该论文针对视觉语言模型(VLM)的安全防御问题,指出现有安全分类器(guard)作为主要黑盒防御手段,仅审查输入的表面形式而忽略其语义,导致恶意请求可以通过集合论、形式逻辑、罕见语言、代码或文本图像等编码方式绕过guard,形成“解码差距”。为了弥补这一缺口,作者提出了一个guard无关的“恢复-解码-重新守护”(Recover, Decode, Reguard)放大模块,在guard之前将图像内容转录并将编码文本还原为明文请求,使任何现成的分类器都能筛查真实意图。评估采用最严苛的攻击者假设:一个由十一种攻击组成的集合,只要任一攻击成功即判定为行为被击破(best-of-suite,遵循AutoAttack),这在越狱防御研究很少被报告。实验覆盖五个guard与两个目标VLM,结果显示:无防御时集合攻击可突破89-91%的行为;即使加上放大模块,最佳guard仍留下63-65%的失败率,且相对于单独使用guard,仅在十个guard-目标组合中有四个显著增益。进一步添加模块化的重新守护层可弥补大部分残余风险,但会使校准良好的guard对良性输入的过度拒绝率升至81-92%;而唯一保持可用性的宽松guard又无法达到部署级安全性(集合攻击成功率48%)。总之,在所研究的流水线以及针对表示转换攻击(即编码和跨模态渲染,留下可读载荷,而非像素或嵌入级攻击)下,没有任何配置能同时实现低攻击成功率和低过度拒绝。论文贡献包括:提出该放大模块、采用集合评估使安全-效用权衡可见,并绘制了基于恢复的VLM防御的有效区域与失效边界。
💡 推荐理由: 该研究揭示了当前VLM安全防御在编码攻击下的根本性缺陷,证明仅靠分类器表面检查无法保证安全,并给出可复现的集合评估方法,帮助蓝队理解安全与可用性的权衡。
🎯 建议动作: 研究跟进