该论文提出了一种针对大型视觉语言模型(LVLM)的新型越狱攻击方法,名为信息过载(Information Overloading)。LVLM 在个人助理、文档分析、具身智能等场景广泛应用,但其双模态攻击面(视觉和文本)易受越狱攻击。现有攻击方法通常采用简单设计,如短文本和分布外图像,但随着大语言模型骨架和多模态机制的进步,这些攻击的可迁移性显著下降。为克服此限制,作者提出同时利用扩展文本和多维图像攻击的信息过载方法。具体而言,该方法通过递归式图像-排版布局,将文本和图像攻击组件组合,指数级增加多模态信息复杂度。这种过载方式放大了所需的跨模态处理,从而破坏 LVLM 的安全对齐。在开源和商业 LVLM 上的大量实验表明,该方法达到了最先进的越狱攻击效果:开源模型平均攻击成功率(ASR)为 88.6%,商业 LVLM 平均 ASR 为 84.0%,超过最佳基线 48.7%。此外,在开源替代模型上优化的提示能够有效跨模型族迁移。实验还通过探测受害 LVLM 中安全关键信息流,发现复杂的图像-排版组合会引发强化的跨模态处理,并降低模型生成拒绝响应的确定性。这些发现凸显了信息过载作为实际且新兴的安全风险,需要针对复杂多模态越狱输入加强防御。
💡 推荐理由: 该攻击揭示了当前LVLM安全对齐在复杂多模态输入下的脆弱性,信息过载可绕过大多数现有防御,对实际部署的视觉语言模型构成严重威胁,值得安全从业者高度关注。
🎯 建议动作: 关注该攻击模式,评估内部LVLM模型的安全性,研究针对复杂多模态越狱输入的防御策略。