本文提出了一种名为元自适应多模态越狱(Meta-Adaptive Multimodal Jailbreaking, MAMJ)的新型攻击方法,用于系统性评估大型视觉语言模型(VLM)的安全性。现有越狱攻击在元层面大多是静态的:基于模板的方法固定了图像与文本的布局,而迭代方法虽然能调整图像与文本内容,但攻击策略和攻击者参数保持不变。MAMJ 突破了这一局限,将攻击者本身作为优化目标,同时优化两个维度:攻击策略提示(ASP)θ 用于指导攻击迭代过程,以及攻击者权重 φ 用于决定攻击的有效性。该方法通过多组攻击轨迹,先利用基于 LLM 的评判器精炼 θ,再以分组聚合的攻击成功率(ASR)作为奖励信号更新 φ,从而实现攻击者自身的自适应进化。在 MM-SafetyBench 基准上,MAMJ 对 GPT-4o、Gemini-3-Pro-Preview 和 Seed 2.0 分别达到了 81.0%、78.9% 和 82.3% 的攻击成功率,比最强的样本级基线高出最多 24.1 个百分点。此外,学习到的攻击者配置(θ*, φ*)不需要重新训练即可迁移到未见过的受害模型,且在代表性防御机制下仍能保持有效性。这些结果揭示了前沿 VLM 在元自适应越狱面前存在系统性漏洞,提示防御者需要针对元级对手设计更加鲁棒的防护策略。本文适合 AI 安全研究者、红队工程师以及关注大模型安全的蓝队人员阅读,以理解多模态攻击的最新演进方向并评估自身系统的风险。
💡 推荐理由: 该研究暴露了视觉语言模型在元层面的越狱脆弱性,攻击者不仅能调整攻击内容,还能自我优化攻击策略和参数,导致高成功率且可迁移至未见模型。对依赖 VLM 的安全产品和服务构成真实威胁,需引起蓝队关注。
🎯 建议动作: 研究跟进