视觉-语言预训练模型(VLPMs)已被证实容易受到对抗性攻击。现有的可迁移攻击通常采用复杂的损失函数或多阶段文本/图像攻击流程,但本文发现这些复杂设计反而存在三个先前被忽视的问题:不恰当的跨模态交互和冗余操作导致攻击效果受限。为解决这些问题,作者提出简单视觉-语言攻击(SimVLA)流程,通过简化跨模态交互(如跨模态单词识别)并去除不必要的复杂损失函数和多阶段设计,显著提升了攻击的可迁移性和效率。在四个数据集和三个下游任务(如图像-文本检索)上的实验表明,SimVLA在Flickr30k数据集上的R@1可迁移性超越当前最优基线8.01%-14.71%,同时仅消耗约35.73%的时间和46.26%的最大显存。该工作强调领域知识(如跨模态单词识别)的重要性,而盲目追求复杂操作反而有害。代码已开源。本研究面向视觉-语言安全领域的研究人员和防御者,揭示了当前攻击流程中过度复杂化的弊端,并提供了一个简单且高效的攻击基线。
💡 推荐理由: 该研究揭示了一种更高效、更实用的视觉-语言对抗攻击方法,可替代现有复杂流程,可能降低攻击门槛。蓝队需关注其攻击向量,以改进视觉-语言模型的防御策略。
🎯 建议动作: 研究跟进