本文提出 DE-FIVE,一种无需重新训练的全新框架,用于检测针对视觉语言模型(VLM)的恶意图像提示。VLM 结合视觉和文本模态,但视觉模态的引入扩大了攻击面,例如对抗扰动和间接提示注入攻击,这些攻击通过精心构造的恶意图像提示诱导模型产生意外输出。现有防御方法通常需要大量数据集重新训练或部署额外复杂分类器,且缺乏专门针对间接提示注入的防御机制。DE-FIVE 利用傅里叶域特征和视觉编码器的隐藏状态表示(图像向量嵌入)实现混合检测策略:黑盒检测器基于傅里叶域特征,白盒检测器利用少量恶意样本导出的图像向量嵌入。实验结果表明,DE-FIVE 在检测恶意图像提示方面持续优于现有最先进基线。主要贡献包括:提出一种无训练、高效的检测框架;融合傅里叶特征和嵌入特征;设计黑盒和白盒双检测器;在标准数据集上验证有效性。本文适合从事 VLM 安全、对抗攻击防御和提示注入检测的研究人员阅读。
💡 推荐理由: 恶意图像提示攻击对 VLMs 构成严重威胁,现有防御不足。DE-FIVE 提供无需训练、高效的检测方案,填补了间接提示注入防御的空白。
🎯 建议动作: 研究跟进,评估框架在自身VLM环境中的适用性