该论文研究的是视觉-语言检索增强生成 (VLRAG) 系统中的知识投毒问题。VLRAG 通过从外部知识库检索图像与文本证据来增强大型视觉-语言模型 (LVLM) 的回答, 使输出有据可依; 但检索管道同时构成了攻击面: 攻击者只要向知识语料注入少量图文对, 就可能通过被召回的毒化证据影响模型输出。作者指出, 现有知识投毒攻击基本都是“常开式” (always-on) 的, 即只要毒化证据被检索到就会影响生成, 缺乏精确的激活控制, 因此恶意行为难以限制在攻击者预期的输入上, 既降低了隐蔽性, 也降低了有效性 (容易在无关查询上暴露)。为此, 论文提出 ViTeGate, 一种面向 VLRAG 的双触发知识投毒框架: 使用视觉触发器有条件地把毒化证据“推”进检索结果, 再使用文本触发器诱导模型对检索到的证据给出攻击者预设的回答。两者协同实现了检索阶段与生成阶段的联合控制——缺少视觉触发时减少毒化证据的暴露, 缺少文本触发时保持正常回答, 从而降低单触发误激活带来的暴露风险。实验在多组查询数据集、多种检索器与多个 LVLM 上展开, 验证了该设计的有效性: 在 InfoSeek 数据集上攻击成功率最高可达 0.98, 同时干净输入的答案准确率最高保持在 0.93, 说明该攻击在实现高成功率的同时能较好维持正常功能表现。论文属于对抗性机器学习与多模态检索安全方向的学术研究, 适合从事 RAG/多模态系统安全、模型供应链与红队评估的读者阅读。
💡 推荐理由: 多模态 RAG 正快速进入企业知识库、图文问答等生产场景, 而本文证明检索语料投毒可以被条件触发, 传统“常开式”投毒的检测与防护假设可能失效; 安全团队需要重新评估检索层与生成层的联合可信性。
🎯 建议动作: 研究跟进, 并纳入内部多模态 RAG 系统的威胁建模与红队评估