检索增强生成(RAG)通过在生成阶段引入外部知识库,显著提升了大语言模型的时效性与事实性,但也把语料库变成了新的攻击面。已有针对 RAG 的投毒研究基本遵循“单点显式注入”范式:把完整的恶意内容封装在单篇文档中,被检索命中后直接进入提示上下文并影响模型输出。正因如此,近期防御机制(基于困惑度、来源可信度、异常文档识别等过滤手段)能够较有效地识别并削减这类威胁。本文首先通过实验验证:面对“间接逻辑诱导”这一类新威胁,现有缓解机制存在明显盲区。其核心思路是改变攻击范式——不再注入显式恶意载荷,而是把它拆解为一条由多篇“休眠文档”组成的信息链。这些文档单独看平淡无害、语义自洽,逐篇审查时可以顺利通过既有过滤;但当它们被同一查询一次性检索并拼接进上下文后,会共同构成一条完整的逻辑推导路径,诱导模型通过多跳推理自行“推导”出攻击者预设的错误结论,而不是直接读到恶意文本。为提升在黑盒条件下的可落地性,作者提出零阶后缀优化(ZOSO),用来自动生成带权威感的后缀表述,以提高检索命中率与上下文说服力。在三个数据集、三种大语言模型上的实验显示,即便在严格的对抗约束下,该方法的攻击成功率仍超过 80%,并能有效绕过针对传统单文档注入的既有防御。作者由此指出一个耐人寻味的悖论:模型推理能力越强,反而越容易在推理型投毒面前被利用。作为对策,论文最后提出基于文档隔离的防御思路 HODOR,试图解耦文档之间被人为构造出的对抗性逻辑依赖。该工作适合 RAG 系统架构师、LLM 应用安全工程师以及关注 AI 供应链与知识库投毒的研究者阅读。
💡 推荐理由: RAG 已是企业知识问答、客服与 Agent 记忆的主流架构,而当前投毒检测普遍假设“恶意载荷集中在单篇文档”。该研究证明逐篇审查存在系统性盲区,仅靠文档级过滤无法拦住跨文档诱导,需把防线前移到检索编排与文档隔离层。
🎯 建议动作: 研究跟进:将该论文纳入 RAG 安全威胁建模,评估内部检索链路是否具备组合级检测与文档隔离能力,并复核现有投毒过滤策略的覆盖盲区。