该论文研究检索增强生成(RAG)系统中的知识投毒风险。RAG 通过外部证据为大型语言模型(LLM)的输出提供依据,提升事实性,但同时也把外部知识库变成了攻击面。既有代表性攻击通常需要注入多篇文档,或使用直接断言目标答案的模板化文本,成本和可检测性较高。作者提出 ToxicRAG,一种“每个目标仅需一篇文档”的单次知识投毒攻击,其核心思路是把虚假信息包装成连贯的“知识更新”叙事:文档首先承认此前被广泛接受的答案,然后引入虚构事件使该答案看似已经失效,最后把攻击者选定的答案归因于一组所谓的权威来源,从而让投毒内容在语义上更自然、更像正常的知识演进。ToxicRAG 还包含一个可选的、以答案为中心的自验证循环:当代理语言模型无法复现目标答案时,攻击者据此修订候选文档,直至其更可能诱导受害者模型给出目标答案。实验方面,作者在 Natural Questions、HotpotQA 和 MS-ARCO 三个数据集上各取 100 个目标问题,使用 4 个受害 LLM 和 4 种稠密检索器,共 12 个数据集—模型组合。在论文所报告的采样语料设置下,ToxicRAG 的攻击成功率(ASR)介于 0.61 到 0.91 之间,并且在每一个组合中都达到或超过评估中最强的基线,领先幅度为 0 到 11 个百分点。论文的主要贡献在于:证明叙事形式的单文档投毒在受评估的 RAG 配置下仍具有显著影响力,揭示 RAG 在事实一致性和来源溯源方面的脆弱性,并呼吁进一步研究相关防御机制。适合 RAG 系统研发者、LLM 安全研究者与蓝队威胁建模人员阅读。
💡 推荐理由: 该研究把 RAG 知识投毒成本降到“每个目标一篇文档”,且用叙事化手法规避直接断言带来的可疑特征,对依赖外部知识库的企业问答、客服与搜索类 LLM 应用构成现实威胁;蓝队需要重新评估知识写入通道与检索结果的信任边界。
🎯 建议动作: 研究跟进,并将叙事式单文档知识投毒纳入内部 RAG 安全评估基线