#geometric-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

检索增强生成(RAG)通过引入外部文档来提升大语言模型的事实性,但同时也引入了新的安全攻击面:恶意攻击者可以向知识库注入经过精心构造的对抗性文档,这些文档一旦被检索并进入上下文窗口,就可能引导模型输出特定的错误答案。现有的后检索防御手段,例如指令跟随、依赖参数化知识或基于文本一致性的校验,均存在被自适应攻击者模仿或针对优化的风险。本文提出 RAGSentinel——一种无需训练、无需标签的防御方法,适用于黑盒 RAG 系统。RAGSentinel 利用一个代理编码器来度量在给定查询条件下,检索文档所引发的隐藏状态偏移;通过移除共享的主题方向,它将有毒文档视为几何离群点,并基于鲁棒多数共识将其过滤掉。作者从理论上证明了:在诚实多数假设和表示层分离条件下,RAGSentinel 能够精确恢复无毒的多数规模上下文。实验覆盖三个问答数据集、三个大语言模型家族以及多种投毒攻击方式,结果显示 RAGSentinel 始终能够保持较低的攻击成功率,同时不损害正常的回答准确率;即使面对对整体流程完全知情的自适应攻击,该防御仍然有效。本文的核心贡献在于提出了一种可认证的、几何共识驱动的 RAG 防御框架,显著提升了对检索投毒攻击的韧性,且不依赖特定的模型内部结构,具有良好的可迁移性。适合关注大模型安全、检索增强系统防护和对抗机器学习的研究者与安全工程师阅读。

💡 推荐理由: 针对 RAG 的检索投毒是当前 LLM 应用面临的重要威胁之一。RAGSentinel 提供了一种免训练、可认证的后检索防御思路,不依赖模型可解释性,能直接适配黑盒系统,对蓝队提升实际 RAG 管线的抗攻击能力有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)