#counterfactual-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Guo Fuzheng

该论文研究的是检索增强生成(RAG)中被长期忽视的“引用通道”安全问题。RAG 会先检索外部知识,再基于检索结果生成答案,并为每一条答案附上来源引用;这些引用构成用户的审计线索——读者可以据此核对结论,而无需盲信模型本身。以往 RAG 安全研究几乎都聚焦于“攻击者能否污染答案内容”,而对引用这一可验证性根基缺乏分析。作者指出引用通道是一个全新且切实可用的攻击面,并提出 CiteShade:据称是首个面向 RAG 的“引用洗白(citation laundering)”攻击。在该攻击中,攻击者只需控制多源检索中的一个来源,即可诱导模型输出攻击者选定的错误答案,并把该错误答案归因到一个“可信但实际并不支持该结论”的来源上;与此同时,支持正确答案的证据仍然留在上下文中,因此传统上依赖“上下文是否被污染”的判断方式无法察觉异常。作者将攻击形式化为一个优化问题,推导出攻击成立所需的三个必要条件(检索条件、生成条件与引用条件),并说明可以在不插入任何指令(即无需显式提示注入)的情况下构造出满足条件的来源文档。实验显示:在多源多跳问答任务上,该攻击把错误答案率从 0.01 提升到 0.68;来源删除实验进一步确认,在全部被测案例中恶意来源都是造成错误输出的因果驱动因素。论文还发现,模型对该攻击的脆弱性取决于其“引用倾向”而非模型规模:在最倾向引用来源的模型上,显式指令条件下攻击成功率(CLR)达 0.84,完全不给指令时仍有 0.64。防御方面,作者证明困惑度过滤与引用支撑性检查各自都不充分,并提出一种反事实防御方法,通过消融/替换来源来判断究竟是哪一个来源真正驱动了最终答案。

💡 推荐理由: 引用是 RAG 的审计与信任根基。该研究表明,攻击者无需污染最终上下文即可让模型把错误答案“洗白”为可信来源的结论,使基于引用的合规审计与人工复核同时失效,且攻击与模型规模无关,只与引用倾向相关。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)