该论文发布了一个针对检索增强生成(RAG)系统中协调性检索投毒攻击的基准测试与失败模式感知评估框架。作者将阅读器输出划分为四个互斥类别(金标准、劫持、弃权、漂移),并引入了实例级别的配对清洁到投毒转换矩阵和强制暴露协议,以隔离阅读器端冲突解决与检索变异的影响。论文提出了一种名为“多态Sybil投毒”的协调攻击类别,其中S个词汇多样的文本段落联合支持攻击者选择的目标,同时规避词汇近似重复过滤器。实验表明,在强制暴露协议下,与单一形态相比,多态变体将劫持成功率从4.0%提升至22.8%,放大了5.7倍。此外,攻击成功率(ASR)单独无法捕获弃权和漂移模式,这些模式占据了47-66%的输出质量,而两个阅读器在ASR几乎相同的情况下,在弃权和漂移上分别有16.5和17.2个百分点的差异。论文发布了冻结基准(3145个问题,2982个保留的Sybil组),官方四路评估器,配对转换工具,以及强制暴露框架,覆盖五个阅读器(7B-120B)、两个检索器和两个交叉验证数据集(TriviaQA, 2Wiki),数据采用CC BY-SA 4.0,软件采用MIT许可证。
💡 推荐理由: 该论文揭示了RAG系统在面对协调性检索投毒时的脆弱性,特别是多态变体能有效绕过现有检测,这对防御者理解并防范此类新型攻击至关重要。
🎯 建议动作: 研究跟进