推荐 8.5
Conf: 50%
本文研究基于代理的检索增强生成(RAG)系统在多跳问答中的安全威胁。现有防御主要关注内容投毒(注入虚假事实)和提示注入(嵌入指令)。作者发现第三个攻击面:显著性通道(salience channel),即通过调整事实的位置、强调方式、框架和语义邻近性,可以重定向模型的推理路径,即使所有检索到的信息都是真实的且没有注入指令。作者将这种攻击形式化为显著性诱导(Salience Induction):保持事实真实性但通过编辑改变多跳属性绑定,同时保持检索痕迹语义完整。定义了六类显著性编辑算子,并构建了迭代的提议-验证流水线,满足事实性和隐蔽性约束。还创建了带干扰注释的多跳基准SalientWiki-MH。在五个前沿模型家族(GPT、Claude、Gemini、DeepSeek、Qwen)和三种代理架构(ReAct、Reflexion、tool-calling)上进行评估,在30%编辑预算下,攻击成功率达83.3%;最强的基线防御后仍然有75.7%的攻击成功率。未经目标导向的重写仅通过降低中性任务成功率来减少攻击。本文提出的轻量级输入侧防御——显著性归一化(Salience Normalization),可将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。结果表明,仅依赖真实性和指令过滤是不够的;鲁棒的RAG代理还需要防御显著性-相关性解耦攻击。
💡 推荐理由: 揭示了RAG系统的新攻击面,即通过操纵事实的显著性而非内容本身来误导模型,现有防御措施对此无效,对构建安全可靠的代理系统具有重要警示意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)