该论文研究基于大语言模型(LLM)的搜索代理面临的安全威胁。这类代理在信息检索任务中依赖外部工具返回的网页内容,而这些内容不可信,容易导致提示注入和意图劫持。以往的安全研究主要关注静态网页注入,但现代搜索代理会提出后续查询并对多个来源进行交叉验证,因此单一被污染页面通常会被稀释或剔除。作者指出,传递搜索结果和页面观察结果的通道本身是一个脆弱的安全边界:通过一个受控的中介搜索接口,攻击者不仅能注入单条恶意页面,还能反复调整代理收集证据的方式,并最终影响其最终答案。在受限的工具中介威胁模型下,每次查询仅附加一个攻击者控制的结果,并跨代理执行轨迹协调证据,即可显著提高攻击成功率。为此,作者提出了权威链劫持(Authority-Chain Hijack, ACH)策略,一种专家优化的攻击策略,将孤立的搜索结果和页面内容操纵串联成一条看似来自多个相互印证来源的一致证据链。在完整的 SafeSearch 测试集上,ACH 取得了所有基线中最高的攻击成功率(ASR),整体 ASR 达到 55.9%,MaxN ASR 达到 83.3%。此外,论文还提出轨迹引导的策略进化(Trace-Guided Strategy Evolution, TGSE)方法,能从执行轨迹中自动改进攻击者策略,减少人工重新设计。TGSE 在保留评估中的最强单一设置下,ASR 达到 71.4%,MaxN ASR 达到 95.0%。该工作揭示了搜索代理在长视界执行中的新攻击面,强调了对搜索返回内容进行更严格验证和沙箱化的必要性。
💡 推荐理由: LLM搜索代理正被集成到各类AI助手中,其对搜索结果的过度信任构成了真实的安全隐患。本文展示的跨查询协调攻击可绕过现有单点检测,威胁面从单个网页扩大到整个证据链,防御者必须重新审视搜索通道的信任边界。
🎯 建议动作: 研究跟进并评估自有搜索代理的暴露风险,关注后续防御措施研究