本文研究了大语言模型(LLM)智能体中工具选择环节的安全漏洞。在典型的 LLM 智能体架构中,工具选择通常采用“检索-选择”两步流程:先从工具库中检索候选工具,再根据任务选择最合适的工具。作者提出一种名为 ToolHijacker 的新型提示注入攻击,针对无黑盒(no-box)场景下的工具选择过程。攻击者通过向工具库注入一个恶意构造的工具文档,操纵 LLM 智能体的工具选择逻辑,迫使它在面对特定目标任务时持续选择攻击者预设的恶意工具。具体而言,作者将恶意工具文档的构造形式化为一个优化问题,并提出一种两阶段优化策略来求解。实验评估表明,ToolHijacker 在工具选择攻击中具有很高的有效性,显著优于现有的手工构造和自动提示注入攻击方法。同时,作者探讨了多种防御手段,包括基于预防的防御(StruQ、SecAlign)和基于检测的防御(已知答案检测、DataSentinel、困惑度检测、滑动窗口困惑度检测),实验结果显示这些现有防御均不足以抵御 ToolHijacker,凸显了开发新型防御策略的紧迫性。该研究主要面向 LLM 安全研究者和智能体系统开发者,揭示了工具选择环节被忽视的攻击面,并为后续防御设计提供了基准。
💡 推荐理由: LLM 智能体依赖工具选择完成任务,ToolHijacker 可劫持该过程,导致恶意工具被优先调用,可能引发数据泄露或非预期操作。现有防御全部失效,亟需关注。
🎯 建议动作: 研究跟进