#tool-selection

共收录 2 条相关安全情报。

← 返回所有主题
推荐 11.6
Conf: 50%
👥 作者: Jiawen Shi, Zenghui Yuan, Guiyao Tie, Pan Zhou 0001, Neil Zhenqiang Gong, Lichao Sun 0001

本文研究了大语言模型(LLM)智能体中工具选择环节的安全漏洞。在典型的 LLM 智能体架构中,工具选择通常采用“检索-选择”两步流程:先从工具库中检索候选工具,再根据任务选择最合适的工具。作者提出一种名为 ToolHijacker 的新型提示注入攻击,针对无黑盒(no-box)场景下的工具选择过程。攻击者通过向工具库注入一个恶意构造的工具文档,操纵 LLM 智能体的工具选择逻辑,迫使它在面对特定目标任务时持续选择攻击者预设的恶意工具。具体而言,作者将恶意工具文档的构造形式化为一个优化问题,并提出一种两阶段优化策略来求解。实验评估表明,ToolHijacker 在工具选择攻击中具有很高的有效性,显著优于现有的手工构造和自动提示注入攻击方法。同时,作者探讨了多种防御手段,包括基于预防的防御(StruQ、SecAlign)和基于检测的防御(已知答案检测、DataSentinel、困惑度检测、滑动窗口困惑度检测),实验结果显示这些现有防御均不足以抵御 ToolHijacker,凸显了开发新型防御策略的紧迫性。该研究主要面向 LLM 安全研究者和智能体系统开发者,揭示了工具选择环节被忽视的攻击面,并为后续防御设计提供了基准。

💡 推荐理由: LLM 智能体依赖工具选择完成任务,ToolHijacker 可劫持该过程,导致恶意工具被优先调用,可能引发数据泄露或非预期操作。现有防御全部失效,亟需关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shiyang Chen

该论文研究了大型语言模型(LLM)智能体在工具选择过程中的失败机制。通常认为,模型在工具集中未能注意到正确工具是导致错误选择的原因,但论文通过注意力片段分析提出了相反的观点:模型在80%的情况下正确关注到了正确的工具,但依然做出了错误选择。作者通过三种实验验证了这一结论:1)输入侧修复(如重新排序或复制正确工具)仅能恢复不超过23%的失败,而读出侧干预可恢复59-91%;2)两种不同表征的读出侧干预(注意力对数偏置和残差流引导向量)在恢复失败任务上高度一致(Jaccard系数0.865),表明瓶颈位于读出阶段;3)提出一种无需训练、无真实标签的选择器,基于每个候选工具的注意力片段,在BFCL和Seal-Tools基准上分别提升+11.9和+14.9个百分点的函数选择准确率。实验覆盖了3B-32B参数的多个模型,证明了注意力-选择分离现象的普遍性。该工作揭示了智能体工具调用中的关键认知瓶颈,并提供了可部署的改进方案。

💡 推荐理由: 该研究直接挑战了LLM智能体工具选择失败的常见解释,揭示了注意力与决策之间的分离现象,为开发更可靠的工具调用机制提供了理论基础。安全工程师可据此改进智能体行为监控与失败分析。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)