该论文研究了大型语言模型(LLM)智能体在工具选择过程中的失败机制。通常认为,模型在工具集中未能注意到正确工具是导致错误选择的原因,但论文通过注意力片段分析提出了相反的观点:模型在80%的情况下正确关注到了正确的工具,但依然做出了错误选择。作者通过三种实验验证了这一结论:1)输入侧修复(如重新排序或复制正确工具)仅能恢复不超过23%的失败,而读出侧干预可恢复59-91%;2)两种不同表征的读出侧干预(注意力对数偏置和残差流引导向量)在恢复失败任务上高度一致(Jaccard系数0.865),表明瓶颈位于读出阶段;3)提出一种无需训练、无真实标签的选择器,基于每个候选工具的注意力片段,在BFCL和Seal-Tools基准上分别提升+11.9和+14.9个百分点的函数选择准确率。实验覆盖了3B-32B参数的多个模型,证明了注意力-选择分离现象的普遍性。该工作揭示了智能体工具调用中的关键认知瓶颈,并提供了可部署的改进方案。
💡 推荐理由: 该研究直接挑战了LLM智能体工具选择失败的常见解释,揭示了注意力与决策之间的分离现象,为开发更可靠的工具调用机制提供了理论基础。安全工程师可据此改进智能体行为监控与失败分析。
🎯 建议动作: 研究跟进