#tool-hallucination

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Laxmipriya Ganesh Iyer

这篇论文聚焦工具增强型 LLM 智能体(tool-augmented LLM agent)中一个被现有方法系统性忽略的失效模式:智能体调用根本不存在的工具,或向工具传入其 schema 从未声明的参数。作者指出,现有防御分为两类——一是工具选择(帮助模型挑对工具),二是工具门控(约束智能体对真实工具能做什么),但二者都隐含一个前提:模型发出的调用至少指向一个真实工具。对于凭空捏造的工具名,门控根本没有做出过任何决策,因此从结构上就不可能拒绝它,这构成一个结构性盲区。论文定位为测量与基准研究,主要贡献有四:第一,给出工具幻觉的五类分类法 H1–H5,覆盖伪造工具、借用参数等不同形态;第二,提出 Resolution Rung 作为参照基线,这是一个免训练、封闭世界的解析器,只做注册表成员校验与签名检查,作者强调其价值不在计算逻辑本身,而在于它必须被放置在调用链的哪个位置——并证明幻觉防御必须前置于任何因果门控,同时刻画了唯一的不可约残留:借用合法工具的参数若恰好符合 schema,则在结构上与合法调用无法区分;第三,开展大规模测量,在十个托管模型、两种调用界面下共采集到 322 次真实幻觉,发现伪造工具调用高度集中在不受约束的 raw-JSON 界面上(34 次 vs 3 次),且模型规模并不能缓解该问题——一个 675B 模型与 7–8B 模型表现相当;第四,将问题扩展到 Model Context Protocol,指出把多个服务器合并进单一命名空间会制造单个注册表无法表达的幻觉面,提出第二套分类 M1–M5,并在真实 MCP 界面上测得 154 次幻觉,其中包含在单注册表界面上表现干净的前沿模型,原因是名称碰撞与遮蔽是合并操作的结构性产物。作者同时发布带版本的 Hallucinated-Tools Benchmark(HTB),使不同解析器方案可在统一基准上横向比较。适合智能体框架开发者、LLM 应用安全工程师与 AI 安全研究者阅读。

💡 推荐理由: 工具幻觉是智能体安全的结构性盲区:门控类防御预设调用指向真实工具,因而无法处理凭空捏造的工具名。论文证明该问题普遍存在、与模型规模无关,并在 MCP 多服务器合并场景中进一步放大,为部署前置解析层提供了量化依据。

🎯 建议动作: 研究跟进:评估在自研智能体网关中前置封闭世界解析层,并跟踪 HTB 基准以横向对比解析器方案。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)