该论文研究了使用工具的LLM智能体在策略许可环境中可能出现的静默策略违反失败模式。当工具执行任何格式正确的调用时,即使对应的状态转换被领域策略禁止,工具本身和智能体的自我报告都不会暴露错误,导致静默的错误状态(如预订取消、乘客数量更改、未经核实处理索赔等)。作者在τ²-bench航空公司领域进行了实验,发现预算智能体中78%的失败是静默错误状态失败,且聚合失败率在不同随机种子间可复现。为此,他们提出了一种轻量级干预措施:在写入操作前添加确定性的只读预执行门控,检查提议的调用和当前状态。四个门控组成的套件将完整基准测试成功率从29.6%提升至42.0%(GPT-4o-mini,+12.4个百分点,P=0.0012),并在15个独立种子集上复现(+12.3个百分点,P=0.0008)。效果集中在门控触发的26/50个任务上(成功率提升+19.2个百分点),而未触发门控的24个任务变化不显著。两个负对照(自执行零售领域和BFCL)表明,门控在工具策略许可时有效,在工具已自执行时几乎没有帮助。作为提示性证据(非核心主张),同样的失败模式存在于前沿模型(GPT-5.2默认推理仍然尝试违反策略的写入,相同门控套件将成功率从61.2%提升至71.6%,+10.4个百分点,P=0.020,n=5,未复现)。论文的贡献是限定的评估和可靠性结果:确定性门控不能保证任务成功,但可以在动作边界确定性地防止一类已知的静默策略违反写入。适合对LLM智能体安全、策略执行和可靠AI感兴趣的读者。
💡 推荐理由: 揭示了LLM工具使用中一种难以察觉的静默策略违反失败模式,并提出了一种简单、轻量、可解释的确定性防御机制,对构建安全可靠的LLM智能体系统具有直接参考价值。
🎯 建议动作: 研究跟进