该论文聚焦于大语言模型(LLM)智能体中的“过度安全”问题。Agent guardrails 作为动作执行前的安全检查,有时会拒绝真正授权且合法的操作,这严重阻碍了智能体在实际场景中的部署。作者指出,评估这种过度安全非常困难:在授权与未授权的边界上,动作本身并不能决定安全与否,而是取决于人为定义的授权策略,这使得传统的数据标注方法难以适用,且真实世界中边界案例难以收集和验证。为此,他们提出了 Cautious Bench——首个专门针对过度安全设计的基准测试框架。该框架将每个测试样本及其标签与明确的授权策略共同设计,并通过构建时的逻辑门控自动重新推导每个示例,确保标签是策略的机械推理结果而非人工主观判断,从而为研究者提供了可认证的参考标准。Cautious Bench 包含 756 对可判定的“良性/孪生”样本对,在三种对象名称类型下共构成 2268 个测量对,另有 40 对不可判定样本单独报告。作者对来自五种不同设计的六个 guardrail 进行了测量,发现了一个“名称迷信”效应:当对象名称看起来“吓人”(如包含危险词汇)时,guardrail 会显著更频繁地拒绝授权操作,而仅改变名称文本这一变量即可引发拒绝率差异。这表明当前 guardrail 倾向于依赖表面文本线索而非深度的授权上下文,揭示了其安全判断的表面性和脆弱性。该研究为智能体安全评估提供了新基准,也为改进 guardrail 的鲁棒性指明了方向。
💡 推荐理由: 该研究暴露了LLM智能体护栏的一个系统性缺陷:可能因表面词汇而误拒合法操作,影响可用性甚至被利用。对部署Agent防护的安全团队,理解并测试此类过度拒绝行为是保障系统可靠运行的关键。
🎯 建议动作: 研究跟进并评估自身agent guardrails的过度拒绝行为