本文研究编码代理(coding agents)在受企业安全策略约束环境下的性能表现。现实场景中,编码代理通常运行在具有受限凭据、限制出站流量、只读文件系统和非 root 执行等安全控制的组织中,但现有基准测试(如 Terminal-Bench)几乎都在宽松沙箱中进行,因此策略强制对代理性能的影响尚不明确。作者从常见企业限制中提取了嵌套安全策略级别,并基于 Terminal-Bench 2.1 对 12 个编码代理进行了系统评估。结果表明,安全加固并非毫无代价,但影响程度并不均匀:在最高策略强度下,成功率下降最多达 18.3 个百分点,成本(如 token 消耗或时间)膨胀最多 167.3%,且这两个指标并不总是一致;例如,某个模型在保持成功率方面表现最好,却在效率上损失最大,说明模型选择取决于具体策略配置。进一步分析揭示,策略阻塞行为时,代理通常会陷入超时或生成错误解决方案,而非提前终止,且失败模式的混合因模型而异。为排除策略本身导致任务不可解的因素,作者验证了在最高策略强度下任务的可解决性,将模型自身失败与策略禁止的任务区分开来。最后,作者开源了 Boundary-Bench,这是一个可插入的硬化插件,能够对 Terminal-Bench 及兼容基准上的编码代理进行策略约束评估。该工作为在真实企业安全环境中部署编码代理提供了重要实验依据和评估工具。
💡 推荐理由: 安全从业者需要了解 AI 编码代理在实际受控环境中的真实表现,本文首次系统量化安全策略对编码代理成功率与效率的影响,并为策略配置与模型选型提供实证数据。
🎯 建议动作: 研究跟进