#cost-aware-evaluation

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Paul Kassianik, Blaine Nelson, Yaron Singer

本文针对当前安全agent评估仅关注峰值成功率(如漏洞发现、利用开发、渗透测试、CTF完成等),忽略操作实际成本的问题,提出一种成本感知的评估框架。作者指出,在实际安全运营中,每一次推理步骤、工具调用、遥测查询和情报丰富请求都会消耗预算。因此,他们通过成本-成功双维度,在攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战上评估语言模型安全agent。不同于只报告最佳情况成功率,他们在固定成本水平下比较模型,并按推理支出和工具支出分解性能。实验揭示红队与蓝队任务的不同扩展规律:攻击性CTF性能随测试时计算增加而提升,且扩展的开源模型在保持成本竞争力的同时可接近前沿专有系统;而防御性SOC调查则不同,其成功更多依赖于纪律性的工具使用、遥测导航和选择性丰富,而非单纯的推理预算。作者主张安全agent基准应同时衡量经济效率、操作契合度与任务成功率。成本感知、SOC原生的评估能为哪些模型今天实际可用、防御agent仍需改进之处提供更清晰图景。论文附带交互式网站展示结果。

💡 推荐理由: 传统安全agent评估忽视操作成本,导致模型实际部署性价比不明确。该研究首次系统引入成本感知评估,为红蓝队agent选型提供经济性视角,有助于安全团队做出更务实的采购和部署决策。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)