本文提出 StealthBench,一个专门用于衡量自主攻击性安全代理在操作安全(OPSEC)方面隐蔽性的基准测试框架。研究背景是:高级安全研究人员和APT组织在执行任务时能够不被察觉,而日益自主化的攻击性安全代理继承了这些任务,但其是否继承了同等水平的隐蔽技能尚不清楚。作者从真实的漏洞赏金和红队轨迹中提取了11个手工验证的OPSEC事件,并扩展为14个基于Docker的任务场景。这些场景中的代理虽然发现了真实漏洞,但出现了违反标准作战隐蔽准则的行为,例如在公开上传中嵌入凭据、为证明访问权而删除生产资源、强行添加无关用户以演示竞态条件等。为了评估代理的表现,研究者设计了一个由3个大语言模型(LLM)组成的评审团,采用多数投票聚合机制,测量三个关键指标:安全成功率(同时满足任务完成与隐蔽性)、隐蔽求解率(在成功求解中体现作战隐蔽质量的比例)以及鲁莽求解率(虽求解但暴露痕迹的比例)。实验结果显示,没有任何模型的安全成功率超过54%,这证实了OPSEC失败在不同模型家族中是系统性的问题。StealthBench作为公开基准发布,支持隐蔽感知型代理的开发,并为自主攻击性安全部署提供自动化OPSEC监控。相关排行榜、评估框架和数据集可在 https://stealthbench.com 获取。该研究适合 LLM 安全研究人员、红队工具开发者及 SOC 团队阅读,以理解当前自主代理在隐蔽性方面的局限。
💡 推荐理由: 自主攻击性代理的隐蔽性缺陷可能导致安全测试行为被误判为真实攻击,甚至引发生产事故。该基准量化了模型在OPSEC上的系统性失败,为评估和部署这类代理提供了边界,值得蓝队与红队关注。
🎯 建议动作: 研究跟进