推荐 3.5
Conf: 50%
本文提出 ATOBench,一个面向自主渗透测试代理的评估框架,核心目标是让代理在面对欺骗性目标响应时的验证过程变得可观测。研究背景是:自主渗透测试代理依赖目标系统的响应来指导后续动作和生成最终报告,如果目标响应被欺骗(例如植入错误证据),攻击轨迹和验证过程都会被误导。然而,仅看最终报告无法了解代理如何解释冲突证据、如何调整策略、为何决定停止、以及如何将观察转化为漏洞声明。ATOBench 通过在运行时注入注册的响应变换,并将每个变换后的回合与同一环境下的原生回合配对,在首个受影响响应处对齐,然后利用源链接重构追踪后续动作、证据恢复、停止决策和报告支撑。框架定义了三个冻结的观察契约,分别覆盖利用证明(exploit proof)、资源所有权(resource ownership)和可复用工件(reusable artifacts)。作者在 450 个回合上评估了五条模型路线,发现增加的活动量可能掩盖断裂的验证链,而成功的恢复依赖于找到可用证据并在报告中保留这些证据。ATOBench 将欺骗性目标观察转化为可复现的探针,用于研究自主渗透测试中的证据处理机制,从过程层面扩展了对进攻性渗透测试代理的评估,揭示了不可信观察如何影响动作、验证和报告。适合关注 LLM 驱动的安全代理评估、红队自动化以及智能体鲁棒性的研究者阅读。
💡 推荐理由: 自主渗透测试代理正被用于真实安全评估,但对其在证据被欺骗时的内部验证机制缺乏可观测性。ATOBench 提供了首个系统化框架来揭示这种失败模式,对构建可信赖的 AI 安全代理至关重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)