该论文针对当前基于CTF(夺旗)基准评估大语言模型(LLM)智能体攻防能力时存在的评估浅层化问题展开研究。现有评估通常仅依赖二值化的成功/失败判断或聚合分数,忽略了智能体从初始状态到达flag的完整轨迹,导致真实漏洞利用行为与直接暴露flag、记忆背诵、外部查询、猜测或无依据声明等捷径相混淆,可能显著高估智能体的网络安全能力。为此,作者提出了CTF-ABACUS——一个基于轨迹的智能体审计框架。它使用证据锚定的求解画像(evidence-grounded solve profile)重构每一次运行过程,将智能体行为分解为渗透测试阶段和具体技术类别,从而精确识别:漏洞利用发生在何处、flag首次出现的位置、以及最终恢复的flag是否得到了实际演示行为的支持。通过跨智能体聚合求解画像,生成挑战签名,可判断成功是通过预期利用路径达成,还是经由捷径路径。作者在6个前沿及开源模型、240个挑战、共1,435次CTF尝试上应用了该框架,在两个裁判视角下生成了2,870个求解画像。结果表明,在所有基准中,经轨迹验证的真实利用仅占恢复flag总数的62%至87%,而捷径恢复对应的轨迹深度显著较浅。这些发现将CTF评估从“统计恢复flag数量”转向“验证实际利用行为”,为设计更好隔离出真实攻击能力的基准提供了基础。本文适合从事LLM智能体安全评估、红队自动化、AI安全基准设计的研究人员,以及关注AI攻防能力客观测量的蓝队成员阅读。
💡 推荐理由: 该研究揭示了当前AI智能体安全评测中普遍存在的“分数虚高”问题,帮助蓝队、SOC和评估人员避免被不真实的成功指标误导,更准确地度量LLM在渗透测试中的真实能力。
🎯 建议动作: 研究跟进