本文对基于大语言模型(LLM)的自动化渗透测试智能体(pentest agent)能力演进做了实测跟踪。作者选取两个都构建于 PentestGPT 之上的系统进行对比:一个是较早期的、采用人在回路(human-in-the-loop)模式的系统,底层使用开放权重模型 Kimi K2.5;另一个是较新的全自主系统,底层使用 Claude Opus 4.8。在三个公开靶机上的测试中,自主系统全部攻克三台目标,其中包括人在回路系统始终未能完成的两台。作者认为更值得注意的反而是旧系统的表现:即使在未能拿下的靶机上,它仍完成了约一半的子任务,而且整套系统只运行在普通的大学 GPU 上、没有云厂商的安全护栏介入。作者坦承,由于模型、控制框架(harness)、自主程度与记忆架构在同一实验中同时发生变化,只能描述趋势而无法做归因解释。随后作者提出下一个关键问题:当任务复杂度继续上升时,什么会成为这类智能体的上限?业界通常的答案是长时程记忆,即在长时间攻击链中丢失先前发现。作者通过给两个系统都加装覆盖度记忆(coverage-memory)层来检验这一假设,结果两者成绩均未提升。在可复盘的旧系统失败运行中,真正的瓶颈看起来是规划与承诺(planning and commitment),而非记忆丢失:智能体已经掌握了通往下一步的证据,却没有把它转化为具体的利用假设。作者据此推测,攻击性能力的进步更多取决于智能体的规划能力,而非记忆容量。最后作者指出,用于追踪该能力的同一套子任务评分体系对防御方同样可用,使其能够在能力爬升阶段就持续度量,而不必等到在真实环境中遭遇。研究视角上,本文属于能力评测与趋势追踪类工作,适合 AI 安全、红队/紫队、SOC 与安全战略规划人员阅读。
💡 推荐理由: 该研究给出了一套可复现的 LLM 渗透智能体能力刻度:全自主智能体已在公开靶机上全部通关,且普通大学 GPU 即可运行开放权重模型、无厂商护栏。更关键的是,作者验证防御方能用同一套子任务评分在能力上升期提前量化风险,而非在实战中被动遭遇。
🎯 建议动作: 研究跟进,并将子任务评分体系纳入内部紫队能力评估与威胁趋势跟踪