捕获旗标(CTF)竞赛是网络安全领域最有效的实战训练形式之一,涵盖密码学、Web 利用、二进制利用等核心技能。近年来,大型语言模型(LLM)已能以极少人工输入解决越来越多类型的题目,这引发了关于竞赛公平性、排名有效性以及参与者是否还能通过参赛获得预期学习收益的紧迫问题。本文采用混合研究方法,系统评估了 LLM 对现代 CTF 的冲击:首先综合了已发表的基准测试(包括一份近期政府评估报告),其次对三类挑战进行了现场竞赛案例研究,再对社区中关于 AI 使用的公开讨论渠道进行结构化观察,最后与资深玩家和组织者进行了半结构化访谈。研究按类别绘制了当前人机能力边界,结果表明密码学、Web 和二进制利用中的简单及中等难度挑战已可被可靠自动化,而某些更细分的子类别仍难以被 LLM 攻克。作者发现,社区内部关于是否应允许 AI 参与的分歧,其根源在于一个未声明的先决问题:竞赛的根本目的是什么。基于此,本文提出了一个由四部分组成的保障框架:分级竞赛组别、抗 LLM 的题目设计、用于调查性目的的遥测手段,以及一份社区行为准则草案,并配套提供一个决策工具,将各类保障措施与竞赛声明目标相关联。该论证不仅适用于 CTF,还推及任何以展示结果作为潜在能力证据的网络安全评估场景,对于重新思考 AI 时代下的能力认证与人才培养模式具有启发意义。适合 CTF 组织者、网络安全教育者、AI 安全研究者和竞赛平台开发者阅读。
💡 推荐理由: LLM 正在重塑 CTF 这一核心安全训练场景,直接影响人才选拔、技能评估和竞赛公正性。本文首次系统提出可操作的公平保障框架,为社区应对 AI 冲击提供了路线图。
🎯 建议动作: 研究跟进,并考虑将保障框架纳入内部 CTF 或安全评估活动设计