#ctf

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Kimberly Milner, Minghao Shao, Nanda Rani, Haoran Xi, Venkata Sai Charan Putrevu, Meet Udeshi, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

该论文针对当前基于CTF(夺旗)基准评估大语言模型(LLM)智能体攻防能力时存在的评估浅层化问题展开研究。现有评估通常仅依赖二值化的成功/失败判断或聚合分数,忽略了智能体从初始状态到达flag的完整轨迹,导致真实漏洞利用行为与直接暴露flag、记忆背诵、外部查询、猜测或无依据声明等捷径相混淆,可能显著高估智能体的网络安全能力。为此,作者提出了CTF-ABACUS——一个基于轨迹的智能体审计框架。它使用证据锚定的求解画像(evidence-grounded solve profile)重构每一次运行过程,将智能体行为分解为渗透测试阶段和具体技术类别,从而精确识别:漏洞利用发生在何处、flag首次出现的位置、以及最终恢复的flag是否得到了实际演示行为的支持。通过跨智能体聚合求解画像,生成挑战签名,可判断成功是通过预期利用路径达成,还是经由捷径路径。作者在6个前沿及开源模型、240个挑战、共1,435次CTF尝试上应用了该框架,在两个裁判视角下生成了2,870个求解画像。结果表明,在所有基准中,经轨迹验证的真实利用仅占恢复flag总数的62%至87%,而捷径恢复对应的轨迹深度显著较浅。这些发现将CTF评估从“统计恢复flag数量”转向“验证实际利用行为”,为设计更好隔离出真实攻击能力的基准提供了基础。本文适合从事LLM智能体安全评估、红队自动化、AI安全基准设计的研究人员,以及关注AI攻防能力客观测量的蓝队成员阅读。

💡 推荐理由: 该研究揭示了当前AI智能体安全评测中普遍存在的“分数虚高”问题,帮助蓝队、SOC和评估人员避免被不真实的成功指标误导,更准确地度量LLM在渗透测试中的真实能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Michael Macaulay, Harmony Bouabid, Guo Gen Ang, Sasha Shaw

捕获旗标(CTF)竞赛是网络安全领域最有效的实战训练形式之一,涵盖密码学、Web 利用、二进制利用等核心技能。近年来,大型语言模型(LLM)已能以极少人工输入解决越来越多类型的题目,这引发了关于竞赛公平性、排名有效性以及参与者是否还能通过参赛获得预期学习收益的紧迫问题。本文采用混合研究方法,系统评估了 LLM 对现代 CTF 的冲击:首先综合了已发表的基准测试(包括一份近期政府评估报告),其次对三类挑战进行了现场竞赛案例研究,再对社区中关于 AI 使用的公开讨论渠道进行结构化观察,最后与资深玩家和组织者进行了半结构化访谈。研究按类别绘制了当前人机能力边界,结果表明密码学、Web 和二进制利用中的简单及中等难度挑战已可被可靠自动化,而某些更细分的子类别仍难以被 LLM 攻克。作者发现,社区内部关于是否应允许 AI 参与的分歧,其根源在于一个未声明的先决问题:竞赛的根本目的是什么。基于此,本文提出了一个由四部分组成的保障框架:分级竞赛组别、抗 LLM 的题目设计、用于调查性目的的遥测手段,以及一份社区行为准则草案,并配套提供一个决策工具,将各类保障措施与竞赛声明目标相关联。该论证不仅适用于 CTF,还推及任何以展示结果作为潜在能力证据的网络安全评估场景,对于重新思考 AI 时代下的能力认证与人才培养模式具有启发意义。适合 CTF 组织者、网络安全教育者、AI 安全研究者和竞赛平台开发者阅读。

💡 推荐理由: LLM 正在重塑 CTF 这一核心安全训练场景,直接影响人才选拔、技能评估和竞赛公正性。本文首次系统提出可操作的公平保障框架,为社区应对 AI 冲击提供了路线图。

🎯 建议动作: 研究跟进,并考虑将保障框架纳入内部 CTF 或安全评估活动设计

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Rundong Wei, Xiaomei Tian, Xiaoqi Li

本文提出一个面向CTF竞赛的DSA签名分析与可视化平台,旨在帮助初学者理解DSA算法及其相关的nonce漏洞攻击。DSA基于数论、模运算和大整数计算,传统工具仅展示输入输出,使得签名、验证和密钥恢复攻击的中间过程不透明。该平台提供三大功能:基本签名生成与验证、常见CTF攻击方法的复现、以及攻击工作流的动态可视化。平台覆盖三种典型的nonce漏洞:nonce重用、线性nonce泄漏、以及基于隐藏数问题(HNP)的格攻击。通过逐步展示和高亮中间值,底层计算变得可直接检查。实验表明,平台正确复现了标准DSA工作流程及所有三种攻击场景。该工作的核心贡献在于通过交互式可视化降低了DSA及其攻击的学习门槛,适合CTF参赛者和密码学学习者使用。

💡 推荐理由: 非对称密码算法(如DSA)的nonce漏洞在现实攻击中至关重要,但教学难度高。该平台通过可视化填补了理论与实操之间的鸿沟,有助于培养安全从业者对nonce相关漏洞的直觉。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jörg Schneider, Sebastian Neef, Sebastian Koch

这篇论文以海报形式回顾了CTF(Capture The Flag)安全竞赛在过去20年间的演变,并总结了作者所在学术团队ENOFLAG的运营经验。CTF自DIMVA 2006的现场竞赛CIPHER II开始,至今已成为网络安全学习的主流方式。作者作为ENOFLAG创始成员,基于长期参与和组织CTF的实践,分析了竞赛形式、题目类型、技术栈和参与者群体的变化趋势。论文重点讨论了CTF在教育价值、团队协作、技能培养方面的长期影响,以及学术团队在维持活跃度、平衡研究与竞赛之间面临的挑战。作者还分享了组织内部培训、知识传承和激励新人的具体策略。该研究为安全社区提供了宝贵的质性经验,尤其对高校和CTF组织者有直接参考意义。

💡 推荐理由: CTF是安全人才培养的重要途径,本文基于20年一手经验总结,为团队建设、竞赛设计和长期运营提供经过验证的洞见。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker

本文提出 unix-ctf,一个面向 shell 智能体的 CTF 任务生成器,旨在专门训练和评估 Unix 能力(即使用 shell 和操作系统原语作为一等工具的能力),以解决现有终端基准(如 Terminal-Bench 2.0)中智能体过度依赖通用编程语言(如 Python)而忽视 Unix 特性的问题。每个任务在一个干净的 Linux 容器中基于单一 Unix 特性隐藏一个短令牌(形如 flag(a3b1c9...)),智能体必须通过 shell 命令恢复它。任务生成采用 LLM 辅助的合成管道:LLM 提出隐藏技术,并将其转换为参数化的隐藏-查找脚本对,通过双向合约过滤——隐藏脚本不得在磁盘上留下 flag 明文痕迹,查找脚本必须能在新目录中恢复 flag。由于 LLM 仅负责种植和恢复步骤,而容器布局、评分框架固定,该管道在 750 次原始尝试中成功生成 656 个可移植变体(成功率 87.5%),而对照的端到端容器生成方法仅成功 17.4%。656 个变体经规范化后得到 155 种不同的隐藏技术。使用 GRPO 对 Qwen3-8B 进行 LoRA 微调,基于该表面训练的模型在 15 技能多族保留集(n=225)上将求解率从 11.6% 提升至 43.6%,在 InterCode-CTF 上达到 32/100,其中取证技能提升 33 个百分点。结果表明 Unix 能力是可分离、可训练的,并且最好直接评估而非混入编程能力。

💡 推荐理由: 该研究为评估和增强 LLM agent 的 Unix 操作技能提供了可复现基准与训练方法。安全从业者可利用该基准测试 agent 在真实环境中的命令执行能力,或将其作为自动渗透测试与系统管理任务的基础训练平台。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)