#cyber-range

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Jakob Nyberg, Sandor Berglund, Andrei Buhaiu, Joakim Loxdal, Pontus Johnson, Mathias Ekstedt

该论文介绍了 MAL Simulator——一个基于 Meta Attack Language(MAL)构建的网络攻防操作仿真器,目标是支撑"决策驱动"的网络攻击与防御仿真,用于系统分析以及自动化代理(agent)的训练与评估。研究背景是:在自动化攻防研究中,尤其是强化学习代理的训练与评测,长期缺少可复用、可跨目标域迁移的仿真环境;已有仿真器往往与特定场景强耦合,更换目标域就需要改动源码,导致实验难以复现和横向比较。核心方法上,作者把仿真器围绕一种攻击建模语言(MAL)来设计:防御方只需编写或复用 MAL 领域模型,即可刻画资产、攻击步骤及其依赖关系,从而在不修改仿真器源码的前提下适配不同目标域;仿真器同时对外提供通用接口,以便与现有机器学习框架对接。实验包含两个案例研究,分别训练防御型代理与攻击型代理。为让实验有据可依,模型所依赖的数据采集自在 CRATE 网络靶场中搭建的仿真网络。主要结果有三点:(1)训练得到的攻击者策略比所对比的搜索方法更高效地抵达既定目标;(2)在带噪声的告警条件下,训练得到的防御者代理产生的成本低于朴素的启发式防御代理;(3)当把强化学习攻击者与强化学习防御者放在一起对抗时,防御方的表现显著下降。作者认为第三点尤为关键:只在静态或弱对手条件下训练的防御代理,面对同样经过训练的自适应攻击者会明显退化,这正说明同时支持攻防两侧代理训练的仿真器不可或缺。MAL Simulator 及配套工具已公开。

💡 推荐理由: 它把攻防图建模与强化学习代理训练打通,可低成本验证检测与响应策略;其"RL 攻击者对 RL 防御者时防御性能显著下降"的结论,直接提示基于静态或弱对手数据训练的自动化防御策略在真实自适应攻击下会失效。

🎯 建议动作: 研究跟进,可将 MAL 建模与仿真框架纳入内部自动化响应策略评估的候选工具集

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jakob Nyberg, Teodor Sommestad, Andrei Buhaiu, Joakim Loxdal, Pontus Johnson, Mathias Ekstedt

该论文来自瑞典皇家理工学院(KTH)相关研究团队,聚焦于「自主网络事件响应智能体」在真实度较高的网络靶场中的能力评估。研究动机在于:尽管自动化入侵响应(如自动封禁、隔离、限速)在学术与工业界被广泛讨论,但缺乏一个既能模拟真实网络拓扑变化、又包含人类用户行为的可重复评测环境,导致不同策略之间难以公平比较。作者构建并复用了原本面向人类操作员培训的网络靶场,其中包含仿真网络环境、可变网络拓扑、红队模拟器以及模拟用户智能体(simulated user agents),从而在防御动作产生可用性代价的前提下评估防御方的收益。防御智能体的目标是在红队智能体无法访问内网主机的同时,尽量降低防御措施带来的业务可用性损失。告警由 SIEM 平台生成,并映射为智能体可消费的数据建模语言,使智能体能够在结构化事件流上进行决策。论文对比了两类策略:一类是人工设计的启发式(heuristic)策略,另一类是通过强化学习(RL)训练得到的策略;RL 策略的优化目标是在一个网络攻击仿真器上最小化「入侵损失+可用性损失」的联合代价函数。实验结果表明:总体而言,强化学习智能体的防御效率优于启发式策略;但性能高度依赖于对手(红队)所采用的策略,并与模拟用户的行为模式存在强耦合,说明在自适应对手和含噪人类行为的环境下,单点最优策略并不稳健。论文的贡献在于提供了一套可复现的靶场评测方法学与对比结果,指出对手建模和用户行为建模是自动响应智能体评估中不可忽略的变量,为后续构建更鲁棒的自动化防御决策系统提供了实证基线。

💡 推荐理由: 自动化/智能体化事件响应正被引入 SOC 流程,但「自动封禁是否真的更划算」长期缺乏含可用性代价与自适应对手的可复现评测。该研究给出的靶场方法学与 RL 优于启发式但并不稳健的结论,提示防御方不能仅凭离线指标上线自动响应策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Simona Boboila, Xavier Cadet, Edward Koh, Daniel Balasubramanian, Dirk Van Bruggen, Peter Chin, Alina Oprea

该论文针对当前网络攻防节奏失衡的现实问题展开研究:攻击行为日益自动化,人类分析师可用于检测、推理与响应的窗口被大幅压缩。大语言模型(LLM)因具备关联异构证据、对未见威胁进行推理的能力,被视为实现自主网络防御的潜在基础,但直接把 LLM 接入真实安全运营遥测并不可行——原始日志的到达速度远超模型处理能力,单条事件往往语义模糊,且不受约束的 LLM 动作会带来显著的运营风险。为此作者提出 BlueSTAR,一种面向企业 IT/OT 网络自主网络防御的分层代理(tiered agentic)架构。其核心设计是先把高吞吐的安全遥测转化为紧凑的入侵指标(IOC),从而在降低数据量的同时保留可用于推理的关键证据,再由分层代理在受约束的条件下完成检测、推理与响应决策。论文还提出一种韧性(resilience)度量,将攻击者可达范围、对关键任务资产的影响以及防御动作本身造成的业务中断三者联合纳入评估,弥补了传统只看是否阻断的评估偏差。实验在两个真实企业 IT/OT 靶场(cyber range)上进行,覆盖七条基于真实入侵技术的攻击链。结果显示:对已知威胁,BlueSTAR 保留了确定性响应的快速遏制能力;对需要上下文推理与跨周期(cross-cycle)推理的攻击,包括凭据窃取、重复失陷、并发攻击者以及针对物理过程的攻击,BlueSTAR 也能成功防御。该工作适合 SOC/蓝队工程师、安全自动化与检测架构设计者、OT 安全团队以及研究 LLM 安全落地的读者阅读。

💡 推荐理由: 它给出了一种可落地的 LLM 自主防御分层架构与评估指标,直指“日志太快、单事件太模糊、LLM 动作太危险”三大工程痛点,并提出把韧性(攻击者可达范围、关键资产影响、防御副作用)作为统一评估维度,对 SOC 自动化与 OT 安全建设有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Michail Takaronis, Athanasia Kollarou, Georgios Kavallieratos, Vasileios Gkioulos, Sokratis Katsikas

本文研究如何利用大型语言模型(LLM)辅助面向服务的网络靶场(SOR)的安全需求获取。网络靶场环境复杂,涉及多方利益相关者和不同安全关切,传统需求获取过程困难且耗时。作者基于SEBoK系统工程指南,首先识别安全使命目标与利益相关者需求,将其与架构指南一起作为提示上下文,输入给五个LLM(GPT-5.2、Gemini 3.1 Pro、Grok 4.1、Sonar和Kimi K2.5)。LLM共生成84条安全需求,经人工整合为27条,并映射到服务导向靶场的各架构层。随后,五位网络安全专家从必要性、清晰性、完整性、可行性和可测试性五个标准进行评估,并允许拒绝某条需求。结果显示,必要性接受率达98.5%,清晰性87.4%,完整性85.2%,可行性78.5%,拒绝率仅0.7%,但可测试性仅为44.4%,表明需求在如何测试方面信息不足。研究表明,LLM能够在早期阶段有效辅助安全需求获取,为设计者和开发者提供有价值的初始基线,但人工审查仍不可或缺,尤其在改进测试细节等特定方面。本文为自动化需求工程提供实证参考,并指出AI与人类协作在安全需求工程中的应用潜力与局限性。

💡 推荐理由: 这项研究展示了LLM在网络安全需求工程中的辅助潜力,可帮助蓝队快速生成候选安全需求。但较低的可测试性得分提醒我们,需结合专业知识完善验证标准,避免引入模糊需求。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.6
Conf: 50%
👥 作者: Hanlin Jiang, Puyi Wang, Jiandong Jin, Shaofei Li, Zhan Shen, Pengli Wang, Ziming Wang, Yifeng Cai, Ning Jia, Yuxin Ren, Peng Jiang, Yao Guo, Ding Li

本文提出的 RangeFactory 是一个面向多跳网络靶场(cyber range)的自动化编排框架,核心目标是解决现有靶场构建无法自动将大量孤立漏洞环境组合为端到端验证的多跳攻击链的问题。现实中的网络攻击通常需要跨越多个主机和网段持续推进,因此多跳靶场对于研究和提升大语言模型(LLM)智能体完成完整攻击链的能力至关重要。早期工作虽然扩展了单漏洞任务规模,并能根据人工指定的漏洞语义构建多主机场景,但无法自动协调日益增多的漏洞环境。RangeFactory 将靶场构建形式化为依赖解析问题:首先从智能体对真实漏洞的实际攻击中提取依赖信息,然后通过模板引导的编排解析已知依赖,最后利用端到端攻击执行来验证组合后出现的运行时依赖。基于 RangeFactory,作者构建了包含 1,148 个已验证靶场实例、覆盖 287 条不同攻击链的基准 RangeBench,并评估了前沿攻击智能体在攻击深度、网络规模和任务信息等维度上的表现。结果显示,在成功突破入口漏洞的运行中,仍有 24.5%-47.0% 的运行无法完成剩余攻击路径,揭示出从初始立足点到完成多跳攻击之间存在显著的持续攻陷差距。此外,RangeFactory 还生成了包含 5,541 条带结果标注的多跳攻击轨迹语料库,为攻击过程分析和未来智能体训练提供了执行数据。该研究适合关注 AI 安全、LLM 智能体评估和网络靶场自动化的安全研究人员阅读。

💡 推荐理由: 该研究首次实现大规模自动编排多跳网络靶场,并量化了LLM智能体在多步攻击中的持续攻陷差距,为安全评估和靶场建设提供了可复用的基础设施与数据资源。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Fengyu Liu, Jiarun Dai, Yihe Fan, Wuyuao Mai, Ziao Li, Bofei Chen, Jie Zhang, Zheng Lou, Bocheng Xiang, Qiyi Zhang, Xudong Pan, Geng Hong, Yuan Zhang, Min Yang

论文提出了AgentCyberRange,第一个开放、多靶场的基础设施,用于在逼真的网络靶场中衡量前沿AI系统的自主网络攻击能力。该基准整合了15个真实Web应用程序中的110个漏洞,以及8个包含156个内部主机的企业级网络靶场,并提供了Cage工具链用于执行、编排、结果收集和验证。基准涵盖两个核心阶段:Web利用阶段(代理探索暴露的应用程序并验证漏洞)和后利用阶段(代理将初始据点转化为内部更广泛的入侵)。研究评估了6个前沿AI系统(如GPT-5.5 with Codex),在匹配的提示和预算下,GPT-5.5 with Codex解决了16.1%的Web利用任务和31.7%的后利用任务;当提供更具体的提示时,这些比率分别提高到33.0%和46.3%。此外,研究还发现了基准之外的发现,包括流行项目中的未知漏洞以及绕过主机防御的载荷变异。结果表明,开放的网络靶场评估对于在逼真且可重复的条件下观察新兴攻击能力是必要的。

💡 推荐理由: 该研究填补了现有AI安全基准缺乏真实、多主机网络靶场评估的空白,为早期发现AI系统的潜在攻击能力提供了可复现的测试平台,对安全防御策略制定具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Kyriakos Christou, Maria Michalopoulou, Stefano Taggi, Matteo Merialdo, Nikolai Stoianov, Vasilis Ieropoulos, Theofanis Eleftheriadis, Philippos Isaia, Eleni Darra, Ilias Koritsas, Antonis Voulgaridis, Giorgos Rizos, Dimitris Kavallieros, Stefanos Vrochidis, Konstantinos Votis, Liliana Medina, Joao Camacho, Tim Gerling, Aimilia-Bantounax, Pavel Varbanov, George Sharkov, Christos Laoudias, Jose Borges, Maria K. Michael

本文介绍了ACTING平台,旨在解决网络防御训练中跨域、多域演习的互操作性问题。论文主要贡献有三:首先,提出了第一代演习描述语言(EDL-FG),这是一种结构化语言,用于形式化描述网络靶场的训练服务和演习场景。EDL-FG能够捕捉模拟ICT/OT环境所需的技术基础设施,以及控制网络事件、注入和参与者交互的场景逻辑,从而支持跨联邦网络靶场的互操作和自动化场景部署。其次,ACTING平台引入了自动化的参与者表现评估和评分机制,通过在参与靶场间协调数据收集和分析,实时评估受训者在演习中的行动。第三,该平台支持结合民用和军事操作情境的多域网络训练场景。ACTING基于H2020 ECHO项目的联邦能力,展示了可互操作的场景描述和自动化评估如何支持可扩展且逼真的网络防御训练。该研究适合网络靶场设计者、安全培训组织者和从事安全演习自动化的研究人员阅读。

💡 推荐理由: 网络防御训练常受限于异构靶场间的孤立,ACTING通过标准化描述与自动化评估,为大规模、多域联合演习提供可行方案,有助于提升蓝队实战训练效率。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
INFO
PAPER 2026-04-27

Dynamic Cyber Ranges

推荐 3.5
Conf: 50%
👥 作者: Víctor Mayoral-Vilches, María Sanz-Gómez, Francesco Balassone, Maite Del Mundo De Torres, George Nicolaou, Samuel Rodriguez Borines, Almerindo Graziano, Paul Zabalegui, Endika Gil-Uriarte

本研究针对LLM驱动的智能体在网络安全领域的评估问题展开。当前基于Jeopardy CTF的基准测试已接近饱和,而静态设计的网络靶场在抵御LLM驱动的攻击者时效果递减。作者通过部署一个LLM驱动的APT智能体在三个不同真实度层级的基础设施(PRO Labs、MHBench、军事级网络靶场)中验证了这一观察。为对抗这一趋势,作者提出动态网络靶场:一种由LLM驱动的防御者智能体增强的网络靶场环境,能够强化基础设施、监控入侵并实时响应。在评估的多个场景中,防御者智能体将攻击者成功率降至0-55%,并在多种配置下实现完全阻止。由于攻击者和防御者智能体共享相同的基础模型能力,动态网络靶场在模型改进时能保持评估头部空间。值得注意的是,一个较小的、专有的本地模型(alias2-mini)在相同未调优提示下,在多个场景中匹配了前沿模型的防御效果,并在一个复杂企业场景中比前沿模型快10倍检测到攻击者,表明保护隐私的本地模型可以作为对抗前沿攻击者的合格防御者。实验还揭示了涌现的智能体行为,包括范围扩展和提示泄露,对AI基准测试完整性和智能体系统设计具有启示意义。

💡 推荐理由: 该研究为LLM驱动的攻击与防御评估提供了动态对抗框架,揭示了静态靶场的局限性,并证明本地小模型可有效防御前沿攻击者,对安全评估体系设计和隐私保护部署有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)