#drl-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

该论文提出并实现了一个名为 Trident 的智能体化 LLM 红队框架,用于评估和攻破基于深度强化学习(DRL)的自主网络防御系统。研究背景在于:现有的 DRL 防御评估几乎完全依赖静态或启发式红队智能体,缺乏对自适应威胁的鲁棒性检验;同时,基于可验证奖励的强化学习(RLVR)虽然提升了 LLM 的推理能力,但因缺少合适的网络攻防基准环境和交互数据集,尚未在网络安全领域得到有效应用。为弥合这一鸿沟,Trident 框架由三部分组成:一是动态基准环境,包含隔离的沙箱服务器,覆盖 CybORG CAGE 4 和 CyberWheel 两类场景;二是包含超过 13,000 条高保真红蓝对抗交互轨迹的数据集,用于 RLVR 训练;三是名为“Code-as-Policy”的 RLVR 智能体架构(Trident Agentic),该架构将红队智能体训练问题形式化为上下文赌博机,采用“日志摘要器—规划器—编码器”三部分设计,其中可训练的规划器根据压缩的执行日志生成完整攻击策略,而冻结的编码器将这些策略转化为可执行的 Python 代码,并部署到真实 DRL 防御者环境中进行攻击。实验结果表明,现有 DRL 防御存在根本性的脆弱性:仅用一个可训练的 7B 规模规划器,Trident 相比静态红队基线,平均使蓝队防御性能下降 522%,并且能够自主发现静态启发式完全无法揭示的涌现行为,如诱饵规避和自适应状态优先级选择。该研究首次将 LLM 驱动的智能体红队方法与 RLVR 结合,揭示了 DRL 防御在自适应智能攻击面前的严重不足,为后续安全研究提供了新的评估范式和高保真数据资源。适合安全研究人员、LLM 安全工程师以及强化学习防御系统的开发者阅读。

💡 推荐理由: 该工作利用 LLM 作为可学习红队,首次系统性地证明了现有 DRL 防御在自适应攻击下的脆弱性,为蓝队评估自身防御系统提供了新视角和高保真数据集,尤其适用于基于 LLM 的智能体安全研究。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)