#deep-reinforcement-learning

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

该论文研究数字孪生(DT)系统中的隐蔽性磨损攻击。数字孪生作为工业4.0的关键技术,通过实时监控、仿真和精准控制物理资产,实现了数据驱动决策和运营优化。然而,这种物理与虚拟域的无缝交互极大地扩展了攻击面。论文提出一种基于深度强化学习(DRL)的新型隐蔽磨损攻击方法,攻击者通过策略性地隐蔽操纵控制信号,诱导目标关节产生额外扭矩,加速其磨损,同时逃避最先进的异常检测系统的监测。作者对多种强化学习算法(包括TD3、SAC、PPO和A2C)进行了基准测试,发现SAC在样本效率、稳定性和攻击有效性方面表现最佳。在UR10e工业机器人臂上进行的实验表明,该攻击能够显著提高目标关节的扭矩水平,导致加速退化和维护成本增加,且全程保持隐蔽。研究结果凸显了DRL驱动的攻击对数字孪生环境的严重威胁,强调了开发鲁棒防御机制以保护关键工业系统的紧迫性。

💡 推荐理由: 揭示了数字孪生系统面临的新型AI驱动物理攻击风险,对工业控制安全具有警示意义,促使防御者关注隐蔽性磨损攻击的检测与防护。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jannatul Ferdous, Rafiqul Islam, Md Zahidul Islam

该论文提出了一种面向勒索软件检测的安全感知深度强化学习(SA-DRL)框架,核心创新在于将误报(False Positive)和漏报(False Negative)的成本不对称性嵌入到强化学习的奖励信号中。传统机器学习检测器通常使用对称目标函数,对漏报和误报给予同等惩罚,但实际中漏报可能导致不可逆的加密、业务中断和高昂恢复成本,而误报通常可逆。SA-DRL通过设计非对称奖励函数(R2)优先减少漏报,同时引入安全最优模型选择(SOMS)准则和自适应样本排序机制。在平衡的勒索软件检测数据集上,对DQN、DDQN、PPO和A2C四种深度强化学习智能体进行了评估,使用对称基线奖励(R1)和安全感知非对称奖励(R2),采用四个折扣因子、五折交叉验证和三个随机种子,共进行480次训练。SOMS准则以漏报率优先,结合F1分数和训练时间选择模型。结果表明,非对称奖励塑造显著提升了安全导向的检测性能。SOMS选出的最佳配置(DDQN + R2 + gamma=0.1)实现了漏报率0.0080,F1分数0.9915,AUC 0.998,相比最佳监督基线减少漏报67.6%。在所有配置中,R2使平均漏报率相比R1降低43%。该研究强调了奖励函数设计对安全敏感型勒索软件检测的重要性,为将领域先验知识融入强化学习框架提供了有效范式。适合安全研究人员、机器学习和入侵检测从业者阅读。

💡 推荐理由: 勒索软件检测中漏报代价远高于误报,但传统方法常忽视该不对称性。本文提出的非对称强化学习框架能显著降低漏报率,对提升实战检测效果具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jannatul Ferdous, Rafiqul Islam, Md Zahidul Islam

本文提出了一种可审计的勒索软件检测与遗忘框架,旨在解决现有机器学习检测器不支持选择性样本移除的问题,以满足GDPR和CCPA等隐私法规要求。该框架将深度强化学习与多分片SISA(分片隔离状态聚合)重训练相结合:核心检测器采用双深度Q网络(DDQN),从行为特征中学习奖励引导的检测策略,并考虑不对称的安全成本;而多分片SISA则通过分片级重训练实现隐私合规的选择性样本移除,并支持审计验证。在包含2000个样本和103个特征的平衡Windows 11行为数据集上,基线DDQN检测器取得了0.9925的F1分数和0.9983的AUC。实验评估了四种指标:效用保持、基于oracle的遗忘验证、成员推断审计和计算效率。结果表明,单分片遗忘仅引起极小的效用下降且oracle分歧较低,而中等分片数量(M=5-10)提供了最佳的效率-性能权衡,将重训练时间从完全重训练的80-330秒降低至5-30秒。此外,大多数配置下成员推断分数接近0.5,表明遗忘后隐私泄露风险有限。这些发现证明,一个隐私合规的勒索软件检测框架可以同时实现高检测性能、可审计的删除验证和高效的样本移除。

💡 推荐理由: 该研究首次将机器遗忘引入勒索软件检测领域,在保持高检测性能的同时支持按需删除用户数据,为满足隐私法规提供了可审计的解决方案,对安全运营中的隐私合规实践具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Raihan Uddin, Fatemeh Lotfi, Tolunay Seyfi, Fatemeh Afghah

开放无线接入网络(O-RAN)越来越多地将近实时控制委托给从第三方供应商获取的深度强化学习(DRL)xApp,这引入了新的供应链攻击面。后门策略在正常情况下表现最优,但一旦对手向观察到的关键性能指标(KPI)遥测数据中注入隐蔽触发器,就会产生有害的控制动作,降低服务质量(QoS)。本文提出ORAN-DEFEND,一种无需重新训练的包装器,通过奇异值分解(SVD)从少量可信的干净轨迹中估计安全子空间,将每个KPI窗口投影到该安全子空间上,从而净化冻结的、可能被攻陷的xApp。作者从分析和实验两方面建立了精确的恢复条件:如果触发器能量集中在安全子空间的正交补中,则防御成功,并通过触发器的正交补能量分数量化该边界。在Colosseum COLORAN数据集上,评估了四种结构不同的DRL后门攻击(TrojDRL、SleeperNets、BadRL和Q-Incept),涵盖内环和外环投毒机制,结果表明在子空间假设成立时,所有攻击都实现了100%的回报恢复和≥99.5%的防御成功率。几何消融实验揭示了任何线性投影防御的内在且此前未表征的极限:当触发器与合法信号共定位时,正交补能量分数单调地控制恢复,线性残差检测器降至随机水平,而非线性分类器仍保持完美可分性。

💡 推荐理由: O-RAN供应链中第三方DRL xApp的后门攻击是新兴威胁,ORAN-DEFEND提供了一种轻量级、无需重新训练的防御方案,对保障O-RAN安全性具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Marco Arazzi, Mert Cihangiroglu, Serena Nicolazzo, Antonino Nocera, Vinod P

随着物联网(IoT)的快速发展,攻击面不断扩大,针对智能对象及其交互的新兴威胁日益增多。确保服务提供的安全性对于IoT生态系统的正常运行、安全性和可靠性至关重要。服务提供涵盖设备注册、配置、认证、授权和软件部署等关键任务。本文提出一个综合框架,旨在选择最合适的智能对象来交付目标服务,同时在服务提供阶段监控相关实体的行为。该方法采用深度强化学习(DRL),使智能代理通过与复杂动态环境的交互,学习在遵守预定义安全约束的同时适应变化。对于行为监控,利用联邦学习(FL)开发全局行为指纹(BF)模型,该模型完全分布式,可分析IoT设备在网络中的交互方式。此外,BF用于计算每个服务提供商的可靠性评分,反映其遵守安全约束的程度。该评分被纳入服务提供过程,使智能对象不仅能根据功能适用性,还能根据可靠性水平选择提供商。广泛的实验评估表明,该解决方案即使在资源受限的IoT设备上也能有效部署,成为现代IoT生态系统中可行且可扩展的安全增强机制。

💡 推荐理由: 该研究将深度强化学习与联邦学习结合,为IoT服务提供动态安全决策和分布式行为监控,为资源受限环境下的安全服务编排提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Linkang Du, Min Chen 0032, Mingyang Sun, Shouling Ji, Peng Cheng 0001, Jiming Chen 0001, Zhikun Zhang 0001

该论文提出了一种名为ORL-AUDITOR的新型数据集审计机制,专门针对离线深度强化学习(offline DRL)场景。离线DRL利用预先收集的数据集训练模型,广泛应用于自动驾驶等安全关键领域。随着高质量数据集成为AI核心资产,许多机构公开共享数据集,但面临滥用或侵权的风险。现有水印技术无法处理已发布的数据集,而数据集推理(dataset inference)和成员推理(membership inference)等方法在离线DRL中因模型行为多样性和离线约束而效果不佳。作者利用累积奖励(cumulative rewards)作为唯一标识符,能够区分DRL模型是否基于特定数据集训练。ORL-AUDITOR是首个轨迹级(trajectory-level)数据集审计机制。实验在多种离线DRL模型和任务上进行,审计准确率超过95%,假阳性率低于2.88%。论文还研究了不同参数设置对实际部署的影响,并在Google和DeepMind的开源数据集上验证了审计能力。代码已开源。该工作为保护数据集知识产权提供了新思路,适用于任何使用离线DRL数据集的场景。

💡 推荐理由: 离线强化学习数据集的知识产权保护是当前空白,该论文提出一种无需修改数据的审计方法,有助于检测模型是否未经授权使用了特定数据集,对数据提供方具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Oubo Ma, Ruixiao Lin, Yang Dai, Jiahao Chen, Chunyi Zhou, Linkang Du, Shouling Ji

该论文系统研究了深度强化学习(DRL)中可塑性干预(plasticity interventions)对后门攻击威胁的影响。可塑性干预是现代DRL智能体的内置组件,用于缓解可塑性损失,但其对后门漏洞的作用尚不明确。作者通过大规模实证研究,分析了14,664个案例,涵盖了多种代表性干预措施和后门攻击场景。结果表明,除了一种干预(即锐度感知最小化SAM)会加剧后门威胁外,其他干预(如L2正则化、Dropout等)均能缓解后门攻击。病理分析揭示了加剧机制源于后门梯度放大,而缓解机制则归因于激活路径破坏和表示空间压缩。基于这些发现,作者提出了两个新见解:一是概念框架SCC(结构性因果关系),用于解构干预与后门之间的机理交互,从而指导鲁棒的后门注入;二是发现异常损失景观锐度可作为DRL后门检测的关键指标。该研究填补了可塑性干预与后门威胁系统性研究的空白,对DRL安全部署具有重要指导意义。适合DRL安全研究者、对抗性机器学习从业者以及AI系统防御工程师阅读。

💡 推荐理由: 该研究揭示了DRL中普遍使用的可塑性干预措施对后门威胁的非预期影响,为安全部署DRL提供了关键机理理解,尤其是发现了异常损失景观锐度可作为后门检测信号,具有实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)