推荐 3.5
Conf: 50%
该论文提出了一种面向勒索软件检测的安全感知深度强化学习(SA-DRL)框架,核心创新在于将误报(False Positive)和漏报(False Negative)的成本不对称性嵌入到强化学习的奖励信号中。传统机器学习检测器通常使用对称目标函数,对漏报和误报给予同等惩罚,但实际中漏报可能导致不可逆的加密、业务中断和高昂恢复成本,而误报通常可逆。SA-DRL通过设计非对称奖励函数(R2)优先减少漏报,同时引入安全最优模型选择(SOMS)准则和自适应样本排序机制。在平衡的勒索软件检测数据集上,对DQN、DDQN、PPO和A2C四种深度强化学习智能体进行了评估,使用对称基线奖励(R1)和安全感知非对称奖励(R2),采用四个折扣因子、五折交叉验证和三个随机种子,共进行480次训练。SOMS准则以漏报率优先,结合F1分数和训练时间选择模型。结果表明,非对称奖励塑造显著提升了安全导向的检测性能。SOMS选出的最佳配置(DDQN + R2 + gamma=0.1)实现了漏报率0.0080,F1分数0.9915,AUC 0.998,相比最佳监督基线减少漏报67.6%。在所有配置中,R2使平均漏报率相比R1降低43%。该研究强调了奖励函数设计对安全敏感型勒索软件检测的重要性,为将领域先验知识融入强化学习框架提供了有效范式。适合安全研究人员、机器学习和入侵检测从业者阅读。
💡 推荐理由: 勒索软件检测中漏报代价远高于误报,但传统方法常忽视该不对称性。本文提出的非对称强化学习框架能显著降低漏报率,对提升实战检测效果具有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)