该论文针对深度学习网络入侵检测系统(NIDS)评估中的可重复性和公平性问题展开研究。现有评估通常假设数据分布静态,忽略随机性和环境变化的影响,导致报告性能无法反映真实部署情况。作者聚焦于能够感知并适应数据分布偏移的先进模型(shift-aware models),通过控制变量实验,系统分析了随机种子、训练数据划分、超参数、环境噪声等随机和环境因素对F1分数等指标的影响。实验表明,即使是微小的变化也可能导致F1分数大幅波动,影响结果的可重复性;部分因素会显著偏斜性能。基于发现,论文提出了一系列实用建议,包括固定随机种子、使用多次重复实验、报告置信区间、统一评估协议等,以支持深度学习NIDS的公平和可重复评估。该工作对于推动NIDS领域的科学评估方法具有重要参考价值。
💡 推荐理由: 安全运维团队在部署或选型基于深度学习的NIDS时,需要了解评估结果是否可靠。该论文揭示的性能波动问题直接关系到模型在实际环境中能否稳定工作,强调必须采用更严谨的评估方法论。
🎯 建议动作: 研究跟进