#dataset-quality

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Gints Engelen, Vera Rimmer, Wouter Joosen

该论文对网络安全入侵检测领域广泛使用的基准数据集 CICIDS2017 进行了系统性的审查与重建。研究背景是:尽管机器学习技术在网络入侵检测中展现出不错的效果,但缺乏能够代表现代网络流量的高质量训练数据,一直是制约其在实际大规模网络环境中落地的主要障碍。CICIDS2017 是近年来为满足网络入侵检测代表性要求而构建的基准数据集之一,但作者认为其数据采集流程和标注质量存在严重问题。作者重新审视了该数据集的完整数据管道,包括流量生成、流构建、特征提取和标签标注等环节,并通过深入分析发现了一系列缺陷,这些缺陷严重影响了数据集的正确性、有效性和整体可用性。具体而言,作者识别出流量生成中的异常、流构建的逻辑错误、特征提取中的不一致以及标签标注的失误,并针对多数问题提出了改进的数据处理方法。通过该方法,超过 20% 的原始流量痕迹被重建或重新标注。最终,作者在修正后的数据集上重新运行机器学习基准测试,结果显示模型性能有显著提升。该研究通过具体案例揭示了数据采集问题可能对模型评估产生巨大影响,并为如何预期和避免此类问题提供了切实建议。适合网络入侵检测研究者、数据集构建者以及依赖基准数据进行安全机器学习模型评估的工程师阅读。

💡 推荐理由: CICIDS2017 是入侵检测研究中最常用的基准数据集之一,但其隐藏的错误可能导致大量已发表模型评估结果失真。这项工作揭露了数据管道的缺陷并给出修正方法,提醒从业者重新审视基于该数据集的结论,并关注数据集质量对安全模型可信度的根本性影响。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)