本文指出网络安全机器学习基准数据集中普遍存在的标签错误问题,并以威胁情报(CTI)领域为例,构建了改进版数据集 D-LADDER++(基于公开的 LADDER 数据集经人工修正标签错误后得到)。作者使用开源模型 Microsoft Phi-3 和闭源模型 Google Gemini 在 D-LADDER++ 上进行了零样本和少样本评估,并对 Phi-3 进行了微调以提升适配性。实验结果表明,测试集中的标签错误会显著影响模型性能评估,进而误导模型选择。研究强调了构建高质量、无标签错误的网络安全基准数据集的重要性,以确保机器学习模型的可靠评估和实际部署。
💡 推荐理由: 标签错误在网络安全基准中普遍被忽视,但会严重扭曲模型性能评估,导致选型失当和部署风险。本文系统性地修正了现有数据集并量化了影响,为后续研究提供了更可靠的评测基础。
🎯 建议动作: 研究跟进