#data-imbalance

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Xian Wu 0007, Wenbo Guo 0002, Jia Yan, Baris Coskun, Xinyu Xing 0001

恶意软件分类是网络安全中的重要任务,但实际数据集中常因标注人员缺乏专业知识而包含大量错误标签。以往研究表明,错误标签会严重影响机器学习模型的准确性。尽管在图像识别和文本挖掘领域,已有多种噪声学习方法被提出并取得显著效果,但它们在恶意软件分类场景下的有效性尚未被系统验证。本文首先将代表性及最新的噪声学习方法应用于真实世界的恶意软件分类任务,发现这些方法均无法有效减轻错误标签的影响。通过精心设计的实验,作者揭示出主要原因在于恶意软件数据集存在极端的数据不平衡以及极高的错误标签比例。为此,作者提出了一种名为MORSE的新型噪声学习方法。MORSE对最先进的半监督学习技术进行了定制和扩展,将可能的错误标签样本视为未标注数据,从而避免其负面作用。同时,MORSE集成了样本重加权方法,平衡训练数据中各类样本的使用,以应对数据不平衡挑战。文中在合成数据集和真实数据集上进行了评估,结果显示MORSE显著优于现有噪声学习方法,能最大限度地减少错误标签的影响。本文适合从事恶意软件检测、对抗性机器学习及数据质量研究的安全工程师和研究人员阅读。

💡 推荐理由: 恶意软件分类模型依赖高质量标签,但真实环境标签噪声普遍存在。MORSE方法首次验证了现有噪声学习方法在恶意软件场景中的失效,并提出针对性解决方案,有助于提升安全运营中自动化分类的可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)