本文提出SMETA-ZSL,一种面向网络安全威胁分类的零样本学习方法。传统监督学习依赖大量标注数据,但新出现的威胁类别往往缺乏标记样本。零样本学习通过利用辅助语义知识(如自然语言描述)来识别未见过的类别。大型语言模型可将非结构化的网络威胁情报(CTI)报告转换为语义原型,为新兴威胁提供表征。然而,网络安全领域存在威胁描述语义重叠、行为特征与文本异构、类别严重失衡以及开放集条件等问题。SMETA-ZSL通过以下创新解决这些挑战:首先,使用对比微调从重叠的语言描述中学习语义原型;其次,通过情景元学习和知识蒸馏将行为特征与语义原型对齐;最后,采用自适应路由机制在已见和未见类别之间泛化。在7个基准数据集上,SMETA-ZSL在严格的归纳设置下取得了最优的广义零样本性能,平均超过先前方法10.8个百分点,最高提升18.1个百分点。该方法有望提升安全运营中心对未知威胁的自动化检测能力。
💡 推荐理由: 该方法使安全系统无需标注样本即可识别新兴威胁,显著降低对人工标签的依赖,提升威胁情报的自动化利用效率。
🎯 建议动作: 研究跟进