该论文提出了一种可复现的流水线,用于从自由文本的漏洞描述中将 CVE 映射到 MITRE ATT&CK 企业技术。传统方法依赖 CWE->CAPEC->ATT&CK 的推导链,但论文量化了该链在表扩展过程中产生的伪影。作者基于 MITRE 威胁情报防御中心专家人工标注的 1,207 个 CVE 构建了金标准数据集,并训练了一个多标签分类器。实验表明,该模型在 recall@5 上比零样本嵌入相似度基线提升了约一倍,且所有排序指标均有改善。随后论文研究了是否可以利用 LLM 辅助标注来扩展金标准数据集。初步实验出现矛盾结论:单次运行显示性能下降,而五次随机种子平均显示小幅提升。然而,独立复现和扩展规模研究(新增 100 至 984 个 CVE)表明,表面的改进实际上是评估伪影。LLM 生成的标签与专家标注的一致性约为 0.39,在任何扩展规模下都无法提供可靠的改进,并且在新增约 1000 个 CVE 时降低了稀有技术的覆盖率(macro-F1 下降 0.04)。根本原因是评估噪声:在小测试集上选择检查点等效于在多次噪声评估上最大化,导致完全相同的运行之间 recall@5 差异高达 0.05。通过基于验证集检查点选择的修正协议,仅使用金标准数据的模型达到 recall@5 = 0.673 ± 0.019,重复决定性实验确认了 LLM 扩展的零结果。最终扩展研究表明,增加专家人工标注数据能够持续提升性能,而 LLM 标注的数据则不能,表明该分类器受限于标签质量而非数据集规模。所有数据集、模型、代码和训练日志均已公开。适合安全研究人员、威胁情报分析师以及参与 ATT&CK 映射自动化工作的蓝队成员阅读。
💡 推荐理由: 该研究系统性地验证了 LLM 在 CVE 到 ATT&CK 映射中的可靠性边界,警告业界不要盲目信任 LLM 扩展数据,并为构建高质量威胁情报分类器提供了基准协议和公开金标准数据集。
🎯 建议动作: 研究跟进