该论文提出了一种名为 TTP-R1 的两阶段框架,用于从网络威胁情报(CTI)文本中自动提取 MITRE ATT&CK 攻击技术。手动标注 ATT&CK 技术成本高昂且难以扩展,而 ATT&CK 分类体系包含数百种技术,单条 CTI 文本可能涉及多种技术,导致准确且完整的提取充满挑战。现有的自动化方法存在不足:多标签分类器受严重类别不平衡和大标签空间困扰;基于大语言模型(LLM)的方法(如检索增强流水线或微调生成器)优化的是 token 级目标,将技术标注视为序列生成而非集合预测,缺乏对预测技术集合正确性和完整性的直接监督。TTP-R1 结合了检索增强的监督微调(SFT)与基于可验证奖励的强化学习(RLVR)。其混合检索器首先将庞大的标签空间缩小为候选集,然后微调 LLM 学习从中选择正确技术;随后应用分组相对策略优化(GRPO),使用分解奖励直接监督预测技术集合的精确率、召回率和输出格式。在四个 CTI 基准上,TTP-R1 取得了最佳平均 F1,子技术级 F1 相比使用检索增强的 Claude Sonnet 4.5 提升 7.4 个百分点,且以 8B 参数模型在单 GPU 上服务时运行速度快 28 倍。该研究聚焦于利用可验证奖励的强化学习来提升结构化威胁情报抽取的准确性与效率。适合 LLM 安全应用、威胁情报自动化及安全运营研究人员阅读。
💡 推荐理由: 该研究解决了 CTI 到 ATT&CK 自动映射这一安全运营刚需,其两阶段 RLVR 方法显著提升抽取精度与速度,为蓝队自动化威胁分析提供了新思路。
🎯 建议动作: 研究跟进