本论文提出并实现了一个名为 TagZilla 的自动化平台,用于在威胁情报(CTI)报告中为失陷指标(IoC)自动添加归属(owner)和滥用类型(abuse type)标签。在网络攻击活动中,IoC 通常包括 IP 地址、URL、文件哈希和加密货币钱包等,这些指标往往以非结构化文本形式出现在报告中,或仅在报告末尾列出而缺乏上下文,导致其分析价值受限。TagZilla 的核心思路是:给定一份威胁报告,自动分析其文本内容,识别其中描述的 IoC,并为每个 IoC 标记其所属的威胁组织、恶意软件家族,以及该 IoC 相关的滥用类型(例如钓鱼、性勒索、命令与控制等)。在技术方法上,TagZilla 引入了基于大语言模型(LLM)的新颖方案:对归属标签采用开放世界分类(open-world classification),即不限定已知实体集合,能够识别报告中出现的新组织或家族;对滥用类型标签则采用封闭世界分类(closed-world classification),预设了 29 种固定类型。作者构建了包含 100 份威胁报告、1,534 个指标的的人工标注地面真值数据集,评估结果表明 TagZilla 在归属标签上的 F1 分数为 0.94,在滥用类型标签上的 F1 分数为 0.93。进一步,作者将 TagZilla 应用于 765 份威胁报告,共识别出 15,583 个 IoC,归属于 637 个恶意软件家族、113 个威胁组织和 162 个其他实体。实验证明,即使报告中涉及多个攻击者和恶意软件家族,TagZilla 也能有效完成标签标注,从而为这些实体生成 IoC 画像。该研究的主要贡献在于:提供了一种自动化、可扩展的 IoC 上下文增强方法,显著提升威胁报告的可用性和分析效率;其开放世界分类设计尤其适合处理不断演变的新型威胁。适合安全运营中心(SOC)分析师、威胁情报研究员以及自动化安全分析工具开发者阅读。
💡 推荐理由: 威胁报告中 Ioc 缺乏上下文是 SOC 分析师日常痛点。TagZilla 用 LLM 自动为 IoC 打上威胁组织和滥用类型标签,能显著加速威胁研判、攻击归因和情报整合,值得蓝队关注其方法是否能集成到现有情报管道。
🎯 建议动作: 研究跟进