该论文针对威胁报告知识图谱提取工具评估的可复现性问题进行系统审计。研究者注意到工具发布时引用的三元组F1分数高度依赖于预测三元组与黄金标注之间的匹配规则,而匹配算法(精确匹配、同义词、嵌入相似度等)的选择会显著影响最终得分。作者检查了12个公开系统,仅对5个系统能够重新实现其论文中所述的匹配规则,其余7个规则不透明。在共享文档上使用8种不同匹配协议重新评分10个系统的预测输出,结果显示45对系统排名中有11对发生倒置;同一组预测在不同协议下F1得分可从0.16变化至0.70。在GRID外部378项校准数据集上,作者对比了词汇匹配、嵌入和蕴含等机械匹配器与多审阅者的人工裁决,一致性最高不超过71%,而使用LLM作为评判时一致性达到86%。为分离模型本身与匹配规则的影响,作者构建CTIForge,可固定抽取结果、仅改变验证层。实验发现,在7种部署配置下,验证层对精确率的影响并非单边:4个托管后端精确率提升,3个离线后端精确率下降,该差异与骨干网络、解码和提示耦合,不能简单归因于服务方式。同时,对于明确争论实体类型的动作增加了约2.8倍,说明手写验证规则内嵌了其为之开发的后端的约定。作者开源了完整管道、协议集合和逐三元组审计记录。此工作对于安全团队如何客观评估威胁情报知识图谱工具、避免被表面F1分数误导具有重要参考价值。
💡 推荐理由: 安全团队常依赖知识图谱工具的F1分数做采购决策,但匹配协议不透明会导致分数虚高和排名失真。该文揭示了这一隐患,并提供了可复用的审计工具与方法,有助于提升威胁情报工具评估的可信度。
🎯 建议动作: 研究跟进