#ner

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yasir Ech-Chammakhy, Oussama Azrara, Jaafar Chbili, Anas Motii

本文提出 STINER,一个面向社交媒体(特别是 X/Twitter)的战略级网络威胁情报(CTI)自动提取框架。战略 CTI 关注高级别洞察,如识别受攻击行业、将攻击归因于特定勒索软件组织、评估数据泄露规模等。X 平台往往在官方报告发布前数天就出现实时泄露公告,是获取此类情报的最快来源,但其非正式且高度不规则的社交媒体语言使得传统命名实体识别(NER)模型难以准确解析,形成自动化防御系统的盲区。为解决此问题,作者构建了一个专家标注的高质量语料库,包含 2,100 条真实告警,并设计了一个包含 8 种实体类型(如威胁行为者、行业、地点等)的细粒度分类体系。他们针对 12 种配置评估了 9 个模型,涵盖通用与领域自适应编码器、开放模式提取以及零样本和微调设置下的生成式大语言模型(LLM)。实验结果显示,领域自适应编码器(如 DarkBERT)取得了 89.33% 的严格 F1 分数,优于通用基线以及微调后的 LLM,且 LLM 推理延迟显著更高。基于 STINER-DarkBERT,作者进行了 2025 年上半年的欧洲威胁态势分析,结果与官方关于主要目标的报告相符,同时突出了西班牙攻击的独特可见性,并展示了社交媒体驱动提取如何能提前发现 SafePay 勒索软件活动的早期信号,而无需等待厂商威胁态势报告的追溯性描述。该研究适合网络安全防御者、威胁情报分析师以及自然语言处理研究人员阅读,有助于理解如何从非结构化社交媒体数据中高效提取战略级情报。

💡 推荐理由: 该研究为蓝队提供了一种从社交媒体实时提取战略威胁情报的可行方法,弥补传统 NER 在非正式语言上的不足,能显著缩短从攻击发生到情报感知的时间窗口,增强早期预警能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)