#threat-level

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Han Wang, Murathan Kurfalı, Alfonso Iacovazzi

本文研究了大型语言模型(LLM)在网络威胁情报(CTI)运营任务中的可靠性,具体聚焦于“威胁等级判定”这一子任务。随着LLM的快速发展,其在安全运营中被视为潜在的自动化辅助工具,但其实际决策能力尚未得到充分验证。作者首先从公开的MISP OSINT(开放源码情报)数据源中构建了一个经过筛选和标注的评估数据集,该数据集模拟了真实世界中安全分析师需要判断的威胁事件。随后,作者设计了一套定制化的提示词(prompt),在零样本(zero-shot)条件下系统比较了八个不同架构的LLM(未列出具体模型名称)的威胁等级判定表现。实验结果表明,零样本模型整体表现较弱,难以正确分配威胁等级,说明基础LLM缺乏足够的领域知识或推理能力。在此基础上,作者对每个模型进行了有监督微调(supervised fine-tuning),并对比了微调前后的效果。结果显示,微调显著提升了模型性能,F1分数依据基础架构不同介于0.40至0.58之间,但仍未达到实际部署所需的高标准。作者指出,尽管微调带来明显改进,当前性能水平仍不足以支持安全运营中的自动化决策,未来需要在数据质量、模型适配和领域特定调优方面进行更多研究。本研究为评估LLM在CTI分析中的实际边界提供了量化证据,也为后续模型优化方向提供了参考。适合安全分析师、CTI平台开发者和LLM应用研究者阅读。

💡 推荐理由: 该研究直接检验LLM在威胁等级判定这类操作性CTI任务中的真实能力,提醒蓝队不要盲目信任零样本LLM输出;微调虽有增益但远未达到生产级,有助于设定合理自动化预期。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)