#multi-label classification

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ahmed Ryan, Saad Sakib Noor, Md Erfan, Shaswata Mitra, Sudip Mittal, Md Rayhanur Rahman

本研究针对开源大语言模型(LLM)在多标签MITRE ATT&CK技术分类任务上的表现进行了系统性评估。当前已有的自动化方法大多基于简化后的单技术句子进行评测,无法体现真实网络威胁情报(CTI)报告中复杂的语言和多步骤攻击模式,导致性能被高估。为填补这一空白,作者构建了一个包含2,076条人工标注句子的基准数据集(其中1,281条为正样本,795条为负样本),这些句子来自83份复杂非结构化CTI报告,并映射到114种独特的ATT&CK技术。标注过程采用六阶段流程,达到了交换机间一致性κ=0.68。在此基础上,评估了7个开源LLM(参数量从8B到236B),测试了不同提示策略和温度配置的影响。结果显示,性能最佳的模型微平均F1分数仅为0.22,确立了复杂非结构化CTI报告上多标签ATT&CK分类的实证基线。统计分析表明,参数量与F1分数呈显著正相关,但提示策略和温度设置未带来统计显著的性能提升。结论是当前开源LLM尚不足以支撑生产级ATT&CK分类任务,本研究为未来CTI研究提供了可复现的数据集、基准测试和发现。

💡 推荐理由: 该研究首次在真实复杂CTI报告上评估开源LLM的多标签ATT&CK分类能力,揭示了当前技术的实际性能瓶颈,为安全运营团队选择自动化工具提供了可靠基线。

🎯 建议动作: 研究跟进,将基准数据集和评估框架纳入内部CTI工具测试。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)