推荐 5.5
Conf: 50%
本文针对安全运营中心(SOC)中常见的告警疲劳问题展开研究。在实际环境中,安全检测系统每天产生的大量告警远超分析人员可处理的范围,因此自动化的告警分诊(triage)至关重要。现有方法通常直接提示或微调大语言模型(LLM)输出分诊标签,但并未训练模型对检测结果是否为真实威胁进行推理。作者提出了一种结合思维链(Chain-of-Thought, CoT)推理能力的分诊分类器,使用真实的人工标注的Windows端点检测数据,通过自动化提示优化、自训练和带可验证奖励的强化学习来训练模型。研究发现,CoT推理会降低标签token的概率,从而影响依赖该概率的自动化分诊判断,为此作者额外训练了一个校准器(calibrator),读取完整推理轨迹并估计判定正确的概率。最终系统在测试集上达到82.6%的准确率;在高置信度阈值下,相比直接输出标签的LLM分类器,良性告警的召回率提升了43.0%,恶意告警的召回率提升了18.3%。实验还表明,训练校准器是必要的——未训练的置信度评估器会导致高置信度召回率降为零;此外,微调后的30B模型显著优于前沿通用模型,说明针对任务进行专门训练比单纯扩大模型规模更有效。本文贡献在于提出了一种可推理的告警分诊方法,并解决了推理带来的置信度校准问题,为SOC自动化分诊提供了新的思路。适合从事安全自动化、LLM应用及告警管理的研究人员和工程师阅读。
💡 推荐理由: 该研究直接解决SOC告警疲劳的痛点,通过可推理的LLM和校准器提升分诊准确性,显著优于直接标签分类,为安全运营自动化提供了可靠且可落地的方案。
🎯 建议动作: 研究跟进,评估其方法在内部SOC告警数据上的效果。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)