本文聚焦安全运营中心(SOC)中普遍存在的告警疲劳问题:每日产生的检测告警数量远超分析师可处理范围。以往研究通常直接提示或微调大语言模型(LLM)输出三分类标签(良性/恶意/待查),但未训练模型对检测是否构成真实威胁进行推理。作者提出一种基于思维链(Chain-of-Thought, CoT)推理的告警分类器,在真实人工标注的Windows端点检测数据上进行训练。训练流程结合了自动提示优化、自训练以及使用可验证奖励的强化学习,使模型能够生成推理轨迹并据此给出分类结论。实验发现,CoT推理虽然提升了分类性能,但会降低用于自动分类的标签token概率,导致置信度估计不可靠。为此,作者额外训练了一个校准器,该校准器读取完整推理轨迹并估计分类结论为正确的概率。最终系统在测试集上达到82.6%的准确率;在高置信度工作点(该系统用于自动化分类的运行区间)下,相比直接输出标签的LLM分类器,良性样本召回率提升43.0%,恶意样本召回率提升18.3%。研究还证明,未经训练的置信度评估会使高置信度召回率降为零,说明训练专门的校准器是不可或缺的环节。此外,经过微调的30B参数模型显著优于前沿的通用大模型(如GPT-4级别),表明针对特定任务的目标训练比单纯增大模型规模更有效。本文的核心贡献在于提出了一套结合CoT推理与概率校准的告警分类框架,为缓解SOC告警疲劳提供了新思路。
💡 推荐理由: 告警疲劳是SOC日常运营的核心痛点,本文提出的CoT推理+校准器方法能显著提升告警分类的准确性和置信度可靠性,帮助安全团队优先处理高置信度威胁,减少误报和漏报。
🎯 建议动作: 研究跟进