该研究针对安全日志异常检测中传统方法(如 Wazuh 规则检测、OpenSearch 统计异常检测)依赖预定义规则或历史行为基线、难以捕捉语义和上下文信息的问题,探索了利用大语言模型(LLM)进行端到端异常认证行为检测的可行性。作者指出已有 LLM 方法容易受提示构造、日志噪声以及缺乏端点特定认证行为数据的影响,因此提出了一种标准化的基于指令的 LLM 分类框架,用于检测正常、边界和异常三类认证行为,尤其关注边界情况。研究构建了一个受控的网络安全测试平台,生成端点特定认证数据,形成包含正常、边界和异常场景的精选数据集。实验评估了三种指令微调 LLM:Meta Llama 3.1 8B Instruct、Qwen 2.5 7B Instruct 和 GPT-OSS 20B,并与 Wazuh 规则检测和 OpenSearch 异常检测进行对比,使用统一的真实严重性评分框架衡量性能。结果显示 Meta Llama 3.1 8B Instruct 整体端到端检测性能最强,准确率 89.3%、召回率 88.2%、F1 分数 91.8%、假阴性率 11.8%;而 Wazuh 准确率仅 52.0%、假阴性率 68.6%,OpenSearch 准确率 49.3%、假阴性率 74.5%。对于边界异常场景,Meta Llama 检测出 80%,而 Wazuh 和 OpenSearch 分别只有 20% 和 15%。Qwen 的整体检测性能低于 Meta Llama,但平均推理延迟最低,且结构化响应有效率为 100%。GPT-OSS 在产生有效响应时表现出较强的分类性能。该研究的核心贡献在于构建了端点特定的认证日志数据集,并展示了指令微调 LLM 在安全日志异常检测中优于传统方法的潜力,尤其是对边界情况的识别能力。适合对 LLM 安全应用、日志分析、异常检测和蓝队自动化感兴趣的研究人员和工程师阅读。
💡 推荐理由: 该研究表明 LLM 在安全日志异常检测中可显著优于传统规则/统计方法,尤其对边界异常有更高召回,有助于 SOC 分析师减少漏报,提升检测覆盖。
🎯 建议动作: 研究跟进