#log-anomaly-detection

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Rohit Patel, Susil Kumar Mohanty, Jeenal Chaudhary

该论文面向 AIOps 场景中的根因分析(RCA)任务,指出现有做法多依赖云端托管的大语言模型,虽然能力较强,但会带来数据隐私外泄风险、网络往返延迟以及随生产日志规模线性增长的按查询计费成本,难以在日志量极大的生产环境中长期支撑。为此作者提出 TriCalRAG——一个面向本地化部署(on-premise)开源权重模型的三策略检索增强基准。实验平台为一台配备 NVIDIA RTX PRO 6000(96GB 显存)的高内存工作站 GPU,使用 vLLM 在本地提供推理服务,并与经典 LSTM 日志异常检测器 DeepLog 进行对照。数据集选用四个真实且公开可得的日志集合:BGL、HDFS、Thunderbird 与 OpenStack。模型方面评估了两个开源权重模型 Qwen2.5-14B 与 Mistral-Small,并在三种提示策略下比较:零样本(zero-shot)、少样本(few-shot)以及基于已标注历史事件库的检索增强生成(RAG)。评价指标包含准确率、精确率/召回率与 F1,并对 3 个随机种子给出 bootstrap 95% 置信区间,同时报告吞吐量与显存占用。主要发现有三点:其一,RAG 相比零样本提示不仅把平均 F1 提升 0.10–0.27,更重要的是显著稳定了模型的概率校准,零样本提示会让两个模型趋于近退化行为——在部分数据集上把高达 100% 的事件都判为“异常”,而 RAG 在多数配置下能把预测正类率拉回接近真实类别分布;其二,Mistral-Small 的宏平均 F1 高于 Qwen2.5-14B(0.644 对 0.560),但在 12 种配置中有 7 种出现校准失败,而 Qwen2.5-14B 只有 5 种,且 Mistral-Small 吞吐量约为前者一半,说明模型选型取决于部署更看重峰值精度还是跨提示条件的可预测行为;其三,消融实验显示批处理在单卡上可将吞吐量放大 41 倍,4-bit 量化可降低 20% 延迟且精度无可测损失。作者开源了基准测试框架、数据划分与评估代码,以支持可复现的本地化 AIOps 研究。

💡 推荐理由: 多数 AIOps 团队正把 LLM 引入日志根因分析,但云端推理带来日志外泄与成本失控风险。该工作给出了可本地复现的评测口径,并揭示零样本提示会引发“全判异常”的退化校准问题,提示防御方不能只看 F1 而忽略预测正类率与校准稳定性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chia-Hsuan Wu, Dar-Hsin Dustin Wu, Rui Fang, Yi-Ting Lee, Chia-Chih Lin, Ming-Syan Chen

该论文提出了一种面向硬件安全模块(HSM)日志的异常检测框架 HSMLog,旨在解决传统方法仅关注孤立事件而忽略跨事件序列、密钥状态、会话及时间模式之间关联性的问题。HSM 是负责密钥管理和加密操作的硬件设备,其日志包含安全关键行为,但异常往往体现在多事件之间的复杂关系上。现有检测方法缺乏针对 HSM 场景的证据验证与报告机制。HSMLog 采用两阶段流水线:第一阶段使用小型语言模型(SLM)对滑动窗口内的结构化 HSM 事件进行候选告警识别,并结合 HSM 运维规则进行策略引导评估,以过滤误报;第二阶段检索预先存在的策略规则和历史可疑密钥记录(严格限定在告警窗口之前),结合候选相关日志上下文,进行保守的候选复核与事件分析,从而提升可解释性和可信度。研究团队使用真实工业 HSM 背景日志,并注入与工业伙伴共同定义的异常场景进行评测。实验结果显示,该方法实现了 98.97% 的精确率、96.00% 的召回率、98.66% 的异常事件覆盖率和 97.46% 的 F1 分数,证明其在异常告警和事件初步分类方面具备有效性。该研究的主要贡献包括:提出两阶段 SLM 辅助日志异常检测架构、设计 HSM 特定策略引导规则、强调上下文和时序约束以增强证据链,以及通过工业环境数据验证了可行性。适合从事日志异常检测、安全运营、AI 辅助 SOC 分析以及硬件安全模块运维的研究人员阅读。

💡 推荐理由: 针对 HSM 这类高价值基础设施,现有日志异常检测多忽略跨事件关联。HSMLog 引入小语言模型和策略引导的两阶段分析,在保持高精度的同时增强可解释性,对提升关键密码资产的威胁可见性有参考价值。

🎯 建议动作: 研究跟进,评估其方法应用于内部 HSM 日志审计的可行性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Samuel Ndichu, Tao Ban, Seiichi Ozawa, Takeshi Takahashi, Daisuke Inoue

本文提出了一种名为NLLog(Natural-Language Log)的轻量级日志异常检测管道,旨在解决系统日志因模板化格式导致难以被自动化分析和人工理解的问题。NLLog的核心思想是将解析后的日志模板确定性重写为“谁-做了什么-严重程度”(WHO-WHAT-SEVERITY)的自然语言句子,然后通过词频-逆文档频率(TF-IDF)加权进行池化,使用树集成(如随机森林)对会话进行分类,并利用TreeSHAP反向投影证据以辅助分析师审查。在Hadoop分布式文件系统(HDFS)和Blue Gene/L(BGL)数据集上的实验表明,NLLog超越了两种复现的匹配协议基线;在HDFS、BGL和AIT警报数据集上,NLLog在商用硬件上实现了低误报率,延迟适合安全运营中心(SOC)的初步分类。消融实验(覆盖度、稀疏vs密集、忠实性、对抗性测试)表明,回退充分性依赖于语料库;部署前的注册阶段覆盖度检查可以揭示需要改进的领域。可审计的确定性重写与轻量级密集编码相结合,为日志异常检测和分类提供了可衡量的表示层。该研究适合对日志分析、异常检测和可解释AI感兴趣的安全研究人员阅读。

💡 推荐理由: NLLog提供了一种轻量级、可解释的日志异常检测方法,通过将日志转换为自然语言句子降低分析门槛,适合SOC日常使用,同时保持低误报率和低延迟。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Junwei Zhou 0002, Yuyang Gao, Cheng Tan, Yanchao Yang 0002, Jianwen Xiang

该论文提出了一种名为 GLog 的自进化日志异常类型预测框架,旨在解决现有日志异常检测方法在多云和微服务环境中的局限性。传统方法通常只能进行二分类(正常/异常),难以适应动态变化的日志模式,且在日志解析过程中存在语义损失问题。GLog 是一个端到端框架,不需要人工标注的异常类型标签即可动态预测异常类型。其工作流程分为两个阶段:首先,使用正常/异常标签对指令微调的大语言模型(LLM)进行微调,使其能够在原始未解析的日志序列上实现高精度异常检测;然后,对检测到的异常进行聚类,自动生成伪异常类型标签和描述,并用于第二阶段微调,使模型能够预测具体的异常类型并输出可解释的结果。GLog 通过利用完整日志语义并动态更新异常类型库,减少了人工标注成本,能够适应大规模环境中系统行为的演化。实验在多个数据集上验证了其有效性。

💡 推荐理由: 该工作针对日志异常检测的细粒度分类和自适应能力不足提供了创新方案,结合 LLM 和聚类实现自动化的异常类型预测,有望减轻运维人员的分析负担。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)