#aiops

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Rohit Patel, Susil Kumar Mohanty, Jeenal Chaudhary

该论文面向 AIOps 场景中的根因分析(RCA)任务,指出现有做法多依赖云端托管的大语言模型,虽然能力较强,但会带来数据隐私外泄风险、网络往返延迟以及随生产日志规模线性增长的按查询计费成本,难以在日志量极大的生产环境中长期支撑。为此作者提出 TriCalRAG——一个面向本地化部署(on-premise)开源权重模型的三策略检索增强基准。实验平台为一台配备 NVIDIA RTX PRO 6000(96GB 显存)的高内存工作站 GPU,使用 vLLM 在本地提供推理服务,并与经典 LSTM 日志异常检测器 DeepLog 进行对照。数据集选用四个真实且公开可得的日志集合:BGL、HDFS、Thunderbird 与 OpenStack。模型方面评估了两个开源权重模型 Qwen2.5-14B 与 Mistral-Small,并在三种提示策略下比较:零样本(zero-shot)、少样本(few-shot)以及基于已标注历史事件库的检索增强生成(RAG)。评价指标包含准确率、精确率/召回率与 F1,并对 3 个随机种子给出 bootstrap 95% 置信区间,同时报告吞吐量与显存占用。主要发现有三点:其一,RAG 相比零样本提示不仅把平均 F1 提升 0.10–0.27,更重要的是显著稳定了模型的概率校准,零样本提示会让两个模型趋于近退化行为——在部分数据集上把高达 100% 的事件都判为“异常”,而 RAG 在多数配置下能把预测正类率拉回接近真实类别分布;其二,Mistral-Small 的宏平均 F1 高于 Qwen2.5-14B(0.644 对 0.560),但在 12 种配置中有 7 种出现校准失败,而 Qwen2.5-14B 只有 5 种,且 Mistral-Small 吞吐量约为前者一半,说明模型选型取决于部署更看重峰值精度还是跨提示条件的可预测行为;其三,消融实验显示批处理在单卡上可将吞吐量放大 41 倍,4-bit 量化可降低 20% 延迟且精度无可测损失。作者开源了基准测试框架、数据划分与评估代码,以支持可复现的本地化 AIOps 研究。

💡 推荐理由: 多数 AIOps 团队正把 LLM 引入日志根因分析,但云端推理带来日志外泄与成本失控风险。该工作给出了可本地复现的评测口径,并揭示零样本提示会引发“全判异常”的退化校准问题,提示防御方不能只看 F1 而忽略预测正类率与校准稳定性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)