本文是一篇针对大语言模型(LLM)在漏洞评估中产生“AI 垃圾内容”(AI Slop)及幻觉问题的系统性综述。研究背景是:LLM 被广泛集成到网络安全漏洞评估流程中,显著提升了自动化水平,但同时也引发了可信性危机——模型会生成幻觉漏洞、看似合理但错误的补丁、以及语义重复或误导性的 bug 报告。这些产物被统称为“AI slop”,它们大量涌入人工分流(triage)管线,给安全分析师带来沉重的认知负担,其效果类似于一次拒绝服务攻击。作者通过结构化文献回顾,形式化了一套 AI slop 的分类法,并剖析其根本原因:安全专家所依赖的因果演绎推理与当前 LLM 的自回归概率生成之间存在根本性差距。为了量化这一差距,作者提出了“演绎覆盖率分数”(Deductive Coverage Score)作为可测代理指标,并通过实验表明,思维链(chain-of-thought)提示和工具使用型智能体虽然能缩小该差距,但无法完全消除。在缓解策略方面,作者认为被动的幻觉检测和水印方法只能追溯来源,不能验证正确性,且受限于熵约束;因此他们主张采用主动的神经符号验证(neuro-symbolic verification),将流水线的每个组件映射到已有明确安全输入限制的系统中。最后,论文设计了两套评估工具:CVE-Bench 和 Slop-Score,包括数据集构建、指标公式和防作弊机制。整体上,本文主张将评估标准从语言流畅性转向数学可验证性,为构建可信的 AI 驱动漏洞分流系统提供了路线图。适合安全研究员、LLM 应用开发者及 SOC 自动化决策者阅读。
💡 推荐理由: LLM 辅助漏洞评估正在落地,但幻觉和错误输出会直接误导安全决策,增加分析师负担。本文首次系统梳理了 AI slop 的分类与根因,并提出了可量化的评估与验证方向,对构建可信的 AI 安全工具具有重要参考价值。
🎯 建议动作: 研究跟进