推荐 5.5
Conf: 50%
本研究旨在评估大型语言模型(LLM)在重复性漏洞检测任务中的表现一致性。研究者使用 Snyk VulnBench JS 1.0 基准测试,对同一份 JavaScript 代码、相同的提示词和测试框架进行了 300 次重复扫描,重点分析 GPT-4 等代理型 LLM 在安全审查中的可重复性。实验发现,LLM 的检测结果存在高度不均衡:参考匹配的发现(即与基准答案一致的漏洞)在五次重复中表现稳定,但额外的、非匹配的发现则极不稳定——在 250 次模型运行中,161 个独特非匹配发现里有 80 个仅出现在一次,仅 22 个在全部五次中出现。相比之下,当 Claude 匹配到 Snyk Code 参考发现时,134/158 的独特匹配发现在五次重复中全部出现,稳定性显著更高。研究还揭示了互补性:模型能持续发现常见的高信号利用模式,甚至在一个案例中识别出 Snyk Code 产品的潜在遗漏。而确定性 SAST 工具(Snyk Code)则能系统性地列举重复的数据流污染点。结论认为,代理型 LLM 审查与确定性 SAST 应结合使用,而非相互替代。本文适合安全工程团队、LLM 应用研究人员和 Benchmark 设计者阅读,以理解 LLM 在漏洞检测中的可靠性边界。
💡 推荐理由: 揭示了 LLM 安全审查在重复性上的严重缺陷,提醒安全团队不能完全依赖 LLM 进行漏洞检测,同时也展示了与 SAST 协同的可行方向。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)