该论文聚焦于静态分析在软件安全中的核心地位与 CodeQL 等工具面临的现实瓶颈:构建高覆盖率查询套件通常需要大量人工投入。尽管大语言模型(LLM)在代码推理方面展现出潜力,但其生成结构化、可执行安全查询的实际能力仍缺乏系统评估。为此,作者开展了一项实证研究,利用美国国家漏洞数据库(NVD)中的漏洞数据,评估 LLM 合成 CodeQL 查询的能力,并探索将 LLM 作为自动 CodeQL 查询生成器的可行性。研究系统评测了多种 LLM 架构在大量真实漏洞场景下的表现,重点衡量其生成的查询对检测覆盖率和精确率的提升程度。结果显示,LLM 生成的查询能够显著增强基线 CodeQL 查询,平均 F1 分数提升达 82%。此外,论文提供了详细的成本效益分析:直接使用 LLM 扫描整个代码仓库在计算和财务上往往不可行,而利用 LLM 合成 CodeQL 查询则是一种可扩展且成本有效的替代方案。该研究的核心贡献在于证明 LLM 可以有效弥合非结构化漏洞报告与形式化静态分析规范之间的鸿沟,为大规模自动化漏洞检测提供了一条可扩展路径。适合静态分析研究者、SAST 工具开发者、DevSecOps 工程师以及漏洞管理团队阅读。
💡 推荐理由: 该研究验证了用 LLM 自动生成 CodeQL 查询可将平均 F1 提升 82%,为安全团队降低 SAST 规则编写成本、扩展检测覆盖面提供了新思路,值得评估其落地可行性与风险。
🎯 建议动作: 研究跟进