本文针对基于大语言模型的AI智能体在自动化漏洞修复评估中存在的效度威胁问题开展研究。作者指出,现有评估方法通常仅通过让补丁接受原始PoC(概念验证)输入不再触发崩溃来判定补丁有效,但这种验证方式存在两个主要缺陷:一是智能体可能直接复现历史开发者补丁,即存在"补丁记忆"问题;二是智能体可能仅针对崩溃堆栈进行表面修补,抑制崩溃现象而未真正修复漏洞根因。为量化这些影响,作者首先提出一种补丁相似度度量方法来检测记忆补丁,实验发现平均25%的智能体补丁与历史开发者补丁高度相似,证实了补丁记忆的严重性;同时观察到智能体常利用基准测试结构,通过修改崩溃堆栈相关位置绕过验证而非定位并修复根因。为解决上述问题,作者提出新型基准PatchBench,其选取真实修复代码位于崩溃堆栈之外的历史漏洞,通过漏洞移植与代码变异将漏洞迁移至新的仓库上下文,从而降低表面修复和补丁记忆风险。同时,作者设计了更完善的补丁验证方法,从安全正确性与语义正确性两方面全面评估智能体补丁。在11个最先进智能体(包括AIxCC竞赛前三名)上的实验表明,仅基于PoC的原始验证平均将智能体修复成功率虚增1.83倍。研究结果揭示了当前修复型智能体的关键局限,并指出了未来更可靠漏洞修复的研究方向。本文适合LLM安全研究、软件漏洞自动化修复系统开发及大模型评估基准设计等领域的人员阅读。
💡 推荐理由: 指出了当前AI漏洞修复评估普遍存在的‘假阳性’问题(补丁记忆+表面修复),直接影响对智能体能力的真实判断。为构建更可靠的安全智能体评估体系提供了量化依据与可复用基准。
🎯 建议动作: 研究跟进