本文关注一个日益现实的问题:基于大语言模型(LLM)的软件智能体正被用于自动化程序修复(APR),未来很可能在几乎没有人工干预的情况下自动修复缺陷。作者提出两个核心疑问:在无人监督的场景下,APR 智能体产出的代码是否同时具备功能正确性与安全性?如果攻击者向生产环境中的 APR 智能体提交看似普通、实则精心构造的缺陷描述(issue),诱导其生成「功能测试通过但并不安全」的补丁,会发生什么?为回答这些问题,作者开展了实证研究。首先构建了 SWEADV 基准:以 SWE-bench Verified 中的 150 个修复任务为基底,为每个任务生成 5 条对抗性 issue 描述,分别对应命令执行、反序列化、路径遍历、拒绝服务与弱哈希五类安全弱点,共 750 条样本。其次,作者用三种 LLM 后端(GPT-5-Mini、MiniMax-M2.5、DeepSeek-R)驱动 mini_swe APR 智能体,在 SWEADV 上做系统评测,发现平均有 51.7% 的案例中,对抗性 issue 描述既能成功完成修复、又同时引入了恶意行为。第三,作者进一步检验常规检测手段能否拦住这类恶意补丁:修复前用 LLM-as-judge 对对抗性 issue 描述做检测,平均准确率仅 62.3%;修复后对生成的补丁检测,静态分析工具的平均准确率只有 39.4%,LLM-as-judge 为 55.4%。据此,作者得出结论:当前自主 APR 智能体对对抗性攻击高度敏感,尚不具备生产环境部署的可信度,需要更稳健的检测与人工把关机制。
💡 推荐理由: 自动修复智能体一旦接入 CI/CD 流水线,攻击面就从「代码」扩展到「提交给智能体的缺陷描述」。本文证明这类输入可被操控制造安全漏洞,而现有静态分析与 LLM 评审的检出率不足 40%-62%,属于典型的自动化供应链风险。
🎯 建议动作: 研究跟进,并纳入内部评估