本文研究自我进化 LLM 编码代理的安全漏洞。这类代理能够通过模仿共享技能库中检索到的技能来编写自己的工具,本文发现该过程中存在可被利用的脆弱性:当代理在编写新技能时,若以检索到的恶意技能为模板,生成的技能会保留原恶意负载,作者称之为“自我中毒”。攻击者可在技能库中植入带有隐蔽负载的恶意技能,而无需主动调用它们;代理在模仿时会将负载复制到新技能中并存储、运行,形成自我传播的蠕虫,即使在植入技能被移除后,代理自写的副本仍可继续传播和保留。为量化这一风险,作者定义了代理自我中毒率(ASPR),并在 153 个工具相关 SWE-bench Verified 任务上对六个模型进行评估,结果显示 ASPR 介于 20.3% 至 41.8%,中毒库中的恶意技能数量为植入数量的 4.9 至 9.0 倍。进一步研究表明,即使不使用特殊横幅,仅负载本身即可触发自我中毒(DeepSeek-V4-Pro 达到 11.1% ASPR);将恶意技能描述定制到特定任务族可将 ASPR 提升至 86.7%。植入技能清除后,Qwen3 在第五轮仍保持 68% 的 ASPR,说明代理自写副本形成了持久威胁,且能规避依赖攻击者提交名称、代码与签名的现有防御。最后,作者提出“反提示”(counter-prompt)防御策略,通过抑制横幅式复制,将 EvoMal 的 ASPR 降至不超过 6.7%,同时不显著影响任务完成率。该工作揭示了 LLM 编码代理自我进化循环中的新型攻击面,并为构建安全的代理协作生态提供了防御思路。
💡 推荐理由: 该研究揭示了 LLM 编码代理在自我进化过程中可能被植入恶意技能并形成自我传播的蠕虫,攻击面新颖且隐蔽,现有防御基于攻击者提交内容易被绕过。对依赖编码代理的 CI/CD 自动化、代码生成链和共享技能库的安全设计提出了挑战,需重新审视代理的信任边界与输入完整性验证。
🎯 建议动作: 研究跟进,并评估内部编码代理工具链的潜在暴露面