本文由多所高校和机构的研究人员提出,关注自我进化的大语言模型(LLM)编码代理的安全漏洞。此类代理能够从共享技能库中检索示例,并通过模仿这些示例来自动编写新技能。研究人员发现,这一自我进化过程中存在一种可被利用的“自我投毒”(self-poisoning)漏洞:当代理检索到恶意技能时,该恶意技能可能成为新技能的模板,从而保留其中的恶意负载。攻击者可将恶意技能预先植入技能库,无需直接调用,代理便会模仿并生成携带恶意代码的新技能,并可能将其执行、存储并再次写回库中,形成自我传播的蠕虫。论文提出了 EvoMal 攻击框架,通过将可互换的恶意负载包裹在看似良性的“banner”结构元素中,诱导模仿代理完整复制包含的代码。该攻击可在植入技能被移除后持续存在。作者定义了代理自我投毒率(ASPR)作为评估指标,并在 153 个工具相关的 SWE-bench Verified 任务上对六个模型进行了实验。结果显示,ASPR 范围为 20.3% 至 41.8%,中毒库中的恶意技能数量是植入数量的 4.9 至 9.0 倍。即使没有 banner,DeepSeek-V4-Pro 也能达到 11.1% 的 ASPR。将植入技能描述针对单一任务家族定制后,ASPR 可高达 86.7%。在移除植入技能后,Qwen3 仍保持 68% 的第 5 轮 ASPR,表明代理自制的副本导致漏洞持续存在。现有防御措施主要关注攻击者提交的名称、代码和签名,无法有效防御此类攻击。作者提出了一种名为“counter-prompt”的防御策略,通过抑制 banner 风格的复制,将 EvoMal 的 ASPR 降至 6.7% 以下,同时不显著影响任务完成度。该工作揭示了自我进化代理系统面临的新型供应链攻击风险,并为安全防御提供了新的思路。
💡 推荐理由: 自我进化型 LLM 编码代理已成为软件供应链的潜在入口,本研究揭示了一种无需直接调用即可感染代理并自我传播的攻击方式,现有防御难以检测。对于构建或使用此类代理的团队,这是必须关注的新型威胁,且其传播特性可能造成持久影响。
🎯 建议动作: 研究跟进