LLM 代理通过从开放注册表下载技能来获得新能力。开发者通常让代理推荐并安装技能,但代理经常捏造不存在的技能名,这种现象称为“技能名幻觉”。本文首次大规模测量该漏洞,评估了 15,000 条提示和 12 种配置(4 个独立 LLM 和 8 个代理)。结果显示,所有配置都存在幻觉,平均幻觉率在独立 LLM 为 36.0%,在代理中为 36.9%,在真实开发者问题上高达 43.1%。系统共生成 5,669 个独特的虚构名称,且这些名称并非随机噪声:代理会跨提示和模型重复相同的虚假名称,为攻击者提供了高度可靠的目标。攻击者可预先注册这些名称对应的恶意技能,当代理尝试安装时即触发供应链攻击。作者测试了四种模型级防御,最强的检索接地将幻觉率从 40.8% 降至 3.2%,但严重损害了实用性——即使最优配置下,正确推荐技能的概率也仅为约六分之一。因此,技能名幻觉是高度可利用的漏洞,修复无法仅靠提示工程或模型调优,需要生态系统层面的结构性变革:注册表级名称预留和验证的推荐管道。
💡 推荐理由: 揭示了 LLM 代理技能推荐机制中的系统性安全漏洞,攻击者可以低成本利用虚构名称实施供应链攻击,影响所有依赖开放注册表的代理系统。
🎯 建议动作: 研究跟进