本文针对LLM智能体在加载第三方技能(skill)时面临的安全威胁展开研究。技能是以自然语言指令编写的文件包,由第三方开发者编写并通过市场分发,执行时拥有用户特权。恶意技能可窃取数据、劫持智能体或在供应链中持久化,使技能市场成为新的攻击面。现有提示注入防御不适用于此场景,因为它们依赖于可信指令与不可信数据之间的边界,而技能本身即指令集合,注入命令混入合法指令中并继承其权限。为此,作者提出Locate-and-Judge两阶段检测器:第一阶段使用轻量级定位器(locator),根据每条指令被遵循的注意力分数(instruction-following attention)对技能的各个结构跨度(span)进行评分,仅保留得分最高的K个跨度;第二阶段由判断器(judge)详细检查这些保留跨度。将昂贵的判断集中在小部分高注意跨度上,使检测器能够审计整个市场而非抽样。与直接基于LLM的扫描相比,该方法将成本降低一个数量级,大幅提升可扩展性,同时仅牺牲少量召回率。在可比成本下,其表现优于关键词和正则表达式基线。部署于市场级别规模且成本极低时,Locate-and-Judge能够以高精度标记可疑技能,其中大部分经验证为恶意,发现了数十个活跃恶意技能,包括多个伪装成良性功能的技能,以及许多被SkillSpector和Cisco Skill Scanner漏检的技能。作者还发布了标注数据集。本文适合AI安全研究员、LLM应用开发者及平台安全运维人员阅读。
💡 推荐理由: LLM智能体技能市场是新兴攻击面,现有提示注入防御失效。本文提出首个规模化、低成本的恶意技能检测方案,直接威胁供应链安全,值得智能体平台和蓝队关注。
🎯 建议动作: 研究跟进:评估方法在自身智能体系统上的适用性,考虑集成至技能审核流程。