该论文针对大语言模型(LLM)智能体在间接提示注入攻击下的能力约束问题展开研究。攻击者可将恶意内容注入外部技能的输出,这些输出随后被放入智能体的执行上下文中,从而影响后续的敏感操作。现有防御手段主要分为两类:对不可信内容进行分类(如 Spotlighting)或对操作权限进行授权(如 CaMeL、AttriGuard),但并未直接解决“不可信数据一旦进入智能体状态,其未来的能力边界应如何动态收缩”这一核心问题。论文提出 SkillGuard,一种驻留在系统层(harness-level)的强制约束机制,将不可信数据的进入视为“污染”事件,并在此基础上限制智能体未来的调用能力,使其状态无法到达部署者定义的禁止状态。SkillGuard 依赖可靠的技能摘要与安全策略,构建“技能影响图”(Skill Impact Graph)来描述涉及安全关键的状态迁移;通过“可转向性签名”指定对技能参数的允许控制方式;并以内联引用监视器对每一次技能调用进行实时仲裁。一旦检测到污染,SkillGuard 不再调用辅助 LLM 进行推断,而是采用二元限制、分数限制或分数流限制策略,计算加权的能力削减方案。评估在 AgentDojo 的四个套件上开展,后端使用 Gemini 2.5 Flash 和 Llama3.3-70B,对比纯 LLM 无防御基线以及 Spotlighting、CaMeL、AttriGuard 三种不同系统层次的防御。实验还构造了一种组合式攻击基准,其中每个单一观察不足以触发目标违规,但组合后可达成攻击。结果显示,在 AgentDojo 的 Tool Knowledge 攻击下,SkillGuard 在两个后端上几乎完全消除了四个套件中的三个的攻击成功,Slack 套件上的攻击成功率分别降至 4.8% 和 14.3%。在组合式攻击下,SkillGuard 在 Llama 后端上优于所有基线,在 Gemini 上匹配最强基线并保持更高良性效用。与二元限制相比,分数流限制在同等的攻击成功率下保留了显著更多的可用能力。此外,SkillGuard 在两个场景中均不增加模型调用次数或 token 开销。该工作适合关注 LLM 智能体安全、AI 系统防御机制以及安全策略自动化的研究者与工程人员阅读。
💡 推荐理由: 间接提示注入是当前 LLM 智能体面临的实际威胁,而现有防御未能在系统层面动态收窄能力边界。SkillGuard 提供一种不依赖额外模型推理的轻量强制手段,为构建可证安全的智能体运行时提供了新思路。
🎯 建议动作: 研究跟进