本文针对技能增强型智能体(skill-augmented agents)的安全问题展开研究。此类智能体会将可复用的技能作为持久化运行时上下文加载,以提升任务执行能力,但这也为恶意技能提供了长期影响后续行为的通道。恶意技能可能在特定用户任务和工作区状态下,诱使智能体泄露机密、破坏代码、绕过审批或将数据暂存以备外传,使得安装前的审查不足以防范风险,因此需要运行时且任务条件化的防护机制。作者提出一种名为 Defense-as-Skill 的防御范式,将运行时守护本身实现为可安装、可检查、可编辑的技能。其守卫模块 SkillSonar 与不受信任的任务技能并行运行,针对用户任务边界检查敏感操作,并将操作路由到允许(allow)、重新规划(replan)或确认(confirmation)决策,无需修改底层智能体运行时。为评估该方案,作者构建了任务条件化数据集 SCOPE-R,涵盖 6 个风险族和 21 个子类别,包含 206 个攻击确认的恶意实例和 43 个良性任务。然后通过运行时守护技能演化(一种蒙特卡洛树搜索过程,根据回放反馈迭代磁盘上的守卫技能)改进 SkillSonar。在 Claude Code 和 OpenClaw 上的实验表明,演化后的守卫大幅降低了攻击成功率,同时保持了良好的安全-效用平衡。在 GLM-5 的重复运行中,SkillSonar 将 ID ASR 从 0.482 降至 0.104,OOD ASR 从 0.606 降至 0.115。进一步分析展示了跨受害者模型、未见过风险族和外部基准的迁移能力,以及对自适应攻击者的持续防护。消融实验还表明,显式安全责任分配和技能原生表示对性能提升都至关重要。
💡 推荐理由: 该研究直指LLM智能体技能生态的运行时风险,首次将防护本身技能化,为‘技能即攻击面’提供了全新防御范式,对构建安全的智能体应用具有重要指导意义。
🎯 建议动作: 研究跟进