该论文提出 SafeEvolve,一种面向 LLM 智能体(agent)安全对齐的“经验驱动自进化”框架。研究背景是:基于 LLM 的智能体在完成任务时,其行为由基础模型与交互环境所用的“harness”(即外部工具/提示/技能编排层)共同决定,因此既可能产生有害的最终回答,也可能在多步执行轨迹中出现风险。已有的安全对齐方法要么只更新外部 harness、要么只做策略优化,两者孤立进行时难以将运行时控制与模型内在安全能力有效结合。SafeEvolve 的核心思路是:从智能体自身已完成的对策略(on-policy)轨迹中提取安全经验,形成一个持续迭代的“harness-策略共同进化”闭环。在 harness 侧,它将轨迹级安全证据转化为有界(bounded)、组件级的更新,涉及安全提示(safety prompt)与分层技能(hierarchical skills),使生成的 harness 工件可审计、可回滚;在策略侧,采用两阶段 SFT-RL 范式:先通过“使用 harness 的 SFT”引导策略主动利用进化后的 harness 工件,再通过“harness 增强的 RL”结合验证器分解奖励,塑造智能体在多步探索中的自主安全行为。通过这种共同进化,安全经验被转化为改进的运行时 harness 与更安全的策略行为。实验在多个智能体安全基准上进行,展示了比现有基线更好的安全-效用平衡;例如在 Qwen3.5-4B 模型上,SafeEvolve 在 AgentDojo 基准上将攻击成功率(ASR)降低为原来的 1/3(即 3 倍减少),同时将良性任务成功率从 59.79% 提升至 61.86%。该研究的主要贡献在于提出了一种统一的、可迭代的安全对齐机制,弥补了纯 harness 更新与纯策略优化之间的鸿沟,并验证了“经验驱动共同进化”在复杂 agent 场景中的可行性。适合关注 LLM 智能体安全、对齐技术、可审计 AI 系统的安全研究员与工程师阅读。
💡 推荐理由: LLM 智能体安全不能只靠模型对齐或只靠外部过滤;SafeEvolve 提供了一种可闭环的 harness-策略共同进化思路,为蓝队设计多层、可审计的智能体防护提供了新视角。
🎯 建议动作: 研究跟进