推荐 5.5
Conf: 50%
本文提出 ToolHazard,一个可扩展的对抗性环境合成框架,用于评估和提升基于大型语言模型(LLM)的智能体在集成外部工具时的安全性。核心研究问题是:LLM 智能体在感知环境状态时,容易受到嵌入其中的间接提示注入攻击,但现有研究多依赖手工构建或简单复用的环境、基于 LLM 的随机工具模拟以及预定义的注入位置,难以支撑跨领域的规模化安全研究。ToolHazard 通过三个核心组件——环境模拟器(Environment Simulator)、攻击代理(Attacker Agent)和用户模拟器(User Simulator)——自动化地合成可执行的有状态环境,自动发现可行的注入点并生成针对特定环境的载荷,同时构造状态接地(state-grounded)的长时程任务。基于该框架,作者构建了 ToolHazard-Bench,用于在复杂工作流和多样化环境攻击下对智能体进行压力测试。实验结果表明,智能体在多种场景下存在显著漏洞,且注入的时机和位置对攻击效果有重要影响。此外,利用 ToolHazard 生成的对齐数据在 ToolHazard-Bench 和 AgentDojo 两个基准上均提升了智能体的安全性,同时未明显牺牲良性任务的效用。该工作为 LLM 智能体安全评估和对齐提供了可复现、可扩展的自动化工具,适合从事大模型安全、红队测试和智能体对研究的研究人员阅读。
💡 推荐理由: LLM 智能体集成外部工具的场景日益普遍,间接提示注入是实际威胁。ToolHazard 提供了可规模化的自动化对抗环境生成方法,有助于安全团队系统性地发现智能体弱点,并利用生成数据增强防御能力,对蓝队评估和加固自研智能体具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)