本文针对大型语言模型(LLM)智能体在跨查询持久化场景下的安全威胁,提出了一种名为 SPA 的“计划优先”架构。研究背景是:现有防御通常只保护规划阶段或单个工具交互,但持久化智能体面临更广泛的攻击面——攻击者控制的数据可能改变控制流、进入安全敏感的工具参数,或影响后续查询。为此,SPA 在每个查询中仅调用一次规划器,生成声明式领域特定语言(DSL)的完整可执行计划,并采用双格信息流控制(dual-lattice IFC)来跟踪显式数据流和控制依赖上的机密性与完整性。为支持持久化且避免将不可信负载重新暴露给规划器,SPA 将执行结果存储为带标签的工件,并在后续规划时仅揭示语义元数据。作者在 AgentDojo 及其扩展的 AgentDojo-MQ(用于衡量安全状态复用和延迟攻击的多查询数据集)上进行了评估。在“tool_knowledge”攻击下,SPA 配合信息流控制将攻击成功率在 AgentDojo 上降至 0%,在 AgentDojo-MQ 上降至 0.2%。实验表明,计划优先执行与保留标签的持久化机制可显著增强持久化 LLM 智能体的安全性,同时也揭示了严格完整性执行带来的安全-效用权衡。本文适合关注 LLM 智能体安全、信息流控制、可信 AI 基础设施的研究人员和蓝队工程师阅读。
💡 推荐理由: 该研究直击持久化 LLM 智能体面临的关键安全盲区——跨查询状态污染与延迟攻击,提出的计划优先+信息流控制方案为构建安全代理架构提供了可量化验证的新范式,对防御 LLM 恶意网页/工具攻击具有直接参考价值。
🎯 建议动作: 研究跟进