本文研究 LLM 集成应用系统(LLM-integrated app systems)的安全性问题。这类系统通过第三方应用扩展大语言模型(LLM)的功能,系统 LLM 采用交错规划和执行的方式调用第三方应用来回答用户查询。然而,这种架构引入了新的攻击面:恶意应用可能导致规划或执行的完整性被破坏、可用性中断或执行期间的隐私泄露。作者首先识别出若干新型攻击,这些攻击分别影响规划完整性、执行完整性和可用性,并在最近的防御方案 IsolateGPT 上进行了演示,表明现有方案仍存在不足。针对这些问题,论文提出了 ACE(Abstract-Concrete-Execute)安全架构,为 LLM 集成应用系统提供规划与执行的安全保证。ACE 的核心思想是将规划过程解耦为两个阶段:第一阶段仅基于可信信息生成抽象执行计划,第二阶段利用已安装的系统应用将抽象计划映射为具体执行计划。系统通过静态分析结构化的计划输出,验证用户指定的安全信息流约束是否得到满足。在执行阶段,ACE 在应用之间强制实施数据和能力隔离屏障,并确保执行过程严格遵循可信的抽象计划。实验结果表明,ACE 能有效抵御 INJECAGENT 与 Agent Security Bench 基准中的间接提示注入攻击,以及作者新发现的攻击。同时,作者在 LangChain 基准的 Tool Usage 套件上评估了 ACE 在真实环境中的效用,证明其不仅安全,还能保持较高的任务可用性。总体而言,ACE 将系统安全原则引入 LLM 系统加固,是该领域一项重要的研究进展。
💡 推荐理由: LLM 集成应用系统面临新兴的提示注入与恶意应用攻击,本文提出的 ACE 架构通过规划分离、静态验证和执行隔离,为构建安全的 LLM 代理提供了一套可落地的设计范式,对防御者设计防护方案具有重要参考价值。
🎯 建议动作: 建议安全团队阅读全文,评估 ACE 架构在自身 LLM 应用中的可借鉴性,并进行概念验证。