本文提出 TraceGrant,一个面向网络化大语言模型(LLM)智能体的合同化安全治理框架。网络化 LLM 智能体从电子邮件、云存储、日历、交易平台和 Web 服务检索信息以完成多步骤任务,这些任务会产生持久的外部效应。合法执行所需的内容中可能同时包含间接提示注入,从而重定向工具调用、篡改敏感参数或破坏任务完成。现有防御主要约束不受信内容或单个工具调用,未能充分连接用户意图、运行时证据、实际效果和任务完成状态。TraceGrant 通过显式契约(Contract)在任务-效果生命周期内实施治理。执行前,从受信任的用户请求中建立任务-效果边界;执行中,被接受的证据只能实例化契约已授权的权限;执行后,根据实际工具结果验证任务完成情况。在固定基准设置下,针对949个 AgentDojo 和400个 Agent Security Bench 攻击案例,TraceGrant 记录零攻击成功,同时分别在77.32%和83.00%的攻击率下保持可用性。作者还通过白盒防御感知攻击、契约质量分析、阶段消融、定向压力测试和运行时开销测量进一步评估 TraceGrant。结果表明,TraceGrant 提供了一个统一的治理层,将受信任的用户意图、运行时证据、具体工具执行和经过验证的任务完成连接起来。该论文适合对 LLM 智能体安全、提示注入防御和形式化安全契约感兴趣的蓝队和安全研究人员阅读。
💡 推荐理由: 针对网络化 LLM 智能体的间接提示注入是当前实际风险,TraceGrant 通过显式契约将用户意图、运行时证据和任务验证统一治理,为构建可审计、可验证的智能体安全边界提供了新思路,值得防御方关注。
🎯 建议动作: 研究跟进:关注后续验证实现和可迁移性,评估是否可用于自身智能体安全架构