该论文关注 LLM Agent 在调用外部工具时面临的间接提示注入(Indirect Prompt Injection, IPI)风险:由于 Agent 需要读取网页、文件、API 返回等外部内容,攻击者可将恶意指令埋入这些工具输出中,诱导 Agent 执行非预期动作。作者指出,现有防御思路各有局限:提示加固(prompt hardening)容易被自适应攻击绕过;内容过滤往往会过度清洗外部内容,破坏正常任务所需信息;预生成计划难以应对动态、复杂的多步任务;权限约束则牺牲了执行灵活性。因此核心难题是:如何在不限制 Agent 正常规划自由度的前提下,精准定位并仅移除真正诱发不安全动作的那部分恶意内容,从而兼顾安全性与任务效用(security-utility trade-off)。为此作者提出 ActGuard,一个“执行前动作审计”框架。其关键设计是不再判断外部内容本身是否可疑,而是判断该内容是否使当前动作偏离“局部合理预期”。具体而言:在每一步,ActGuard 先预测即将执行的动作可能调用的工具集合,构建一个“局部工具先验(local tool prior)”,该先验不约束实际执行轨迹;随后在执行前将候选动作与该先验进行比对,开展工具级别的对比分析(tool-level contrastive analysis)与参数级别的证据定位(parameter-level evidence localization),以识别工具选择和动作参数上的偏离;最后由一个验证器(verifier)审查被定位到的证据,只对确认恶意的文本片段进行掩码,并基于净化后的上下文重新生成动作。这种“先审计、再最小化清洗、后重生成”的流程既保留了合法的规划灵活性,又避免了无差别过滤带来的信息损失。作者在面向工具使用型 Agent 的挑战性基准上进行了评估,结果显示 ActGuard 能将攻击成功率降至与当前最先进防御相当的水平,同时使任务效用接近无攻击场景,取得了较好的安全—效用平衡。代码已公开于 GitHub 仓库 binzhwang/ActGuard。该工作属于防御方法类研究,适合关注 Agent 安全、提示注入防护与 LLM 系统鲁棒性的研究者和安全工程师阅读。
💡 推荐理由: Agent 通过工具读取外部内容已成为 IPI 的主要入口,而现有过滤/加固方案普遍存在“要么被绕过、要么过度清洗伤效用”的两难。ActGuard 提出的执行前动作偏离审计与最小化证据掩码思路,为企业级 Agent 部署提供了可参考的安全—效用平衡范式。
🎯 建议动作: 研究跟进