该论文聚焦于 LLM Agent 的推理记忆(reasoning memory)被对抗性写入导致的安全问题。LLM Agent 本身是无状态的,需要依赖外部记忆在步骤间传递上下文,并默认信任记忆内容,因此攻击者若能写入该记忆即可操控 Agent 行为。论文重点分析了一种名为 FARMA 的攻击方式:攻击者无需执行恶意命令,只需在 Agent 的推理记忆中插入伪造条目,声称某项必需的安全步骤已经完成,从而使 Agent 跳过该步骤。FARMA 原论文提出的防御方案 SENTINEL 基于固定可疑措辞列表对记忆条目进行评分,但其作者自己也承认,攻击者只要知晓该列表并改写措辞即可绕过,该问题在原文中未被解决。本文证明该缺陷比原述更严重:一个简单的自动化攻击者,仅用语言模型改写伪造条目,就能在首次尝试时绕过 SENTINEL,使 SENTINEL 在所有被测试模型上的防护效果降为零。此外,论文发现一种“能力悖论”:越强的模型反而越容易受到此类攻击(GPT-4o 和 GPT-4o-mini 上成功率高达 98-100%,而 Llama-3.1-8B 上为 44%),因为能力更强的 Agent 更忠于执行被改写的声明,因此威胁随模型能力增长而增大。针对此问题,论文提出 Proof-of-Execution Memory(PoEM)防御机制。PoEM 完全不检查记忆内容,而是维护一个独立的、防篡改的、基于 HMAC 链式结构的账本,记录实际执行过的安全步骤;该账本仅由可信的动作层写入。如果记忆声称某步骤已完成,PoEM 会要求账本确认真实执行才允许跳过。攻击者可以篡改记忆内容,但无法为从未执行的步骤伪造账本条目,因此改写措辞不再有效。在三个模型和三个场景下,PoEM 将攻击成功率降至 0%,同时保持合法操作不受阻碍(九个测试单元中八个为零误报,第九个为 1.7%,在采样噪声范围内);而 SENTINEL 会错误阻止 33-50% 的合法操作。PoEM 还能抵御针对其自身的攻击,只增加微秒级开销,并能在真实 LangChain Agent 中无需改动即可运行。PoEM 只保护其所门控的决策,具有较好的精确性和可部署性。本文为 LLM Agent 安全提供了新的防篡改执行验证思路,适合关注 Agent 安全、推理完整性、对抗机器学习的蓝队研究员、安全工程师和 AI 系统设计者阅读。
💡 推荐理由: LLM Agent 正被用于越来越多的自动化决策场景,而记忆投毒攻击可绕过安全机制且无需直接命令。PoEM 提供一种不依赖内容过滤、基于执行事实校验的防御思路,对蓝队构建可信 Agent 系统具有直接参考价值。
🎯 建议动作: 研究跟进