长时运行的基于语言模型的智能体依赖于持久记忆来跨轮次保持上下文。许多智能体内存系统采用软撤销机制处理矛盾信息:当某个事实被新事实取代时,旧事实被标记为“已撤销”但仍保留在存储中,而非物理删除。然而,这种撤销标记在检索阶段是否真正被强制执行,此前缺乏系统性验证。本文对五个代表性智能体内存系统进行了实证测量:将每条记录以“被撤销的策略及其替代策略”的形式载入系统,随后在九种策略场景和九种不同语言模型下进行检索与决策测试,观察被撤销的事实是否会随检索被返回、智能体是否会据此采取行动,并在六种防御条件下对结果进行评分。实验发现,所有被测系统在默认情况下均未强制执行撤销语义:只要撤销标签对检索层可见,被撤销的事实就会与替代事实一同返回,甚至在排序中胜出,导致智能体采纳了已被撤销的不安全策略。基于该发现,作者开发了一个独立的防护组件,置于智能体与其任意内存后端之间,在检索结果返回给智能体之前拦截并抑制任何已被撤销或与当前有效替代记录冲突的内容。该研究揭示了大语言模型智能体内存一致性方面的系统性缺陷,为构建安全的长期记忆机制提供了重要实证依据和可落地的缓解方案。
💡 推荐理由: 该研究揭示智能体内存系统中的软撤销机制在检索时普遍失效,导致智能体可能依据已被撤销的旧策略或旧事实行动,造成安全与合规风险,对依赖长期记忆的LLM应用落地至关重要。
🎯 建议动作: 研究跟进