本文研究大型语言模型(LLM)智能体的长期记忆机制引入的新安全风险:记忆来源清洗(memory provenance laundering)。在LLM智能体中,长期记忆允许智能体重用之前的偏好和工作流程,但同时也将不可信的观测内容转化为持久的行动上下文。作者发现,在基于LLM的记忆整合过程中,外部观测可能被改写为看似用户历史记录或工作流支持的内容,从而保留动作触发器但抹去了低信任来源,而来源本应限制该动作的权限。现有提示过滤器、内容清洗工具和工具守卫均无法在损失性记忆整合之后强制执行来源权威不放大(source-authority non-amplification)的边界。作者形式化了该边界,并实现为保留来源的记忆防火墙(Provenance-Preserving Memory Firewall, PPMF),一种轻量级记忆中间件,它保留平台维护的来源信息,并通过将动作风险与相关记忆的权威级别匹配来授权工具调用。在基于固定风险策略的schema化评估中,易受攻击的整合记忆攻击成功率(ASR)高达1.000;而在保留完整平台来源、确认信息和风险标签的情况下,所有未授权的危险动作均无法通过PPMF门控,同时已确认的良性动作和受控的低风险记忆使用仍可执行。该论文适合研究LLM智能体安全、记忆系统设计以及安全中间件开发的从业者和研究者阅读。
💡 推荐理由: LLM智能体长期记忆的信任边界缺失可能导致未授权操作,该研究揭示了一种新型的提示注入变体,并提供了实用防御中间件,对构建安全代理架构有直接借鉴意义。
🎯 建议动作: 研究跟进