该论文提出 MutMem,一个用于持久化智能体内存的授权变更协议,并集成在 HOM-AIMOS 持久化内存引擎中。核心问题在于:持久化内存需要根据后续结果调整早期证据,但可变的检索权重会引发“归因问题”——审查者必须区分经授权的自适应变更与数据库篡改。MutMem 通过保留内存内容、记录带签名的正面和负面结果证据(无年龄过期)、并将每个非平凡权重变更作为“管家授权”的转换提交来解决该问题。每个转换绑定一个终端溯源节点、签名者时期、量化后的新旧权重、无分叉前驱,以及两个域分离的 SHA-256 承诺。Ed25519 验证在数据库写入器和便携验证器中均执行。被分类为“疑似中毒”的内容会被保留,并附带可修订的签名标签,召回时作为信任证据。实验方面:HOM-AIMOS 在 LongMemEval 上通过 LLM 评判正确回答 459/500(91.8%);在 LoCoMo 上获得 74.12% 的评判准确率,并在另一个上游兼容协议下获得 58.20 的 token F1。原生测试套件通过所有声明的授权、拓扑、篡改、签名者时期和变更后召回测试;签名转换的中位延迟为 4.865 毫秒。在声明 N=100 的 PoisonedRAG 适应实验中,受攻击的前 5 披露中未出现注入毒样本(0/100;95% Wilson 置信上限 3.70%),而在 98 个干净阴性目标中,诱导目标答案攻击成功率为 1/98(1.02%)。一项预注册的四臂消融实验将检索减少归因于签名存储标签:当绕过认知策略时,检索器为 94/100 个目标选择毒样本;恢复标签后为 0/100。MutMem 提供了完整性、授权、可追溯性和历史连续性的证据,但不建立内容真理性。该研究适合关注 LLM 智能体内存安全、数据完整性和投毒防御的研究人员与安全工程师。
💡 推荐理由: 该研究解决了 LLM 持久化内存中授权变更与篡改难以区分的问题,为智能体内存的完整性审计和投毒防御提供了可验证的密码学协议,是 agent 安全领域的重要进展。
🎯 建议动作: 研究跟进