本文针对长期记忆型大语言模型(LLM)代理中的隐私泄露问题展开研究。作者指出,虽然用户从未明确陈述受保护属性(如健康状况、政治倾向等),但代理在多次交互中基于长期记忆生成的条件响应,可能累积性地泄露这些属性。作者将该威胁形式化为“自适应转录隐私”(adaptive transcript privacy),即攻击者通过观察整个交互转录,不断调整先验信念,最终推断出敏感属性。为缓解这一风险,论文提出 DP-MemView——一个面向内存接口的差分隐私层,其核心思想是:不把原始记忆直接暴露给响应 LLM,而是通过一个受差分隐私保护的“视图选择”机制,仅向响应模型提供用于生成公开响应的条件视图。每个视图选择都会针对其读取集合所覆盖的每个受保护属性组进行“记账”(即扣除隐私预算);每个属性账本一旦超过预置上限,后续相关选择会被阻止,并返回一个固定的通用视图,从而在机制上限制累积泄露。作者在显式接口契约下证明了整个自适应转录满足纯 B_a-DP(一种针对贝叶斯攻击者的差分隐私变体),并将结论扩展到多个受保护组存在差异的存储场景,同时给出了观测转录对攻击者先验几率改变的上界。实验部分使用三个不同的响应 LLM,在受控的相邻存储基准和公共语料迁移测试上进行评估,验证了在线与预分配两种模式。结果表明,两种模式都能将转录可分性压低到接近随机猜测,同时保持目标所需的个性化和整体响应质量。进一步的诊断实验显示,若移除关键保护机制(如账本计费、视图约束等),会导致输出支持不匹配、缺失账本计费、暴露侧信道或产生长程泄露累积。总体而言,该工作为长期记忆 LLM 代理提供了一种可证明隐私保障的接口设计,对隐私保护型代理系统的开发具有重要参考价值。
💡 推荐理由: 长期记忆 LLM 代理的隐私泄露是现实且难以察觉的风险;本文首次将差分隐私引入记忆视图接口,为在保持个性化能力的同时提供可证明的隐私保证提供了新思路,对安全工程师设计隐私合规的智能代理有直接启发。
🎯 建议动作: 研究跟进