本文研究大语言模型(LLM)中记忆与提取现象的度量问题。长期以来,模型记忆的定义繁多且关系不明,差分隐私(DP)常被当作同时控制所有记忆形式的统一代理。作者针对实际应用中最重要的两类定义——反事实记忆(counterfactual memorization)与自适应提取(adaptive extraction)——给出了精确的 DP 常数,并证明这两者并不能互相约束。具体地,在 f-DP 框架下,任何带有列表预算 m 的自适应提取协议的成功概率至多为 1-f(κ)(其中 κ 为无遗忘基线),该界在一组稠密基线上是紧的;这意味着 DP 对提取的控制本质上取决于秘密先验可猜测的程度。进一步地,最小熵提供了一个分布无关的保证:在纯 ε-DP 下,只要 H_∞ ≥ ε log₂ e + log₂(m/τ),提取风险就低于 τ≤1/2,且在均匀先验上该界精确。在记忆侧,f-DP 将任何有界得分的反事实记忆限制在优势泛函 η(f) 内,纯 DP 下等于 tanh(ε/2);对于 k≥2 份重复副本,朴素的 ε↦kε 界不可达,精确常数是一个由几何噪声计数达到的闭式阶梯函数。该上限在实际使用的局部得分类中达到,并在此处两种度量发生分离:一种机制被记忆却不可提取,另一种完全可提取但对所有基于损失的得分不可见。由此在基于损失的审计与遗忘验证中产生双侧盲点,该盲点在十亿参数模型上依然存在:一个保留触发器的模型发布可以通过单个提示逐字恢复,而实践者部署的审计却判定其完全干净。论文的贡献在于精确刻画记忆与提取的差分隐私边界,揭示了两者的非等价性以及现有审计方法的固有缺陷,为 LLM 隐私评估提供了新的理论基础。
💡 推荐理由: 该研究揭示基于损失的记忆审计和遗忘验证存在结构性盲点,可能导致严重的隐私泄露在现有检测手段下被忽视。它为安全团队重新评估 LLM 隐私保护提供了关键理论依据,提醒审计方法需要多元信号而非仅依赖损失函数。
🎯 建议动作: 研究跟进