本论文针对大语言模型(LLM)量化是否能够降低隐私风险的问题展开研究。现有相关研究几乎全部使用成员推断(membership inference)来衡量隐私,但作者认为这并非大多数人所关心的实际风险:人们真正担心的是模型逐字复现训练数据。为此,本文直接度量了逐字提取(verbatim extraction)这一风险。实验使用 Pythia 模型以及每个模型已知被记忆的公共序列,在从全精度到四比特的五个精度级别、三种模型规模下,追踪逐字提取的比例,同时测量困惑度以评估通用能力。主要发现有两方面:第一,量化是一种选择性遗忘器——在每种精度和模型规模下,逐字记忆的下降速度都快于能力下降,并且该结论在两种不相关的量化算法和两个评估语料库下均成立;第二,这种选择性不足以使量化成为隐私防御手段,这与先前成员推断研究结果的乐观解读相矛盾。在最大规模的模型中,四比特量化仍能复现大部分记忆序列,而能力仅下降几个百分点,且量化后存活的记忆数据比例随模型规模增大而增加。作者得出结论:压缩不应被视为移除记忆训练数据的方法,提取(extraction)而非成员推断才是实践者应关注的指标。所有代码、采样评估数据和逐配置结果均已公开。
💡 推荐理由: 该研究打破了“量化可缓解隐私风险”的乐观认知,指出量化在较大模型中会保留大部分可提取数据,对依赖量化作为隐私保护手段的 LLM 部署方具有警示意义。
🎯 建议动作: 研究跟进