本文针对差分隐私零阶优化(DP-ZO)在大语言模型(LLM)微调中的局限性,提出了一种噪声感知的自适应收缩方法 SAGE。DP-ZO 仅利用前向传播评估即可实现内存高效的私有微调,是当前隐私保护 LLM 微调的重要技术路线。然而,现有基于聚合的 DP-ZO 方法以固定尺度重建模型更新,忽略了训练过程中有用信号强度的动态变化,导致噪声主导的更新可能被过度加权,从而损害模型效用。SAGE 的核心思想是根据私有化估计的信号质量进行自适应衰减:它从观测到的二阶矩中减去已知的高斯噪声方差来估计潜在信号能量,通过时间追踪稳定该估计,并将当前信噪比与预热参考值比较,从而推导出有界收缩因子。作为纯后处理方法,SAGE 不消耗额外的隐私预算或模型查询,仅引入恒定的额外状态量。理论分析表明,收缩使得二次更新风险项的下降速度快于线性下降项,从而在保留有用下降方向的同时,限制噪声主导更新的影响。实验在 RoBERTa-large、OPT-1.3B 和 OPT-6.7B 上验证,在相同隐私预算下,SAGE 在大多数设置中优于现有基线,同时保持了 DP-ZO 仅前向传播的内存效率。该研究为差分隐私大模型微调提供了更鲁棒的更新策略,适合关注隐私保护机器学习、尤其是 LLM 隐私微调的研究人员和工程师阅读。
💡 推荐理由: 该研究提升了大模型隐私微调中差分隐私与模型效用的平衡,SAGE 作为纯后处理方案无需额外隐私预算,易于集成到现有 DP-ZO 流程,对隐私保护 NLP 应用有直接参考价值。
🎯 建议动作: 研究跟进