差分隐私图像合成旨在从敏感数据集中生成合成图像,缓解组织共享和使用合成图像时的隐私泄露问题。现有方法(如使用差分隐私随机梯度下降训练扩散模型)虽然取得进展,但性能仍不理想。受课程学习启发,本文提出一种两阶段差分隐私图像合成框架,让扩散模型从易到难地学习生成差分隐私图像。第一阶段为“简单阶段”,模型先学习敏感图像的简单特征;为此提出使用“中心图像”——即随机采样敏感数据集的聚合结果。这些中心图像虽不展示细节,但能体现所有图像的有用特征,且仅消耗极小的隐私预算,有助于模型早期训练。第二阶段再使用DP-SGD训练完整模型。实验在四个图像数据集上平均表明,合成图像的保真度和效用指标分别比当前最优方法提升33.1%和2.1%。论文提供了可复现的代码和数据集。
💡 推荐理由: 差分隐私图像合成是隐私保护数据共享的关键技术,本方法显著提升了合成图像质量,降低了隐私预算消耗,对需要安全共享敏感图像的组织具有重要参考价值。
🎯 建议动作: 纳入内部评估