该论文聚焦于差分隐私(DP)在合成数据生成中隐私与统计保真度的权衡问题。现有方法通常间接利用公开数据,例如通过预训练生成模型或匹配公共数据集估计的目标统计量,并依赖领域无关的DP机制。本文开创性地提出将公开数据直接融入DP机制本身的理论框架。作者将归一化直方图作为分布估计器,并在特定DP机制类中刻画了渐近最优的领域感知隐私机制。他们提出了PubMix,一种感知公开数据的DP机制,可用于基于直方图的数据合成管线。实验表明,与领域无关的隐私机制相比,PubMix显著提升了合成数据生成质量。该工作为利用公开数据改进合成数据隐私-效用权衡提供了严格的理论基础和实用方法。适合对差分隐私、合成数据、隐私保护机器学习感兴趣的研究人员和从业者阅读。
💡 推荐理由: 为合成数据中的差分隐私机制设计提供了新的理论方向,通过直接整合公开数据实现更优的隐私-效用权衡,对隐私保护数据发布有重要指导意义。
🎯 建议动作: 研究跟进