本文研究了差分隐私(DP)在合成数据生成中的固有权衡:隐私保护与统计保真度之间的矛盾。现有方法虽然利用公共数据来改善这一权衡,但通常仅在预处理(如使用预训练生成模型)或后处理(如匹配从公共数据集估计的目标统计量)中间接使用公共数据,而依赖领域无关的DP机制。本文提出了一个理论框架,将公共数据原则性地整合到DP机制本身中。作者将归一化直方图作为分布估计器,并在特定类别的DP机制内刻画了渐近最优的域感知隐私机制。具体地,他们提出了PubMix,一种公共数据感知的DP机制,可用于基于直方图的数据合成流水线。实验表明,与领域无关的隐私机制相比,PubMix显著提升了合成数据生成的质量。该工作为利用公共数据改进差分隐私合成数据提供了理论基础和实用方法。
💡 推荐理由: 本文首次理论化地将公共数据嵌入到DP机制设计本身,而非仅作为预处理或后处理,为合成数据中的隐私-效用权衡优化提供了新范式,对DP实践者有指导意义。
🎯 建议动作: 研究跟进