本文是一篇系统化知识综述(SoK),旨在系统评估合成图像能否替代真实图像数据在机器学习中的应用,重点分析了合成图像的效用(utility)与隐私保护(privacy)之间的权衡。研究首先梳理了当前主流的合成图像生成方法,包括生成对抗网络(GANs)、变分自编码器(VAEs)、扩散模型(Diffusion Models)等,并比较了它们在保真度、多样性和可控性方面的差异。随后,论文提出了一个统一的评估框架,从下游任务性能(如图像分类、分割、检测)、数据多样性与分布覆盖、以及隐私泄露风险(如成员推断攻击、属性推断攻击、模型逆向攻击)三个维度对合成图像进行量化测评。通过对大量已有实证研究的元分析,作者发现:合成图像在多数标准化基准任务上可以接近甚至达到真实图像的性能,但在分布外泛化、细粒度识别和长尾类别上仍存在明显差距;隐私方面,即使采用差分隐私训练,合成图像仍可能泄露训练数据的敏感特征。论文还讨论了身份保护、数据去标识化、以及用于联邦学习的合成数据等前沿场景。最终结论是:合成图像在低隐私风险场景下可作为真实数据的可行替代,但在高安全性要求或边缘分布任务中仍需谨慎使用。本文为安全从业者提供了关于合成数据风险收益的全面参考。
💡 推荐理由: 合成图像广泛应用于模型训练、数据增强和隐私保护,但能否安全替代真实数据尚无定论。该综述系统量化了效用与隐私的权衡,对蓝队评估是否采用合成数据、理解潜在泄露风险具有直接指导意义。
🎯 建议动作: 研究跟进