该论文研究分布式场景下的差分隐私(DP)文本合成问题。现有 DP 文本合成流程普遍假设存在一个可信的中央策展方(trusted curator),能够直接访问用户原始文本并进行集中式处理;但在真实的多用户分布式环境中,这一信任与访问假设往往不成立。若把集中式方案生硬地迁移到分布式环境,通常需要用户反复参与并保持严格同步,带来显著的通信与协调开销,实用性较差。 为填补这一空白,作者提出一种差分隐私与密码学的协同设计(DP–cryptography co-design),目标是在不依赖可信策展方的前提下完成文本合成,同时把用户侧参与降到轻量级。方案由两个经过优化的组件构成。第一个是面向分布式的 DP 合成算法:它在嵌入空间中一次性发布 DP 摘要,具体做法是识别出现频率较高的语义区域,并发布这些区域的 DP 质心(centroid),从而支持无需训练、非迭代的离线文本合成,用户只需一次性提交信息即可。该算法还引入“语义支撑保护”(semantic support protection),确保发布的摘要尽量避开低频文本所在的语义邻域,以降低稀有用户数据被暴露的风险。第二个是定制的安全协议,在分布式用户数据之上实现上述算法,在无可信策展方的情况下仍能提供端到端的 DP 保证。 作者在四个基准数据集上进行了评估,结果显示其效用与当前最先进的集中式 DP 文本合成方法相当,说明在更弱的信任假设下也能达到可接受的可用水平。该工作适合研究差分隐私、隐私保护机器学习、联邦/分布式学习以及安全多方计算方向的研究者与隐私工程实践者阅读。
💡 推荐理由: 多数 DP 文本合成方案默认存在可信中央方,与联邦/分布式场景的现实不符。该工作用 DP 与密码学协同设计消除可信第三方假设,并把用户参与降为一次性轻量提交,为跨机构、跨设备的隐私数据共享与合成数据发布提供了可参考的架构思路。
🎯 建议动作: 研究跟进:评估将该类分布式 DP 文本合成方案纳入内部隐私数据共享或合成数据发布管道的可行性,重点关注信任模型与低频语义泄露防护。