该论文研究了基于局部组合(local combination)方法的合成数据生成技术所导致的隐私泄露风险。合成数据被视为在敏感场景下共享数据的一种有前景的解决方案,但近年来的隐私攻击研究表明,尤其是那些不基于差分隐私等正式隐私框架的合成数据生成方法,仍然存在显著的残余风险。本文重点关注三种局部组合方法:SMOTE、Simulant 和 Avatar,它们近期被用于医疗健康领域以分享“匿名化数据”。作者对这些方法进行了系统性的隐私分析,实施了多种攻击手段,包括成员推断攻击、链接攻击和重建攻击。实验结果表明,这三种方法均存在实质性的隐私泄露,这严重质疑了该类合成数据输出在实践中是否应被视为匿名。论文的核心贡献在于:第一,明确了局部组合合成数据方法在多种隐私攻击下的脆弱性;第二,通过统一的攻击框架对三种代表性方法进行了横向对比;第三,为合成数据的隐私评估提供了实证依据。该研究适合数据隐私研究人员、合成数据开发人员以及依赖合成数据进行数据共享的机构(尤其是医疗健康领域)阅读,以认识局部组合方法的隐私边界。”
💡 推荐理由: 合成数据常被认为是隐私保护的‘银弹’,但本文证明局部组合方法(如 SMOTE、Simulant、Avatar)即使在非差分隐私场景下也会显著泄露训练数据隐私,直接影响医疗等领域的数据共享决策。
🎯 建议动作: 研究跟进:若组织正在使用或考虑使用局部组合合成数据方法,应评估其隐私风险并优先考虑采用差分隐私等可证明隐私保护技术。