本文研究拆分学习(Split Learning, SL)场景下的隐私泄露风险,提出了一种名为 SDAR 的新型被动推理攻击框架。拆分学习被视为传统联邦学习的实用高效替代方案,客户端在本地保留部分模型层(即私有模型)并只与服务器交换中间表征,但已有研究表明恶意或好奇的服务器仍可能推断客户端私有数据。然而,以往攻击方法往往依赖过强假设(如拥有大量同分布辅助数据或可控训练流程)或仅针对易受攻击的简单模型,实用性受限。作者假定服务器是诚实但好奇(honest-but-curious)的,即服务器严格遵循协议但试图从收到的中间表征中学习客户端私有信息。SDAR 的核心思想是利用辅助数据通过对抗正则化(adversarial regularization)学习一个客户端私有模型的可解码模拟器:该模拟器在训练阶段拟合客户端模型的行为,同时借助对抗约束迫使编码结果保留与私有特征/标签相关的信息,从而在推理阶段仅凭中间表征即可重构客户端私有特征;在 U 型拆分学习(U-shaped SL)配置下还可同时推断标签。作者在标准配置和 U 型配置下进行了大量实验,验证了攻击的有效性。实验结果显示,在现有被动攻击难以有效重构私有数据的挑战性场景中(如深层拆分点),SDAR 的重构性能显著优于已有被动攻击,甚至可媲美主动攻击。具体而言,在 CIFAR-10 数据集上,当拆分深度为 7 时,SDAR 在标准 SL 和 U 型 SL 下均能将私有特征重建的平均平方误差降至 0.025 以下,并且在 U 型设置下标签推断准确率超过 98%,而现有攻击方法在此设定下无法产生非平凡结果。本文的研究贡献在于揭示拆分学习在更现实假设下的严重隐私漏洞,对设计安全的拆分学习协议具有警示意义。适合关注机器学习隐私、联邦学习/拆分学习安全的研究人员及安全工程师阅读。
💡 推荐理由: 拆分学习被视为隐私保护技术,但本文证明在诚实但好奇的服务器假设下,仅凭公开的中间表征即可高精度重构私有数据,甚至优于已有攻击。安全从业者应重新评估拆分学习在实际部署中的隐私边界,尤其是深层拆分场景。
🎯 建议动作: 研究跟进