本文首次系统研究了神经网络剪枝过程中的隐私风险,特别是成员推理攻击(Membership Inference Attacks)的影响。作者指出,现有的剪枝研究主要关注如何在保持模型精度的同时提高稀疏性,但忽略了剪枝可能带来的训练数据记忆化风险。通过实验,他们发现剪枝过程会导致模型在成员(训练集数据)和非成员(非训练集数据)上的预测行为产生差异(即预测发散),并且这种发散在不同类别上表现不同。基于此观察,作者提出了一种基于自注意力机制的成员推理攻击方法,专门针对剪枝后的神经网络。该攻击利用剪枝导致的预测发散,通过自注意力权重聚焦于发散显著的样本,从而更准确地推断数据是否属于训练集。实验表明,该方法在多个剪枝方法、稀疏度水平和攻击知识假设下,均优于现有的八种成员推理攻击。此外,作者还提出了一种基于KL散度的防御机制,通过最小化剪枝前后模型预测分布的差异来缓解预测发散,从而保护隐私。实验证明,该防御在保持模型稀疏性和精度的同时,有效降低了成员推理攻击的成功率。该研究适合AI安全研究人员、隐私保护工程人员以及模型压缩领域的从业者阅读。
💡 推荐理由: 模型剪枝广泛用于边缘部署,但本文揭示其可能加剧数据记忆,导致训练数据隐私泄露。对设计隐私友好的模型压缩方案至关重要。
🎯 建议动作: 研究跟进