本文提出了一种针对联邦学习(Federated Learning, FL)中梯度反演攻击(Gradient Inversion Attack)的新型防御方法 AEGIS(Attention-Embedding Gradient Isolation Shield)。在联邦学习的协作训练场景下,参与方共享模型梯度以更新全局模型,但攻击者可以从共享的梯度中重建出参与方的私有训练文本,造成严重隐私泄露。作者通过对 Transformer 梯度结构的深入分析,识别出三条私密令牌(token)信息泄露的通道:通道1为注意力输出投影(attention output projection)的梯度,其暴露了一个低秩子空间,该子空间编码了输入嵌入(embedding)信息;通道2为嵌入层梯度的行范数稀疏性,直接揭示了哪些令牌出现在训练样本中;通道3为 MLP 扩展层的梯度,携带了与通道1类似的可恢复子空间信号。现有的防御方法大多只针对其中一条通道进行防护,且往往以牺牲模型效用为代价,或遗留了其余结构信号。AEGIS 是一种轻量级防御,它通过三条反向传播路径上的操作同时封堵上述三个分析通道,且不需要改变模型架构。具体措施包括:冻结注意力投影参数,从构造上消除通道1;在嵌入梯度中注入校准噪声,破坏通道2的令牌存在性信号;在 MLP 扩展梯度中注入逐块(per-block)噪声,掩盖通道3。这些被掩蔽的梯度同时用于本地优化器步骤和服务器导出,因此两侧均不保留干净信号。作者在 11 个模型和 6 个数据集上进行了广泛评估,结果表明 AEGIS 能针对多种梯度反演攻击(包括分析型和基于优化的攻击)将令牌恢复率降至接近零,同时保持或提升模型效用。此外,论文为通道1和通道2提供了形式化保证,并通过完全了解防御机制的自适应攻击者实验验证了整体防御的有效性。该研究适合关注隐私保护机器学习、联邦学习安全以及大语言模型微调隐私风险的研究人员和工程师阅读。
💡 推荐理由: 联邦学习中的梯度共享存在严重隐私泄露风险,尤其当微调大语言模型时,攻击者可近乎完美地重建私有文本。AEGIS 首次系统性地封堵三条梯度泄露通道,且不损害模型效用,为隐私保护的联邦LLM微调提供了实用方案,值得安全与隐私从业者关注。
🎯 建议动作: 研究跟进