协作机器学习允许金融机构在不直接共享数据的情况下共同训练模型,但必须同时满足群体公平性和对抗鲁棒性。然而,现有的公平性感知聚合方法在形式上容易受到“公平性投毒”攻击:恶意客户端可以在保持模型准确性的同时最大化群体差异(例如不同组间的等机会差异),从而规避基于准确性的拜占庭防御机制。论文还指出,FairFed 这类基于公平性差距加权的方案可以被能够观测全局公平性分数的攻击者所利用。针对这一威胁,作者提出了 Fairis,一种服务器端的重新加权方案,其核心思想是根据每个客户端本地报告的等机会差异(Equal Opportunity Difference, EOD)计算未归一化权重 w̄_k = η - F_k,其中 F_k 为本地 EOD(范围0到1),η>1 为安全参数;随后通过归一化得到最终权重 ω_k = w̄_k / Σ_j w̄_j。该方法保证每个客户端获得严格正的权重,同时使恶意客户端的权重随其报告的偏差单调减少。论文证明了三个关键性质:单调权重减少(MWR)、人口参与和不可博弈性,并将 MWR 扩展至多个客户端串通的少数人联盟场景。进一步地,结合服务器端范数裁剪,可证明对手对全局模型的位移被限制在 ω_0 C 以内,且该界限随对手自身报告的偏差严格递减。需要注意的是,该方法依赖于客户端诚实上报公平性分数的假设,这一假设在论文中并未得到解决。实验表明,在台湾信贷数据集上,面对一个足够隐蔽、能绕过基于准确性防御的对手(其模型准确性与良性客户端仅差0.04以内),Fairis 能将其权重比不区分大小的控制策略降低41%至54%。但在常规非独立同分布(Non-IID)数据分割下,没有任何规则占据主导地位。消融实验证明,遏制效果取决于对手的分数与诚实客户端平均值的差距;如果诚实群体本身就不公平,则遏制作用失效。
💡 推荐理由: 该研究揭示了协作学习中的新型安全威胁——公平性投毒,现有公平性聚合方案并不安全。Fairis 提供了具有理论保证的防御思路,对金融等对公平性和鲁棒性要求高的行业有直接参考价值。安全从业者应关注多客户端场景下恶意参与者如何通过操纵公平性指标影响全局模型。
🎯 建议动作: 研究跟进