本文提出 S-BDT,一种新颖的 (ε, δ)-差分隐私分布式梯度提升决策树(GBDT)学习器。研究核心问题是在分布式机器学习环境中,如何在不牺牲模型效用(如准确率或回归误差)的前提下,增强对单个训练数据点的隐私保护。传统差分隐私方法通常通过添加噪声来扰乱模型,但噪声过大会影响模型性能。S-BDT 的主要创新在于使用非球形多元高斯噪声而非各向同性噪声,从而在相同隐私预算下减少所需噪声量。作者推导了该噪声分布下紧密的采样下界,用于隐私放大分析,并将其整合进 Rényi 差分隐私滤波器,实现个体级别的隐私核算,使得隐私预算的分配更加精细。实验在多个基准数据集上验证了方法的有效性:在 Abalone 回归数据集(约4千样本)上,当 ε ≤ 0.5 时,达到相同效用的同时节省 50% 的 epsilon;在 Adult 分类数据集(约5万样本)上,当 ε ≤ 0.08 时节省 30% epsilon;在 Spambase 分类数据集(约5千样本)上,当 ε ≤ 0.03 时节省 30% epsilon。此外,论文还考虑了数据流来自不同子群体(非独立同分布)的场景,显示 S-BDT 能进一步增加 epsilon 的节省。这项工作的贡献包括:提出新的噪声机制,改进隐私核算方法,并在多种数据集和设置中证明其优势,为差分隐私机器学习提供了更高效的解决方案。
💡 推荐理由: 差分隐私是保护训练数据隐私的关键技术。S-BDT 在保持模型效用的同时显著降低隐私预算消耗,为在敏感数据(如用户行为、网络流量)上训练决策树模型提供了更实用的隐私保护方案,具有实际部署价值。
🎯 建议动作: 研究跟进