#distributed-learning

共收录 5 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Ergute Bao, Hongyan Chang, Ali Shahin Shamsabadi, Ting Yu, Xiaokui Xiao

该论文研究分布式场景下的差分隐私(DP)文本合成问题。现有 DP 文本合成流程普遍假设存在一个可信的中央策展方(trusted curator),能够直接访问用户原始文本并进行集中式处理;但在真实的多用户分布式环境中,这一信任与访问假设往往不成立。若把集中式方案生硬地迁移到分布式环境,通常需要用户反复参与并保持严格同步,带来显著的通信与协调开销,实用性较差。 为填补这一空白,作者提出一种差分隐私与密码学的协同设计(DP–cryptography co-design),目标是在不依赖可信策展方的前提下完成文本合成,同时把用户侧参与降到轻量级。方案由两个经过优化的组件构成。第一个是面向分布式的 DP 合成算法:它在嵌入空间中一次性发布 DP 摘要,具体做法是识别出现频率较高的语义区域,并发布这些区域的 DP 质心(centroid),从而支持无需训练、非迭代的离线文本合成,用户只需一次性提交信息即可。该算法还引入“语义支撑保护”(semantic support protection),确保发布的摘要尽量避开低频文本所在的语义邻域,以降低稀有用户数据被暴露的风险。第二个是定制的安全协议,在分布式用户数据之上实现上述算法,在无可信策展方的情况下仍能提供端到端的 DP 保证。 作者在四个基准数据集上进行了评估,结果显示其效用与当前最先进的集中式 DP 文本合成方法相当,说明在更弱的信任假设下也能达到可接受的可用水平。该工作适合研究差分隐私、隐私保护机器学习、联邦/分布式学习以及安全多方计算方向的研究者与隐私工程实践者阅读。

💡 推荐理由: 多数 DP 文本合成方案默认存在可信中央方,与联邦/分布式场景的现实不符。该工作用 DP 与密码学协同设计消除可信第三方假设,并把用户参与降为一次性轻量提交,为跨机构、跨设备的隐私数据共享与合成数据发布提供了可参考的架构思路。

🎯 建议动作: 研究跟进:评估将该类分布式 DP 文本合成方案纳入内部隐私数据共享或合成数据发布管道的可行性,重点关注信任模型与低频语义泄露防护。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xavier Martínez-Luaña, Alba Gude-Santos, Manuel Fernández-Veiga, Rebeca P. Díaz-Redondo

本文提出了一种模型无关的对抗抵抗分布式学习框架,旨在同时解决分布式机器学习中的隐私泄露和恶意操纵问题。传统方法通常分别处理这些威胁,且往往针对特定学习范式或模型架构,限制了实际部署的适用性。该框架结合了范式特定的防御机制与GPBACC(一种隐私增强的编码计算技术),可应用于任意机器学习模型。对于联邦学习,采用鲁棒聚合策略减轻恶意参与者的影响;对于去中心化学习,利用近似解码-比较和组测试技术实现轻量级验证和对手隔离,无需依赖可信聚合器。通过攻击驱动的显式分析,实现了代表性隐私攻击和恶意行为,实验表明GPBACC与鲁棒聚合及验证机制的组合显著降低了隐私泄露并提高了对主动对手的韧性。研究结果为安全分布式机器学习提供了实用且可部署的基础。适合分布式系统安全、隐私保护机器学习方向的研究人员阅读。

💡 推荐理由: 首次提出在联邦学习和去中心化学习两种范式下统一对抗隐私攻击和恶意行为的框架,为实际部署安全分布式学习系统提供了理论支撑和可行方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Thomas Boudou, Batiste Le Bars, Nirupam Gupta, Aurélien Bellet

该论文研究了在拜占庭鲁棒分布式学习场景下,本地差分隐私(LDP)对模型泛化误差的影响。现有工作已证明在分布式学习中,拜占庭鲁棒性、LDP和优化误差之间存在基本的三难困境。然而,本文发现这一三难困境并非普遍适用于泛化误差,而是关键取决于隐私强度。具体而言,在高噪声(强隐私)区域,作者证明增加隐私实际上会降低泛化误差,即鲁棒性与隐私之间不存在冲突;而在低噪声(弱隐私)区域,两者之间的冲突重新出现,增加隐私确实会损害泛化。通过推导LDP约束下拜占庭鲁棒分布式学习的算法稳定性上下界,论文从理论上解释了泛化误差的这种非单调行为,并通过实验验证了理论发现。该结果对于设计兼顾鲁棒性、隐私和泛化性能的联邦学习系统具有重要指导意义。

💡 推荐理由: 揭示了拜占庭鲁棒与隐私之间复杂关系,挑战了现有的三难困境认知,为设计更优的联邦学习安全策略提供理论依据。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Erdenebileg Batbaatar, Young Yoon

本文提出了一种名为 TL++ 的双模式遍历学习框架,旨在解决分布式智能系统在数据孤岛下训练时的准确性与隐私保护问题。传统的联邦学习虽然保持数据本地化,但在异构分区下性能下降且需要反复交换完整模型;拆分学习通过切割层激活值减少通信,但通常无法恢复集中式小批量梯度行为,且可能以明文暴露激活值和梯度。TL++ 包含两种模式:基础模式仅交换切割层激活值和梯度而非完整模型,显著降低通信开销;安全模式通过秘密共享将每个切割层激活值和梯度在编排器与非共谋辅助服务器之间分割,防止任一服务器观察到明文切割层张量,但此保护限于半诚实两服务器设置,且标签和损失相关输出对编排器可见。在轻量级安全路径中,线性或仿射服务器路径可实现精确性,非线性操作需借助非线性 MPC 或近似。论文在 CIFAR-10 和 BioGPT/PubMedQA 数据集上使用全微调和 LoRA 方法评估,与联邦学习和拆分学习基线对比。结果表明,TL++ 基础模式切割层1和精确安全模式切割层3在 CIFAR-10 上分别达到 91.41% 和 90.93% 的准确率,超过最强非 TL++ 基线 12 个百分点以上;基础模式每步通信量相比完整模型同步减少 13.1 倍。PubMedQA 结果同样支持 TL++ 优势。总体而言,TL++ 接近集中式训练性能,同时减少通信并提供激活层秘密共享的隐私保护。

💡 推荐理由: 为分布式数据孤岛环境下的模型训练提供了兼顾高准确率、低通信开销和激活层隐私保护的新方案,对安全从业者设计隐私保护机器学习系统具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stefan Behfar, Richard Mortier

本文针对边缘设备上小语言模型(SLM)分布式微调面临的安全挑战,提出了一种基于模型多样性的系统级防御机制。研究背景是,随着边缘机器学习的发展,语言模型在移动和物联网设备上的分布式部署虽能保护隐私并实现实时响应,但不可信或异构的边缘节点可能注入恶意更新,导致模型被悄悄操纵或收敛性能下降。传统防御方法(如鲁棒聚合或时间异常检测)依赖单一全局模型,难以检测协同性、持续性投毒攻击。核心方法:作者提出不维护单一全局模型,而是轮换或并行训练多个小语言模型(如DistilGPT-2),每个模型由独立采样的边缘节点子集更新。这些模型遵循不同的训练轨迹,形成对同一分布式数据分布的多个独立视图。通过梯度相似性、损失演化或参数方差量化模型间的差异,当某个模型显著偏离集成均值时,系统标记其贡献节点进行隔离或权重重新分配。实验在边缘规模仿真环境下,针对SLM训练的不同异构性和攻击条件进行评估。结果表明,与经典单模型防御(如Flanders和鲁棒方法)相比,模型多样性能够更早、更可靠地检测投毒攻击。主要贡献:证明了模型演化多样性可以作为一种实用且有效的防御机制,保障资源受限边缘设备上的安全分布式学习。适合对分布式机器学习安全、边缘计算、鲁棒聚合感兴趣的读者。

💡 推荐理由: 边缘设备上的分布式学习安全是蓝队需关注的新兴威胁面;本文提出的模型多样性防御不依赖强假设,可有效检测投毒攻击,为资源受限场景提供实用方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)