#split-learning

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Akarsh K. Nair, Muhammad Arifur Rahman, David Brown, Mufti Mahmud

本文研究分割学习中的隐私泄露问题,提出了一种基于拓扑复杂性(persistent Betti complexity)的隐私感知分割学习框架。分割学习通过将神经网络在客户端和服务器之间分割来实现协作训练,但不当的分割点会导致中间表示泄露敏感信息(如特征反转攻击和梯度泄漏)。作者通过逐层分析发现,隐私风险在神经网络层间高度不均匀,存在尖锐的过渡区域,仅靠网络深度无法捕捉。具体而言,在更深的隐私关键分割点,特征反转的保真度可从可忽略的重建提升至SSIM高达0.98。进一步实验表明,Betti复杂度能够一致地识别出与高风险特征空间隐私泄露相关的表示区域。基于此观察,本文提出BettiSafe,一种无需显式执行攻击即可识别隐私敏感层的拓扑引导分割选择策略。与基于深度的启发式方法相比,BettiSafe将特征反转抵抗能力提升2至5倍,同时保持分类准确率。此外,基于Betti的正则化方法在不降低模型效用的前提下,将反转难度提升近5倍,实现了有利的隐私-效用权衡。总体而言,本文表明拓扑复杂度可作为安全、自适应且表示感知的分割学习的结构性描述符,适用于现实世界的协作系统。

💡 推荐理由: 分割学习是一种流行的隐私保护协作训练范式,但现有分割策略常忽略中间表示的隐私风险。本文引入拓扑复杂性分析,无需攻击模拟即可指导安全分割,显著提升了隐私防御能力,对联邦学习和边缘智能场景有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiayun Fu, Xiaojing Ma 0002, Bin B. Zhu, Pingyi Hu, Ruixin Zhao, Yaru Jia, Peng Xu 0003, Hai Jin 0001, Dongmei Zhang 0001

该论文研究分割学习(Split Learning)场景下的劫持攻击防御问题。分割学习是一种分布式机器学习范式,允许多个参与方在不共享原始数据的情况下协作训练模型,但存在安全漏洞:攻击者可能劫持模型参数或梯度,窃取敏感信息。作者提出了一种名为“Pinocchio's Nose”的梯度审查器(Gradients Scrutinizer),通过利用内在属性(intrinsic attributes)来检测和防御分割学习中的劫持攻击。具体地,该方法从梯度中提取统计特征(如均值、方差、高阶矩等),并基于这些特征构建分类器,以区分正常梯度与被劫持的恶意梯度。实验在多个数据集(如CIFAR-10、MNIST、ImageNet)和模型架构(如ResNet、VGG)上进行,结果表明该方法能够以高精度检测多种劫持攻击(包括替换、添加噪声、反向梯度等),且对模型训练性能的影响极小。核心贡献包括:(1) 首次从梯度内在属性角度系统分析分割学习劫持攻击的可检测性;(2) 设计轻量级、模型无关的防御机制,无需修改训练协议;(3) 在多种攻击场景下验证了方法的有效性和鲁棒性。该研究为分割学习的安全部署提供了实用的检测工具。

💡 推荐理由: 分割学习广泛应用于医疗、金融等隐私敏感场景,但劫持攻击可导致数据泄露。该论文提出了首个基于梯度内在属性的通用检测方法,能高效识别多种攻击,填补了该领域的防御空白。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Erdenebileg Batbaatar, Young Yoon

本文提出了一种名为 TL++ 的双模式遍历学习框架,旨在解决分布式智能系统在数据孤岛下训练时的准确性与隐私保护问题。传统的联邦学习虽然保持数据本地化,但在异构分区下性能下降且需要反复交换完整模型;拆分学习通过切割层激活值减少通信,但通常无法恢复集中式小批量梯度行为,且可能以明文暴露激活值和梯度。TL++ 包含两种模式:基础模式仅交换切割层激活值和梯度而非完整模型,显著降低通信开销;安全模式通过秘密共享将每个切割层激活值和梯度在编排器与非共谋辅助服务器之间分割,防止任一服务器观察到明文切割层张量,但此保护限于半诚实两服务器设置,且标签和损失相关输出对编排器可见。在轻量级安全路径中,线性或仿射服务器路径可实现精确性,非线性操作需借助非线性 MPC 或近似。论文在 CIFAR-10 和 BioGPT/PubMedQA 数据集上使用全微调和 LoRA 方法评估,与联邦学习和拆分学习基线对比。结果表明,TL++ 基础模式切割层1和精确安全模式切割层3在 CIFAR-10 上分别达到 91.41% 和 90.93% 的准确率,超过最强非 TL++ 基线 12 个百分点以上;基础模式每步通信量相比完整模型同步减少 13.1 倍。PubMedQA 结果同样支持 TL++ 优势。总体而言,TL++ 接近集中式训练性能,同时减少通信并提供激活层秘密共享的隐私保护。

💡 推荐理由: 为分布式数据孤岛环境下的模型训练提供了兼顾高准确率、低通信开销和激活层隐私保护的新方案,对安全从业者设计隐私保护机器学习系统具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zixuan Gu, Xiaojun Ye, Yang Liu

该研究聚焦于分割式大语言模型(Split-LLM)中的数据泄露与防御问题。在隐私敏感场景中,用户面临两难:使用外部API可能泄露隐私数据,而本地部署则计算成本高昂。分割学习(Split Learning)作为一种折中方案,将模型切分,客户端运行部分网络层,服务器端运行其余部分,但这也引入了新的隐私风险。以往工作主要关注输入提示(prompt)的泄露,通常通过对中间表示的逆向攻击实现,而对生成响应(response)中潜在敏感信息泄露的关注较少。本文首先揭示了Split-LLM中的新型漏洞,提出了补丁模型逆向攻击与双端初始化(PIDI),这是一种两阶段攻击方法,同时针对私有输入提示和输出响应。PIDI结合双端初始化和补丁逆向策略来处理长序列,显著优于以往的逆向方法。为抵御来自两端的威胁,作者进一步提出了基于适配器的双端防护与互信息防御(ADMI),它集成了适配器本地预热策略和互信息正则化,在最小影响任务性能的前提下提供了强大的经验隐私保护。在多种任务和模型上的大量实验表明,ADMI能有效防御PIDI及其他最新逆向攻击。该工作揭示了Split-LLM中双向数据泄露的风险,并提出了实用的防御方案,对安全部署大语言模型具有重要参考价值。

💡 推荐理由: 该研究首次系统性揭示分割式大语言模型(Split-LLM)中双向(输入提示与输出响应)数据泄露风险,并提出了有效防御方法,对保护用户隐私、指导LLM安全部署具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yixiao Zheng, Changzheng Wei, Xiaodong Qi, Hanghang Wu, Yuhan Wu, Li Lin, Tianmin Song, Ying Yan, Yanqing Yang, Zhao Zhang 0009, Cheqing Jin, Aoying Zhou

该论文提出 ZKSL,一个可验证且高效的拆分/联邦学习框架,将训练过程与零知识证明相结合。核心目标是实现联邦学习的隐私保护与可验证正确性,同时避免高昂的证明开销。ZKSL 通过三个设计支柱实现: (i) 层间并行证明,逐层生成证明并聚合; (ii) PC-PLONK,引入专用的隐私承诺列来高效强制执行跨层一致性,避免在电路内进行哈希(在论文规模下不可行)或脱离电路进行哈希(破坏零知识信任模型); (iii) 异步计算-证明调度(K-window),将随机梯度下降与证明解耦,使训练过程不会因证明生成而停滞。论文提供了开源原型,包括立即可用的配置和脚本,可复现 LeNet(两方)和 DeepFM(三方)上的关键结果。它产生结构化日志,记录前向/梯度/反向各阶段的证明生成时间。预期结果是,在启用分层并行时,前向和反向阶段的证明时间显著减少,并且在异步调度下端到端吞吐量更高,与论文图表中报告的趋势一致。该工作适合关注隐私保护机器学习、联邦学习安全性和可验证计算的研究人员和工程师阅读。

💡 推荐理由: 联邦学习面临隐私泄露和模型正确性无法验证的双重挑战。ZKSL 首次将零知识证明高效应用于拆分学习场景,在保证隐私的同时实现了可证明的正确性,为安全协同学习提供了新的技术路径。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zihan Liu, Yizhen Wang, Rui Wang, Xiu Tang, Sai Wu

大型语言模型(LLM)的微调能够使其适应特定应用,但高昂的计算成本使得资源受限的组织难以独立完成。云平台可以提供所需资源,但数据隐私问题使得将敏感信息共享给第三方存在风险。分割学习(Split Learning)作为一种有前景的解决方案,将模型划分为客户端和服务器两部分,通过交换中间数据实现协作且安全的训练,从而使资源受限的参与者能够安全地适配LLM。近年来,涌现了大量研究来推进这一范式,提出了多种模型方法、系统优化以及隐私防御-攻击技术。为了理清该领域的发展脉络,本文首次全面综述了针对LLM微调的分割学习。我们提出了一种统一的细粒度训练流水线来定位关键操作组件,并从三个核心维度:模型级优化、系统级效率和隐私保护,对现有工作进行系统回顾。通过这一结构化分类,我们为推进可扩展、鲁棒且安全的协作式LLM适配奠定了基础。本文适合对LLM微调、隐私保护分布式学习感兴趣的研究人员和工程师阅读。

💡 推荐理由: 分割学习允许资源受限的参与者安全地微调LLM,解决了云上微调的数据隐私痛点,是连接低成本与隐私保护的关键技术。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)