#split-learning

共收录 10 条相关安全情报。

← 返回所有主题
👥 作者: Md Khalid Syfullah, Alvi Ataur Khalil

该论文针对心理健康困扰日益普遍、而各类机构(教育机构、职场、诊所等)虽积累了大量心理健康问卷数据却难以联合建模的问题展开研究。核心矛盾在于两点:一是隐私约束使得原始问卷回答无法集中汇聚;二是各机构的问卷设计高度异构——问题措辞、评分量表、数据格式都不一致,导致数据在语义层面无法直接拼接整合,传统联邦学习(FL)也因模型输入维度与语义不统一而受限。作者提出一种"schema 感知的拆分学习(split learning, SL)"框架,其关键思路是用大语言模型(LLM)充当跨机构的共享语义编码器,将不同来源的异构问卷 schema 对齐到统一表示空间。具体做法是:把每一条问卷记录序列化为一段自然语言描述,从而把彼此不同的问卷结构统一成同一种可被 LLM 理解的文本格式;随后以低秩适配(LoRA)方式对 LLM 进行心理困扰评估任务的微调;再将该模型按拆分学习范式切分到客户端与服务器两侧——客户端本地保留原始问卷回答,只运行一个轻量级前端模块,因此原始记录永远不会离开采集它的机构;而计算密集的模型主干部署在服务器端执行,从而把客户端的算力与内存开销压到最低。实验采用 LLaMA-3.2-3B-Instruct 作为基座,在仅使用 2,000 条训练样本的条件下取得平均 ANLS 0.708 的成绩,在九个实验设置中的八个上优于联邦学习基线,同时将单客户端计算量降低约三个数量级,并展现出对未见数据集的泛化能力。总体而言,该工作为异构、隐私敏感的跨机构协作学习提供了一条"语义统一 + 模型拆分"的可行路径,兼顾了准确性、隐私保护与资源效率。

💡 推荐理由: 它给出了一套可复用的范式:用 LLM 做 schema 语义对齐、用拆分学习把原始敏感数据留在本地,从而在异构且受合规约束的数据源之间完成联合建模。对处理医疗、心理、HR 等敏感问卷数据的安全团队而言,这既是可借鉴的架构,也引入了新的客户端-服务器信任边界与模型供应链风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Md Khalid Syfullah, Alvi Ataur Khalil

该论文针对视觉语言模型(VLM)在隐私敏感与带宽受限场景下的视觉问答(VQA)任务,提出名为 QPriv-VL 的「问题引导式、隐私感知」视觉 token 剪枝框架。研究背景是:联邦学习(FL)、拆分学习(SL)与 U 型拆分学习(USL)虽然能保持原始数据本地化,但跨模型分区传输全部视觉 token 依然带来高昂通信开销,并可能通过中间表示泄露隐私信息;而现有固定比例剪枝方案不区分任务相关性与隐私敏感性,容易在压缩的同时保留敏感区域或误删回答所需的关键图像块。核心方法上,QPriv-VL 在传输前对视觉 token 进行剪枝,其关键组件是轻量级动态阈值预测器(DTP),能在单次前向传播中同时估计「样本级剪枝比例」与「token 级保留掩码」。DTP 融合两类信号:一是问题相关性,通过视觉 patch 与池化后的问题嵌入之间的跨模态相似度计算得到;二是敏感性信号,由冻结的 DINOv2 特征导出。二者结合使模型在无需敏感性标注的前提下,抑制潜在敏感区域,同时保留对回答问题有用的图像块。作者在 GQA、OK-VQA、VQAv2、SLAKE、VQA-RAD、PathVQA 六个数据集上,针对四类隐私攻击(FSHA、FORA、iDLG 以及属性推断型成员推断攻击 MIA)进行了评测。实验结果显示:DTP 在传输显著更少 token 的情况下,达到或超过固定比例剪枝的效果;在 VQA-RAD 上把成员推断攻击成功率从 0.99 降至 0.76–0.79;相对固定比例剪枝降低了 FSHA 与 FORA 的重建 PSNR;在仅使用约 40% 原始视觉 token 预算的前提下仍保持有竞争力的 VQA 准确率。此外,敏感性排除比达到 1.20±0.18,表明模型优先剔除隐私敏感图像块;可解释性分析进一步表明保留策略会随问题语义自适应调整,而非简单依据通用视觉显著性。适合拆分学习/联邦学习系统设计者、VLM 隐私保护与模型压缩方向的研究人员阅读。

💡 推荐理由: 拆分/联邦 VLM 推理中,跨分区传输的视觉 token 是通信成本与隐私泄露的双重来源。该工作给出无需敏感性标注即可在单次前向完成「任务相关性 + 隐私敏感性」联合剪枝的思路,并量化了对成员推断与重建类攻击的抑制效果,为隐私-效用-带宽三方权衡提供了可复用基线。

🎯 建议动作: 研究跟进:纳入内部隐私工程与拆分学习架构评估,复现其在自有 VQA/医疗影像数据集上的隐私-效用-带宽权衡曲线,再考虑试点部署。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaochen Zhu 0003, Xinjian Luo, Yuncheng Wu, Yangfan Jiang 0001, Xiaokui Xiao, Beng Chin Ooi

本文研究拆分学习(Split Learning, SL)场景下的隐私泄露风险,提出了一种名为 SDAR 的新型被动推理攻击框架。拆分学习被视为传统联邦学习的实用高效替代方案,客户端在本地保留部分模型层(即私有模型)并只与服务器交换中间表征,但已有研究表明恶意或好奇的服务器仍可能推断客户端私有数据。然而,以往攻击方法往往依赖过强假设(如拥有大量同分布辅助数据或可控训练流程)或仅针对易受攻击的简单模型,实用性受限。作者假定服务器是诚实但好奇(honest-but-curious)的,即服务器严格遵循协议但试图从收到的中间表征中学习客户端私有信息。SDAR 的核心思想是利用辅助数据通过对抗正则化(adversarial regularization)学习一个客户端私有模型的可解码模拟器:该模拟器在训练阶段拟合客户端模型的行为,同时借助对抗约束迫使编码结果保留与私有特征/标签相关的信息,从而在推理阶段仅凭中间表征即可重构客户端私有特征;在 U 型拆分学习(U-shaped SL)配置下还可同时推断标签。作者在标准配置和 U 型配置下进行了大量实验,验证了攻击的有效性。实验结果显示,在现有被动攻击难以有效重构私有数据的挑战性场景中(如深层拆分点),SDAR 的重构性能显著优于已有被动攻击,甚至可媲美主动攻击。具体而言,在 CIFAR-10 数据集上,当拆分深度为 7 时,SDAR 在标准 SL 和 U 型 SL 下均能将私有特征重建的平均平方误差降至 0.025 以下,并且在 U 型设置下标签推断准确率超过 98%,而现有攻击方法在此设定下无法产生非平凡结果。本文的研究贡献在于揭示拆分学习在更现实假设下的严重隐私漏洞,对设计安全的拆分学习协议具有警示意义。适合关注机器学习隐私、联邦学习/拆分学习安全的研究人员及安全工程师阅读。

💡 推荐理由: 拆分学习被视为隐私保护技术,但本文证明在诚实但好奇的服务器假设下,仅凭公开的中间表征即可高精度重构私有数据,甚至优于已有攻击。安全从业者应重新评估拆分学习在实际部署中的隐私边界,尤其是深层拆分场景。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinben Gao, Lan Zhang

本文提出了一种针对分割学习(Split Learning)框架的新型攻击方法,命名为伪客户端攻击(Pseudo-Client Attack, PCAT)。分割学习是一种保护隐私的分布式机器学习范式,其中客户端在本地保留部分模型层,仅将中间激活( smashed data )发送给服务器端,以完成剩余层的训练和推理。已有研究通常假设服务器是诚实但好奇的,并尝试从中间表示中重构原始数据;但本文从更极端的威胁模型出发,认为服务器可以扮演恶意角色,主动诱导或操控客户端行为。PCAT 的核心思路是:服务器不被动等待客户端上传,而是伪装成一个或多个伪客户端,利用分割学习中的梯度交换机制,向真实客户端发送精心构造的恶意梯度或参数更新,从而在不破坏训练过程的前提下,逐步窃取客户端私有模型的功能(即提取模型权重或复制其决策边界)以及训练数据的敏感信息。文章中详细阐述了攻击的具体算法流程,包括如何设计伪客户端的更新策略、如何在多客户端场景下扩大攻击影响,并分析了不同分割点位置、不同批大小和不同模型架构下攻击的有效性。实验部分在多个图像分类数据集(如 CIFAR-10、Tiny ImageNet)和不同网络结构(如 ResNet、VGG)上验证了 PCAT 的性能,结果表明该方法能够以较低的训练轮次开销,实现远超随机猜测的功能窃取精度,并能显著提高数据重建的质量(如提升 SSIM 和降低 Lp 距离)。此外,文章还讨论了对抗此类攻击的潜在防御方向,比如对客户端上传的梯度进行异常检测、增加噪声扰动或使用安全聚合机制,但未给出完整的防御方案。总体而言,该研究揭示了分割学习在现实部署中可能面临的未被充分认识的安全漏洞,为设计更鲁棒的隐私保护分布式学习系统提供了新的攻击视角和威胁模型。

💡 推荐理由: 分割学习常被视为比联邦学习更保护隐私,但 PCAT 证明恶意服务器可主动窃取客户端数据和模型功能,颠覆了传统信任假设,对隐私保护 ML 系统的安全评估有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Akarsh K. Nair, Muhammad Arifur Rahman, David Brown, Mufti Mahmud

本文研究分割学习中的隐私泄露问题,提出了一种基于拓扑复杂性(persistent Betti complexity)的隐私感知分割学习框架。分割学习通过将神经网络在客户端和服务器之间分割来实现协作训练,但不当的分割点会导致中间表示泄露敏感信息(如特征反转攻击和梯度泄漏)。作者通过逐层分析发现,隐私风险在神经网络层间高度不均匀,存在尖锐的过渡区域,仅靠网络深度无法捕捉。具体而言,在更深的隐私关键分割点,特征反转的保真度可从可忽略的重建提升至SSIM高达0.98。进一步实验表明,Betti复杂度能够一致地识别出与高风险特征空间隐私泄露相关的表示区域。基于此观察,本文提出BettiSafe,一种无需显式执行攻击即可识别隐私敏感层的拓扑引导分割选择策略。与基于深度的启发式方法相比,BettiSafe将特征反转抵抗能力提升2至5倍,同时保持分类准确率。此外,基于Betti的正则化方法在不降低模型效用的前提下,将反转难度提升近5倍,实现了有利的隐私-效用权衡。总体而言,本文表明拓扑复杂度可作为安全、自适应且表示感知的分割学习的结构性描述符,适用于现实世界的协作系统。

💡 推荐理由: 分割学习是一种流行的隐私保护协作训练范式,但现有分割策略常忽略中间表示的隐私风险。本文引入拓扑复杂性分析,无需攻击模拟即可指导安全分割,显著提升了隐私防御能力,对联邦学习和边缘智能场景有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiayun Fu, Xiaojing Ma 0002, Bin B. Zhu, Pingyi Hu, Ruixin Zhao, Yaru Jia, Peng Xu 0003, Hai Jin 0001, Dongmei Zhang 0001

该论文研究分割学习(Split Learning)场景下的劫持攻击防御问题。分割学习是一种分布式机器学习范式,允许多个参与方在不共享原始数据的情况下协作训练模型,但存在安全漏洞:攻击者可能劫持模型参数或梯度,窃取敏感信息。作者提出了一种名为“Pinocchio's Nose”的梯度审查器(Gradients Scrutinizer),通过利用内在属性(intrinsic attributes)来检测和防御分割学习中的劫持攻击。具体地,该方法从梯度中提取统计特征(如均值、方差、高阶矩等),并基于这些特征构建分类器,以区分正常梯度与被劫持的恶意梯度。实验在多个数据集(如CIFAR-10、MNIST、ImageNet)和模型架构(如ResNet、VGG)上进行,结果表明该方法能够以高精度检测多种劫持攻击(包括替换、添加噪声、反向梯度等),且对模型训练性能的影响极小。核心贡献包括:(1) 首次从梯度内在属性角度系统分析分割学习劫持攻击的可检测性;(2) 设计轻量级、模型无关的防御机制,无需修改训练协议;(3) 在多种攻击场景下验证了方法的有效性和鲁棒性。该研究为分割学习的安全部署提供了实用的检测工具。

💡 推荐理由: 分割学习广泛应用于医疗、金融等隐私敏感场景,但劫持攻击可导致数据泄露。该论文提出了首个基于梯度内在属性的通用检测方法,能高效识别多种攻击,填补了该领域的防御空白。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Erdenebileg Batbaatar, Young Yoon

本文提出了一种名为 TL++ 的双模式遍历学习框架,旨在解决分布式智能系统在数据孤岛下训练时的准确性与隐私保护问题。传统的联邦学习虽然保持数据本地化,但在异构分区下性能下降且需要反复交换完整模型;拆分学习通过切割层激活值减少通信,但通常无法恢复集中式小批量梯度行为,且可能以明文暴露激活值和梯度。TL++ 包含两种模式:基础模式仅交换切割层激活值和梯度而非完整模型,显著降低通信开销;安全模式通过秘密共享将每个切割层激活值和梯度在编排器与非共谋辅助服务器之间分割,防止任一服务器观察到明文切割层张量,但此保护限于半诚实两服务器设置,且标签和损失相关输出对编排器可见。在轻量级安全路径中,线性或仿射服务器路径可实现精确性,非线性操作需借助非线性 MPC 或近似。论文在 CIFAR-10 和 BioGPT/PubMedQA 数据集上使用全微调和 LoRA 方法评估,与联邦学习和拆分学习基线对比。结果表明,TL++ 基础模式切割层1和精确安全模式切割层3在 CIFAR-10 上分别达到 91.41% 和 90.93% 的准确率,超过最强非 TL++ 基线 12 个百分点以上;基础模式每步通信量相比完整模型同步减少 13.1 倍。PubMedQA 结果同样支持 TL++ 优势。总体而言,TL++ 接近集中式训练性能,同时减少通信并提供激活层秘密共享的隐私保护。

💡 推荐理由: 为分布式数据孤岛环境下的模型训练提供了兼顾高准确率、低通信开销和激活层隐私保护的新方案,对安全从业者设计隐私保护机器学习系统具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zixuan Gu, Xiaojun Ye, Yang Liu

该研究聚焦于分割式大语言模型(Split-LLM)中的数据泄露与防御问题。在隐私敏感场景中,用户面临两难:使用外部API可能泄露隐私数据,而本地部署则计算成本高昂。分割学习(Split Learning)作为一种折中方案,将模型切分,客户端运行部分网络层,服务器端运行其余部分,但这也引入了新的隐私风险。以往工作主要关注输入提示(prompt)的泄露,通常通过对中间表示的逆向攻击实现,而对生成响应(response)中潜在敏感信息泄露的关注较少。本文首先揭示了Split-LLM中的新型漏洞,提出了补丁模型逆向攻击与双端初始化(PIDI),这是一种两阶段攻击方法,同时针对私有输入提示和输出响应。PIDI结合双端初始化和补丁逆向策略来处理长序列,显著优于以往的逆向方法。为抵御来自两端的威胁,作者进一步提出了基于适配器的双端防护与互信息防御(ADMI),它集成了适配器本地预热策略和互信息正则化,在最小影响任务性能的前提下提供了强大的经验隐私保护。在多种任务和模型上的大量实验表明,ADMI能有效防御PIDI及其他最新逆向攻击。该工作揭示了Split-LLM中双向数据泄露的风险,并提出了实用的防御方案,对安全部署大语言模型具有重要参考价值。

💡 推荐理由: 该研究首次系统性揭示分割式大语言模型(Split-LLM)中双向(输入提示与输出响应)数据泄露风险,并提出了有效防御方法,对保护用户隐私、指导LLM安全部署具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yixiao Zheng, Changzheng Wei, Xiaodong Qi, Hanghang Wu, Yuhan Wu, Li Lin, Tianmin Song, Ying Yan, Yanqing Yang, Zhao Zhang 0009, Cheqing Jin, Aoying Zhou

该论文提出 ZKSL,一个可验证且高效的拆分/联邦学习框架,将训练过程与零知识证明相结合。核心目标是实现联邦学习的隐私保护与可验证正确性,同时避免高昂的证明开销。ZKSL 通过三个设计支柱实现: (i) 层间并行证明,逐层生成证明并聚合; (ii) PC-PLONK,引入专用的隐私承诺列来高效强制执行跨层一致性,避免在电路内进行哈希(在论文规模下不可行)或脱离电路进行哈希(破坏零知识信任模型); (iii) 异步计算-证明调度(K-window),将随机梯度下降与证明解耦,使训练过程不会因证明生成而停滞。论文提供了开源原型,包括立即可用的配置和脚本,可复现 LeNet(两方)和 DeepFM(三方)上的关键结果。它产生结构化日志,记录前向/梯度/反向各阶段的证明生成时间。预期结果是,在启用分层并行时,前向和反向阶段的证明时间显著减少,并且在异步调度下端到端吞吐量更高,与论文图表中报告的趋势一致。该工作适合关注隐私保护机器学习、联邦学习安全性和可验证计算的研究人员和工程师阅读。

💡 推荐理由: 联邦学习面临隐私泄露和模型正确性无法验证的双重挑战。ZKSL 首次将零知识证明高效应用于拆分学习场景,在保证隐私的同时实现了可证明的正确性,为安全协同学习提供了新的技术路径。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zihan Liu, Yizhen Wang, Rui Wang, Xiu Tang, Sai Wu

大型语言模型(LLM)的微调能够使其适应特定应用,但高昂的计算成本使得资源受限的组织难以独立完成。云平台可以提供所需资源,但数据隐私问题使得将敏感信息共享给第三方存在风险。分割学习(Split Learning)作为一种有前景的解决方案,将模型划分为客户端和服务器两部分,通过交换中间数据实现协作且安全的训练,从而使资源受限的参与者能够安全地适配LLM。近年来,涌现了大量研究来推进这一范式,提出了多种模型方法、系统优化以及隐私防御-攻击技术。为了理清该领域的发展脉络,本文首次全面综述了针对LLM微调的分割学习。我们提出了一种统一的细粒度训练流水线来定位关键操作组件,并从三个核心维度:模型级优化、系统级效率和隐私保护,对现有工作进行系统回顾。通过这一结构化分类,我们为推进可扩展、鲁棒且安全的协作式LLM适配奠定了基础。本文适合对LLM微调、隐私保护分布式学习感兴趣的研究人员和工程师阅读。

💡 推荐理由: 分割学习允许资源受限的参与者安全地微调LLM,解决了云上微调的数据隐私痛点,是连接低成本与隐私保护的关键技术。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)