#privacy-preserving-ml

共收录 10 条相关安全情报。

← 返回所有主题
👥 作者: Xujun Che, Depeng Xu, Xintao Wu

论文提出一种针对直方流(Rectified Flow)变换器的几何感知差分隐私训练方法StraightDP,旨在解决文本条件生成模型在强隐私约束下出现的效用悬崖(utility cliff)问题。作者重新审视了直方流的几何特性:在噪声到数据的直线插值过程中,贝叶斯最优速度(Bayes-optimal velocity)在噪声端点主要由少数类条件矩(class-conditional moments)控制,而越接近数据端点,样本特定结构越重要。StraightDP利用这一异质性,先将一小部分隐私预算用于一次性释放白化的类条件矩,这些矩可被蒸馏进模型权重或在采样时注入;其余预算则通过预先声明的DP-SGD(差分隐私随机梯度下降)用于数据端训练,以捕捉超出矩刻画的样本细节。在MNIST数据集上,当ε=1时,仅释放矩即可达到0.76的下游任务准确率,并生成类似原型的样本(FID为237),而统一DP-SGD仅达到0.21;基于矩释放的完整管道在公共潜在空间中达到0.81的准确率和FID 56。此外,作者发现对多模态骨干网络的每token流范数进行约束,不会改变预训练损失,但能显著提升极端噪声像素空间(pixel-space)下的下游准确率,且隐私强度越强,其准确率增益越单调增加。最后,释放的矩还可迁移至冻结的SD3-medium模型,在采样时注入比DP-LoRA训练更节省预算且效果更好。该研究提供了DP训练生成模型的新视角,通过几何感知的预算分配显著改善隐私-效用权衡,适合研究私有生成模型、差分隐私算法和直方流架构的学者与工程师阅读。

💡 推荐理由: 该研究为差分隐私生成模型提供了一种突破效用瓶颈的新范式,对需要保护训练数据隐私的文本到图像生成等场景具有重要意义,并为DP训练中的预算分配和矩注入提供了可参考的设计思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kanav Gupta, Nishanth Chandran, Divya Gupta 0001, Jonathan Katz, Rahul Sharma 0001

该论文提出SHARK系统,旨在解决主动安全(active security)下的两方机器学习推理问题。传统方法(如Escudero et al., Crypto 2020)在预处理模型下需要大量关联随机性、多次通信轮次和高计算开销,导致性能不佳。SHARK基于函数秘密共享(FSS)技术,通过创新性地允许在协议中混合布尔值和算术值(此前工作未实现),并引入“交互式FSS”概念(FSS的推广),显著降低了所需关联随机性、通信轮次、通信量和计算开销。实验表明,SHARK在主动安全推理任务上比现有最优方案快达2300倍。该研究为隐私计算中的安全推理提供了更高效的解决方案,特别适用于需要在预处理模型下实现主动安全的应用场景。

💡 推荐理由: 主动安全推理是隐私计算的关键瓶颈,SHARK大幅提升了效率,可能推动安全机器学习推理在实际部署中的可行性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinwen Gao, Shaojing Fu, Lin Liu 0018, Zhuotao Liu, Yuchuan Luo, Yongjun Wang

本文提出 Euston,一种高效且用户友好的安全 Transformer 推理框架,支持非交互式操作,无需客户端与服务器之间进行多轮通信。Euston 结合了多方安全计算(MPC)与同态加密(HE)技术,针对 Transformer 模型中的自注意力机制和前馈网络进行了优化,显著降低了推理时的计算和通信开销。实验表明,在保证机密性的前提下,Euston 在推理延迟和资源消耗方面均优于现有方案,同时保持了与明文推理相当的高精度。该工作为在不可信服务器上安全部署大规模语言模型提供了实用解决方案。

💡 推荐理由: 当前 LLM 推理服务存在严重隐私泄露风险,Euston 首次实现了非交互式安全推理,兼顾效率与易用性,是隐私计算与 AI 交叉领域的重要进展。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Logan Choi, Wooyoung Kim

该论文研究了TenSEAL同态加密库在加密RNA测序数据预测任务中的应用。同态加密允许在不解密的情况下对加密数据进行计算,从而保护数据隐私。论文使用TenSEAL库实现了同态加密方案,并在RNA测序数据集上训练了机器学习模型,评估了加密数据下的预测性能。实验结果表明,同态加密能够在不显著降低模型准确率的前提下,有效保护敏感基因表达数据的隐私。研究为生物医学数据的安全分析提供了可行的技术路径,并探讨了计算开销与隐私保护之间的权衡。

💡 推荐理由: 同态加密是隐私保护计算的关键技术,该研究展示了其在敏感医疗数据(如RNA测序)上的实用性,对数据合规和隐私保护有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Jiheon Woo, Donggyun Ryu, Yongjune Kim

本文研究同态加密(HE)环境下,使用多项式逼近非线性激活函数时,逼近区间选择与近似误差之间的权衡问题。在HE中,运算仅限于加法和乘法,因此非多项式激活函数必须用多项式近似。Minimax近似(如Remez算法)能最小化给定区间内的最大逼近误差,但区间宽度是关键超参数:宽区间提高对大输入值的鲁棒性,但固定多项式阶数下会增加最大逼近误差。论文将此权衡形式化为一个分布感知的区间优化问题,其中根据预激活值的分布选择逼近区间以最小化均方误差(MSE)。为有效控制区间外输入,作者结合了域扩展函数(DEF)及其HE可实现的对应项——域扩展多项式(DEP),它们模拟区间外的裁剪操作,抑制不受控的多项式外推。首先推导了一个解析易处理的DEF代理目标,该目标捕捉了区间内minimax逼近误差与区间外裁剪误差之间的权衡。然后通过实现误差分解及其上界,将此理想目标与HE可实现的DEP构造联系起来。实验部分通过数值例子验证了所提方法的有效性,表明该方法能根据数据分布自适应选择区间,在保持低逼近误差的同时提高对大输入的鲁棒性。该工作为HE推理中激活函数的精确高效逼近提供了新思路。

💡 推荐理由: 该研究解决了同态加密中多项式逼近的关键超参数选择问题,能提升隐私推理的准确性和鲁棒性,对HE实际部署有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yunsheng Yuan, Xue Xiao, Lina Wang, Feng Li

该论文针对去中心化学习(Decentralized Learning)中的隐私保护问题展开研究。在去中心化学习中,多个智能体(Agent)在没有中心服务器的情况下协作训练全局模型,通过交换梯度信息来更新模型。然而,这种梯度交换会带来严重的隐私泄露风险,且实际应用中各智能体的训练数据通常是非独立同分布(Non-IID)的,这进一步增加了隐私保护的难度。为了解决这些问题,作者提出了一种名为DPDL的隐私保护去中心化学习算法。核心思想是结合差分隐私(Differential Privacy, DP)与相似度校准技术。具体来说,在每个训练轮次中,每个智能体在将交叉梯度(即其邻居的本地模型在自身私有数据上的导数)分享给邻居之前,先使用高斯噪声机制对其进行扰动,然后利用余弦相似度校准收到的来自邻居的扰动交叉梯度,最后将校准后的交叉梯度以动量方式聚合,用于更新本地模型。理论分析部分,作者不仅揭示了达到特定隐私保护级别所需的最小噪声水平,还证明了该算法在Non-IID数据下依然能实现线性加速(Linear Speedup)。实验方面,在真实数据集上验证了算法在防御隐私攻击和训练准确模型方面的有效性。该工作主要贡献于去中心化学习、差分隐私、Non-IID数据场景下的隐私保护算法设计。

💡 推荐理由: 去中心化学习在隐私敏感场景(如医疗、金融)中应用广泛,但梯度交换易泄露隐私。该工作针对Non-IID这一现实挑战提出了可证明隐私保证且保持训练效率的解法,对安全从业者理解并部署隐私保护机器学习有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Nishat Koti, Arpita Patra, Rahul Rachuri, Ajith Suresh

该论文提出了一种名为Tetrad的框架,用于在最多一个被动腐败方存在的四参与方场景下,实现安全的多方计算(MPC),以支持隐私保护的机器学习训练和推理。Tetrad在环上运行,提供了公平性和鲁棒性两种安全级别。其公平乘法协议仅需5个环元素,优于先前最先进的Trident协议(Chaudhari等人,NDSS'20)。Tetrad的一个关键特性是鲁棒性在公平协议之上是免费获得的。其他亮点包括:概率截断无开销、多输入乘法协议、用于切换计算域(算术与布尔电路)的转换协议,以及定制化的混淆电路方法。作者在LeNet和VGG16等深度神经网络上对Tetrad的训练和推理性能进行了基准测试,结果显示,与Trident相比,Tetrad在机器学习训练中快达4倍,推理中快达5倍,且部署成本低至Trident的六分之一。该工作适用于需要保护模型或数据隐私的联合学习场景,以及任何需要三台以上服务器但容错性要求较高的安全计算环境。

💡 推荐理由: Tetrad展示了四方安全计算在隐私保护机器学习中的显著性能提升,且鲁棒性免费获得,对于实际部署安全MPC应用具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xuanqi Liu, Zhuotao Liu, Qi Li 0002, Ke Xu 0002, Mingwei Xu 0001

本文针对协作式神经网络训练中日益突出的数据隐私挑战展开研究。传统方法如联邦学习(FL)完全忽略模型隐私,而同态加密(HE)只能支持单一数据提供方,扩展性受限。现有的安全多方计算(MPC)框架虽能提供合理吞吐并同时保护数据与模型隐私,却严重依赖计算服务器之间的非串通假设(non-colluding assumption),放松该假设仍是开放问题。为此,论文提出Pencil,这是首个无需非串通假设、同时实现数据隐私、模型隐私以及支持多个数据提供方扩展的协作学习私有训练框架。其核心设计理念是基于高效的两方协议构建多方协作训练协议,并确保在模型训练过程中切换到不同数据提供方不会引入额外开销。作者引入了几种新颖的密码学协议来实现该设计,并进行了严格的安全与隐私分析。全面评估显示:(i) 明文训练模型与使用Pencil私有训练的模型测试准确率几乎相同;(ii) 训练开销大幅降低:吞吐量较现有技术提升10~260倍,通信量减少两个数量级;(iii) Pencil能抵御现有及自适应(白盒)攻击。该工作对隐私保护的机器学习领域具有重要推进意义。

💡 推荐理由: Pencil首次在协作学习中同时实现数据隐私、模型隐私和多提供方扩展性,且无需依赖计算服务器的非串通假设,解决了现有MPC框架的根本性安全缺陷。

🎯 建议动作: 研究跟进:关注Pencil的具体实现与后续改进,评估其在自身业务场景下的适用性。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.6
Conf: 50%
👥 作者: Daniil Filienko, Martine De Cock, Sikha Pentyala

本文针对基因组数据的高度敏感性和访问限制,提出了一种跨机构安全合成基因组数据生成方法。由于基因组数据的隐私性,数据共享受到严格监管,阻碍了AI在基因组学中的发展。合成数据生成通过训练生成模型并采样保留相关统计信息的人工数据,可以在不泄露个体敏感信息的同时促进数据共享。但在许多应用中(如罕见病研究),单个机构的数据量不足以训练有效的生成模型,需要跨机构协作。为此,本文设计了一种结合安全多方计算(MPC)和差分隐私(DP)的方案,使得多个数据持有者能够在不暴露原始数据的情况下联合训练合成数据生成器。MPC确保输入隐私,即任何一方都不会以未加密形式泄露其数据;DP则提供输出隐私,通过限制从发布的合成数据中泄露信息来保护个体隐私。作者使用多个真实RNA-seq数据集在联邦环境中进行了实验,结果表明该方法能够在数据分布在不同机构的情况下生成高质量、高实用性的合成数据集,同时有效保护隐私。该工作为隐私保护的跨机构基因组数据共享提供了可行的技术路径。

💡 推荐理由: 该方法直接解决了基因组数据共享与隐私保护之间的矛盾,允许医疗机构在合规前提下安全合作,对推动基因组学AI研究有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kecen Li, Chen Gong, Zinan Lin, Tianhao Wang, Xiaokui Xiao

该论文聚焦于差分隐私(DP)对比学习中的隐私-效用权衡问题。现有的DP对比学习方法因标准对比目标中样本间固有的强依赖性而遭受严重的效用退化:每个样本的梯度依赖于批次中的所有其他样本,这放大了DP噪声的影响。作者指出,有效的DP对比学习需要显式地减少这种内在的样本间依赖。为此,他们提出了DP-GCL,一个原则性的DP对比学习框架,通过限制组级贡献来结构化地限制梯度依赖。DP-GCL将每个批次划分为小的、不相交的组,并将可用的负样本限制在组内,从而局部化梯度影响并降低敏感度。为了弥补由此造成的负样本多样性损失,进一步引入了组内增强,在不增加隐私成本的情况下生成额外的负视图。在八个数据集上的大量实验表明,在实际隐私预算下,DP-GCL在单模态和多模态对比学习中均持续提升了现有技术水平:与现有DP对比方法相比,图像分类准确率提升5.6%,图像-文本检索准确率提升20.1%。该工作为部署或共享在敏感用户数据上训练的嵌入模型提供了更实用的隐私保护方案。

💡 推荐理由: 该研究解决了DP对比学习中严重的效用退化问题,为安全工程师在保护用户隐私的同时保持模型可用性提供了新思路,尤其适用于需要发布或共享嵌入向量的场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)