#training-time-attack

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jin-Seong Kim, Han-Ju Lee, Seok-Won Hong, Takeshi Takahashi, Chansu Han, Tomohiro Morikawa, Seok-Hwan Choi

本文提出了一种新型的AI供应链攻击方法GradLock,针对现有模型反演攻击在训练后优化中面临的泛化瓶颈问题。传统模型反演技术通常依赖从模型输出中迭代恢复私有数据,但在高维数据集上往往只能得到通用特征,难以还原特定身份信息。GradLock将攻击时机前移至训练阶段:在开源组件被篡改的供应链场景下,攻击者可将特定的敏感训练数据通过注入方式直接编码进模型参数。其核心机制包括无状态确定性索引,用于建立隔离的‘数据保险库’,以及动态梯度锁定技术,防止模型优化过程中注入数据的‘负载退化’。该设计使得攻击者在完成模型训练后无需保留任何训练环境访问权限,即可从最终的模型权重中提取出像素级精度的原始数据。实验在MNIST、Imagenette和CelebA数据集上进行,GradLock实现了近无损重建(SSIM约1.0),并且单次提取时间小于1秒。与已有的训练时注入方法相比,该攻击对量化、剪枝和微调等常见部署优化表现出更强的鲁棒性。此外,一项用户部署研究显示,93.3%的参与者未能察觉模型中的恶意逻辑,这突显了当前AI供应链在安全审计方面的严重盲区。从防御视角看,该研究揭示了开源组件被劫持后可能导致的训练数据精确泄露风险,强调了模型训练过程完整性验证、供应链可信审计以及部署后隐私评估的重要性,为AI安全防御体系提供了新的威胁建模依据。

💡 推荐理由: 该研究揭示AI供应链中的开源组件若被植入恶意训练逻辑,可导致训练数据被精确窃取,且现有部署优化难以消除,防御者需重新审视模型训练环节的可信边界和审计手段。

🎯 建议动作: 研究跟进,评估内部ML供应链的第三方组件风险并完善威胁模型

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)