#AI-security

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Torsten Krauß, Jasper Stang, Alexandra Dmitrienko

本文提出了一种名为 ClearStamp 的模型所有权证明方案,旨在解决深度学习模型在发布后被非法复制或盗用时难以确权的问题。现有模型水印方法通常将水印嵌入到模型参数中,但这些水印往往不可见,且容易受到模型压缩、微调、剪枝等操作的破坏。ClearStamp 的核心创新在于引入转置模型训练(Transposed Model Training)的概念:在已训练好的原始模型之后,额外训练一个结构对称的转置模型,并将人类可见的水印(如文本或图案)直接嵌入到这个转置模型中。水印的嵌入过程利用了转置模型与原始模型之间的梯度耦合,使得水印能够传递到原始模型的输出中,但实际的水印参数仅存在于转置模型中。这种方式使得水印对于攻击者而言更难去除,因为要移除水印需要同时修改原始模型和转置模型;同时,水印具有人类可验证性,无需依赖第三方或秘密参数。实验在多个图像分类数据集(如 CIFAR-10、CIFAR-100、ImageNet)以及不同模型架构(ResNet、VGG、ViT)上进行,结果显示 ClearStamp 在面对模型压缩(如量化、剪枝)、微调、蒸馏等常见攻击时,水印保留率显著高于现有方法(如 Backdoor 水印、参数水印)。此外,ClearStamp 对原始模型性能的影响极小(准确率下降不超过 1%),且水印检测无需访问训练数据或模型内部参数,只需通过推理接口即可验证。文章还讨论了水印的不可去除性(robustness)和透明性(transparency)之间的权衡。总体而言,ClearStamp为模型所有权保护提供了一种新颖、鲁棒且实用的技术方案。

💡 推荐理由: 该方案解决了AI模型被盗用后的确权难题,提供一种人类可见且鲁棒的水印机制,可有效威慑模型窃取行为,对模型发布方和云服务商具有实际应用价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)