#ownership-verification

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Yutong Wu, Xiaofan Bai, Shixin Li, Pingyi Hu, Ziqi Zhou, Zilong Wang, Xiaojing Ma, Songfeng Lu, Yuhong Li, Jin Xuan, Yi Wang, Dongmei Zhang, Bin Benjamin Zhu

大语言模型(LLM)作为高价值资产,常面临通过重新部署、微调、量化或进一步对齐而衍生的窃取风险。由于部署后的LLM通常仅通过黑盒查询API对外暴露,所有权验证往往依赖于文本响应的比对。然而,黑盒环境下的开放式生成具有高度的表面形式可变性,重复查询结果可能不同,而现有指纹方法(如全文本匹配、软行为特征或依赖模型特定提示)在最终响应接口下较为脆弱,难以有效完成所有权验证。针对这一难题,本文提出目标反事实指纹识别(TCF)框架,将开放式生成比较转化为受限答案下的目标反事实迁移问题。具体而言,TCF将每个验证查询限制为有限的候选答案集合,从而降低表面形式差异对验证分数的干扰;同时,通过优化提示扰动,使受保护模型在扰动后的答案从原始干净答案迁移到一个预设的目标答案。验证过程只需检查嫌疑模型解析后的最终答案是否与记录的目标一致。文章进一步引入源模型反事实边际(SCM),利用仅基于受保护模型的计算度量,确保目标在扰动前出现的概率极低,而在扰动后高度可能出现,并以此控制目标选择、扰动停止及指纹筛选过程。基于局部行为接近性,作者还从理论上推导了派生模型与独立模型之间的目标准确率差距,为方法提供了可解释的保障。在四个LLM家族上的实验表明,TCF的平均AUC达到0.9861,相比TRAP、ProFLingo和ZeroPrint等方法提升0.07至0.19,验证了其较高的鲁棒性和有效性。

💡 推荐理由: 本文为LLM模型所有权验证提供了新的黑盒指纹方法,面对模型派生、微调等场景更稳健,有助于防御模型窃取争议,适合模型提供商和安全研究团队关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Ran Canetti, Shafi Goldwasser, Or Zamir

该论文首次对机器学习模型的所有权证明问题进行了正式研究。随着机器学习的广泛采用,保护模型所有权成为关键挑战。作者将模型所有权证明建模为三方博弈:模型所有者、窃取者和裁判。模型所有者将原始模型轻微扰动后生成一个变换模型,并附带一个所有权证明。窃取者获取变换模型后试图最小程度修改它,使其保持有用但逃避被识别为属于原所有者。裁判接收模型和所有权证明,必须判断该模型是否是原所有者创建的模型的修改版,还是独立开发的。研究的主要结果是:在黑盒设置下,对于分类器存在一个二分性——在标准密码学假设下,某些概念类的模型所有权可以按上述意义被证明,当且仅当该概念类在某种意义上(接近Blum, Luby和Rubinfeld在STOC'90中定义的概念)不可自纠正。该结果是建设性的,并推广到多个相关场景。论文提供了严格的形式化定义、安全模型和证明,为模型版权保护奠定了理论基础。

💡 推荐理由: 该研究为机器学习模型的所有权验证提供了首个形式化框架,有助于防御模型窃取和知识产权侵权,对模型部署和商业应用具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

随着文本到图像(T2I)扩散模型在创意应用中的广泛使用,模型被未经授权使用的问题日益严重,模型所有权验证(MOV)成为保护知识产权的重要手段。现有基于后门的扩散模型水印方法通常隐含假设验证过程是“忠实”的,即验证者可以查询可疑模型并获得可信的水印响应。然而,在实际对抗环境中,攻击者可能有意或无意地破坏水印信号,导致验证可靠性显著下降。针对这一问题,本文提出了 Cert-LAS,这是首个基于层自适应平滑的认证 T2I 模型所有权验证方法。具体而言,Cert-LAS 利用扩散分类器和拉普拉斯频率敏感(LFS)引导的层自适应噪声将指定水印嵌入模型,并通过假设检验验证可疑模型是否表现出比未加水印参考模型显著更强的水印响应。理论上,作者证明了在特定条件下,即使存在恶意移除攻击,Cert-LAS 仍能实现可靠验证。大量实验验证了 Cert-LAS 的有效性及其对自适应攻击的抵抗性。该工作为 T2I 扩散模型的版权保护提供了具有认证保障的解决方案。

💡 推荐理由: 本文首次为 T2I 扩散模型提供了具有认证保障的所有权验证方法,能有效抵抗恶意水印移除攻击,对保护模型知识产权具有重要实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)