#intellectual-property

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Yudong Gao, Qingyue Wang, Yuanyuan Yuan, Ruixuan Huang, Linghan Chen, Zimo Ji, Shuai Wang

本文关注于混合专家(MoE)大型语言模型的知识产权保护问题。现有的水印方案主要针对密集模型设计,假设水印参数被持续激活,但MoE的动态路由机制打破了这一假设,导致传统水印无法直接应用。此外,MoE模型存在两个关键脆弱性:脆弱的决策边界和路由纠缠(梯度集中覆盖签名)。为此,作者提出了PathMark,首个专为MoE架构设计的水印框架。PathMark创新地将路由作为隐蔽水印通道:当触发时,主动约束所有令牌通过预定的专家子集路由,形成独特的路径签名。该方法包含三种核心机制:1)分布对齐损失,提升目标专家概率至主导水平,扩大决策边界以抵抗扰动;2)宽路径配置,每层指定多个目标专家,增强鲁棒性;3)对比损失,理论上消除梯度泄漏到干净输入,保持其自然路由路径。PathMark天然支持多比特编码(通过组合路径)。验证可通过白盒路由检查(取证场景)或黑盒输出检测(仅API访问)实现。在四个MoE模型上的实验表明,PathMark实现了超过99%的验证准确率,而困惑度下降小于2%,并在量化、微调、剪枝和自适应攻击下表现出优越的鲁棒性。

💡 推荐理由: MoE模型是当前大模型的重要发展方向,其知识产权保护需求迫切。PathMark首次解决了MoE架构下的水印难题,为模型所有权验证提供了可靠的技术方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Zihan Wang, Zhongkui Ma, Xinguo Feng, Ruoxi Sun 0001, Hu Wang 0005, Minhui Xue 0001, Guangdong Bai

该论文提出了一种名为CORELOCKER的神经元级使用控制方法,用于保护深度学习模型的知识产权。核心思想是从训练好的神经网络中提取一小部分显著权重作为“访问密钥”,拥有密钥的用户可以获得模型的全部能力,而未授权用户只能获得部分能力。该方法通过形式化分析给出了保护前后网络效用差异的理论上下界,并基于Fashion-MNIST、CIFAR-10和CIFAR-100数据集以及VGGNet、ResNet和DenseNet等真实模型进行了实验验证。实验结果表明CORELOCKER能有效控制模型使用权限,并对基于微调和剪枝的高级模型恢复攻击具有鲁棒性。该工作为模型所有者提供了一种细粒度的访问控制机制,有助于防止模型被滥用或盗用。

💡 推荐理由: 随着深度学习模型商业价值提升,模型使用权保护成为关键。CORELOCKER提供了一种新颖的、基于权重子集的细粒度访问控制方法,有助于维护模型开发者的知识产权。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Linkang Du, Min Chen 0032, Mingyang Sun, Shouling Ji, Peng Cheng 0001, Jiming Chen 0001, Zhikun Zhang 0001

该论文提出了一种名为ORL-AUDITOR的新型数据集审计机制,专门针对离线深度强化学习(offline DRL)场景。离线DRL利用预先收集的数据集训练模型,广泛应用于自动驾驶等安全关键领域。随着高质量数据集成为AI核心资产,许多机构公开共享数据集,但面临滥用或侵权的风险。现有水印技术无法处理已发布的数据集,而数据集推理(dataset inference)和成员推理(membership inference)等方法在离线DRL中因模型行为多样性和离线约束而效果不佳。作者利用累积奖励(cumulative rewards)作为唯一标识符,能够区分DRL模型是否基于特定数据集训练。ORL-AUDITOR是首个轨迹级(trajectory-level)数据集审计机制。实验在多种离线DRL模型和任务上进行,审计准确率超过95%,假阳性率低于2.88%。论文还研究了不同参数设置对实际部署的影响,并在Google和DeepMind的开源数据集上验证了审计能力。代码已开源。该工作为保护数据集知识产权提供了新思路,适用于任何使用离线DRL数据集的场景。

💡 推荐理由: 离线强化学习数据集的知识产权保护是当前空白,该论文提出一种无需修改数据的审计方法,有助于检测模型是否未经授权使用了特定数据集,对数据提供方具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi

本文提出了一种针对文本到图像(T2I)扩散模型的高效、鲁棒且抗合谋的模型指纹识别方法。现有模型指纹技术通过向生成图像嵌入用户特定标识符来保护知识产权,但普遍存在一个未探索的系统性漏洞:它们缺乏对抗合谋攻击的鲁棒性。合谋攻击中,多个攻击者联合其模型以移除或隐藏指纹。为此,本文首次提出具有抗合谋能力的T2I模型指纹方法。该方法将二进制位字符串(指纹)编码到个性化归一化模块(PNM)的系数中,该模块被集成到T2I模型中,使得从任何生成图像中都能可靠地恢复指纹。为防御合谋攻击并防止未授权模型再分发,引入了一种基于无损函数不变参数变换的抗合谋机制,该机制显著降低合谋模型的图像生成质量(通过增加FID指标),使其实际上不可用。此外,该方法允许开发者通过重新参数化PNM高效地创建多个带指纹的T2I模型副本,而无需重新训练。还引入了一种最坏情况优化策略,以提高对模型级攻击的鲁棒性。实验表明,该方法在多个T2I图像生成和编辑任务中实现了高保真度和鲁棒性,指纹提取准确率超过99.5%。与现有方法相比,该方法首次通过显著增加合谋模型的FID,展现出对合谋攻击的主动鲁棒性。该研究适合AI安全研究人员、模型开发者及知识产权保护相关从业者阅读。

💡 推荐理由: 揭示了现有模型指纹方法在合谋攻击下的系统性漏洞,并首次提出有效的抗合谋方案,对保护生成式AI模型的版权和防止非法分发具有重要实践意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)