#model-watermark

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Zhongrui Sun, Jiahao Chen, Oubo Ma, Yuwen Pu, Zhou Feng, Haibo Hu, Shouling Ji

随着大语言模型(LLM)被广泛再分发、适配和通过不透明 API 提供服务,仅通过检查模型内部结构或部署记录已难以可靠地确认模型所有权。为此,研究者提出了一种基于语义结构的黑盒归属验证方法 PROSE。现有黑盒指纹大多依赖固定的查询-密钥关联,将模型身份简化为与日常行为脱节的稀疏记忆关联,导致鲁棒性和隐蔽性不足,例如在微调或量化后容易失效。PROSE 将指纹从固定查询集转向“目标语义域”,并用模型内化的“语义结构”替代脆弱的响应密钥。具体而言,指纹被编码为模型在语义上组织其领域结论的方式,而非特定 token 或规定输出。PROSE 首先构建一个私有的领域特定语义模板库,通过对结构正确且干净的响应进行混合微调使模型内化这些模板;然后在验证阶段,通过检测模型对未见过自然查询的响应是否呈现指定结构来判断所有权。实验覆盖多个模型架构、模型规模和目标领域,结果表明:在未修改模型上指纹检测率达到 100%,且未观测到误报;模型效用基本不变;在下游修改和输出变换下仍保持强可检测性。该论文面向 LLM 安全、模型知识产权保护和 AI 治理研究人员,提出了一种分布式、自然诱发的、语义级指纹方案,为黑盒模型验证提供了新思路。

💡 推荐理由: 为 LLM 版权保护和模型泄露溯源提供了黑盒场景下的高鲁棒性验证方案,有助于防御方识别未授权模型复用和 API 代理,具有直接的应用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuo Shao 0002, Yiming Li 0004, Hongwei Yao, Yiling He, Zhan Qin, Kui Ren 0001

本文提出了一种名为“解释即水印”(Explanation as a Watermark) 的神经网络模型所有权验证方案,旨在解决深度学习模型被窃取或未经授权复用时的归属认定问题。传统模型水印方法通常直接修改模型参数或输出,可能会影响模型在正常任务上的性能,且容易被去除或篡改;本文则创新性地将水印信息嵌入到模型的特征归因解释 (Feature Attribution) 中,使模型在对待特定触发样本进行推理时,产生带有预设模式的解释结果,该模式即可编码多位水印信息。具体而言,作者设计了一种端到端的训练框架,在保持原任务精度基本不变的前提下,联合优化模型参数以同时满足任务损失和水印嵌入损失,使得只有持有密钥的验证方才能从解释中提取出完整水印。实验在多种图像分类数据集和不同模型架构上验证了该方法的有效性,表明其具有较好的保真性、鲁棒性和安全性,能够抵抗常见的后处理攻击(如微调、剪枝、水印去除等)。本文的主要贡献包括:提出首个利用解释本身作为水印载体的无损所有权验证机制;支持多位水印编码,信息容量高于传统二值水印;并给出了理论分析和系统实验评估。适合对模型知识产权保护、AI安全与可解释性交叉领域感兴趣的的研究者、AI模型提供方及安全审计人员阅读。

💡 推荐理由: 为AI模型所有权验证提供了新思路,利用可解释性作为水印载体,降低对模型性能的影响,增强了水印的抗去除能力,对保护模型知识产权有实际意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)