随着大语言模型(LLM)被广泛再分发、适配和通过不透明 API 提供服务,仅通过检查模型内部结构或部署记录已难以可靠地确认模型所有权。为此,研究者提出了一种基于语义结构的黑盒归属验证方法 PROSE。现有黑盒指纹大多依赖固定的查询-密钥关联,将模型身份简化为与日常行为脱节的稀疏记忆关联,导致鲁棒性和隐蔽性不足,例如在微调或量化后容易失效。PROSE 将指纹从固定查询集转向“目标语义域”,并用模型内化的“语义结构”替代脆弱的响应密钥。具体而言,指纹被编码为模型在语义上组织其领域结论的方式,而非特定 token 或规定输出。PROSE 首先构建一个私有的领域特定语义模板库,通过对结构正确且干净的响应进行混合微调使模型内化这些模板;然后在验证阶段,通过检测模型对未见过自然查询的响应是否呈现指定结构来判断所有权。实验覆盖多个模型架构、模型规模和目标领域,结果表明:在未修改模型上指纹检测率达到 100%,且未观测到误报;模型效用基本不变;在下游修改和输出变换下仍保持强可检测性。该论文面向 LLM 安全、模型知识产权保护和 AI 治理研究人员,提出了一种分布式、自然诱发的、语义级指纹方案,为黑盒模型验证提供了新思路。
💡 推荐理由: 为 LLM 版权保护和模型泄露溯源提供了黑盒场景下的高鲁棒性验证方案,有助于防御方识别未授权模型复用和 API 代理,具有直接的应用价值。
🎯 建议动作: 研究跟进