本文关注于混合专家(MoE)大型语言模型的知识产权保护问题。现有的水印方案主要针对密集模型设计,假设水印参数被持续激活,但MoE的动态路由机制打破了这一假设,导致传统水印无法直接应用。此外,MoE模型存在两个关键脆弱性:脆弱的决策边界和路由纠缠(梯度集中覆盖签名)。为此,作者提出了PathMark,首个专为MoE架构设计的水印框架。PathMark创新地将路由作为隐蔽水印通道:当触发时,主动约束所有令牌通过预定的专家子集路由,形成独特的路径签名。该方法包含三种核心机制:1)分布对齐损失,提升目标专家概率至主导水平,扩大决策边界以抵抗扰动;2)宽路径配置,每层指定多个目标专家,增强鲁棒性;3)对比损失,理论上消除梯度泄漏到干净输入,保持其自然路由路径。PathMark天然支持多比特编码(通过组合路径)。验证可通过白盒路由检查(取证场景)或黑盒输出检测(仅API访问)实现。在四个MoE模型上的实验表明,PathMark实现了超过99%的验证准确率,而困惑度下降小于2%,并在量化、微调、剪枝和自适应攻击下表现出优越的鲁棒性。
💡 推荐理由: MoE模型是当前大模型的重要发展方向,其知识产权保护需求迫切。PathMark首次解决了MoE架构下的水印难题,为模型所有权验证提供了可靠的技术方案。
🎯 建议动作: 研究跟进