本文针对大型语言模型(LLM)水印技术在实际部署中面临的两大挑战——模型性能严重下降和额外推理开销——提出了基于混合专家(MoE)架构的水印方案 WaterMoE。作者首先构建了一个涵盖多种生成任务的综合基准,系统评估了9种代表性水印方法,发现现有方法主要针对文本流畅性设计,在受限或复杂任务上表现不佳,且引入的延迟使其难以用于对延迟敏感的系统。WaterMoE 通过将水印信号嵌入 MoE 模型的每个路由器的专家选择过程中,以受控扰动的方式累积影响最终输出的 token 选择,从而在不显著降低生成质量和计算效率的前提下实现水印嵌入。与作为后处理 token 采样的传统水印方法不同,WaterMoE 将水印嵌入推理循环内部,引入的质量损失和计算开销极低。大量实验表明,该方法在基准测试上达到了接近未加水印模型的保真度,优于现有最新水印方法,且加速比高达4倍,额外推理延迟仅增加1%。本文展示了 WaterMoE 在实际任务中部署的潜力。
💡 推荐理由: LLM 水印是应对内容溯源和滥用的关键技术,但现有方案因性能损失和开销难以落地。WaterMoE 针对 MoE 架构设计的轻量水印方法,为实际部署提供了可行方案,尤其适合对延迟敏感的生产环境。
🎯 建议动作: 研究跟进