本文针对大型语言模型(LLM)输出的多比特水印鲁棒性问题,提出一种基于对数似然比(LLR)的软判决解码方法CORE-BREW。现有基于纠错码(ECC)的LLM水印多采用硬判决解码,丢弃了令牌级别的可靠性信息,导致在编辑攻击(如词汇替换、改写)下鲁棒性不足。CORE-BREW是块状BREW方法的恒定命中率嵌入扩展,通过设定固定目标命中率p*来校准水印信道,从而推导出每个令牌闭合形式的LLR,实现有原则的软判决解码。该方法支持两种检测模式:严格安全模式保留有界距离指定码字接受域,保证严格的误报控制;FPR校准模式采用基于似然的评分和轻量级列表解码,刻画误报率与真正率之间的权衡。在开源LLM上的实验表明,CORE-BREW在令牌级编辑和释义攻击下,相比先前多比特水印基线方法,在低误报率下的鉴别能力和鲁棒性均有提升,同时保持相当的语义质量。该研究为LLM水印的可靠溯源提供了新途径,适合从事AI安全、模型防篡改及逆向工程的研究人员阅读。
💡 推荐理由: LLM输出的可追溯性是防范恶意生成内容的关键,CORE-BREW通过软判决解码显著提升了水印在编辑攻击下的鲁棒性,为安全部署LLM提供了更强的防篡改保障。
🎯 建议动作: 研究跟进