随着大型语言模型(LLM)的快速发展,文本水印技术成为识别机器生成内容的关键手段。然而,现有基于logits的水印方法直接应用于代码生成时面临挑战:代码的低熵特性加剧了代码质量与水印可检测性之间的权衡。本文提出一种名为Grammar-Driven Watermark(GDW)的新型代码水印方法。GDW通过语法引导的三级掩码机制保持语法有效性,并通过结构角色感知调制注入水印信号:对内容承载令牌分配更强偏置,而对语法关键令牌应用更保守偏置。与生成过程对齐,进一步设计了角色感知加权检测统计量以提高可检测性。跨多种编程语言、模型和解码策略的实验表明,GDW相比现有方法建立了更强的质量-可检测性权衡前沿,同时保持对变量重命名攻击的鲁棒性。
💡 推荐理由: 代码水印是保护LLM生成代码版权和溯源的重要技术,GDW优化了质量与检测性的平衡,对AI安全内容鉴伪有直接参考价值。
🎯 建议动作: 研究跟进