该论文提出了一种名为 PURA 的新型多比特水印方法,用于对 AI 生成文本进行细粒度归因。现有方法在保持原始生成分布、支持大容量负载以及编辑后恢复能力之间难以兼顾。PURA 的核心创新在于不在 token 概率层面直接扰动,而是在潜在采样空间中通过密钥化的逆变换采样嵌入负载,并将观测到的 token 视为软区间证据进行序列级聚合来恢复水印。这种设计严格保持基础生成分布不变,同时显著提升在文本编辑和信道扰动下的恢复稳定性。作者还建立了一种统一的鲁棒性分析框架,证明在有界攻击强度下,每比特错误概率随序列长度呈指数衰减。大量实验表明,PURA 在高负载场景下显著优于现有无偏基线:例如在 200 个 token 中嵌入 36 比特时,PURA 达到 91.7% 的消息匹配率,是最强无偏基线的三倍以上,同时保持文本质量,统计上与无水印文本接近,验证开销仅为毫秒级。该研究为 AI 生成文本的追踪与审计提供了一种高容量、高鲁棒性的技术路径。适合关注生成式 AI 安全、内容溯源、模型审计的研究人员和安全工程师阅读。
💡 推荐理由: AI 生成文本的可靠溯源是安全审计与问责的关键。PURA 在保证无损生成分布的同时实现高容量、抗编辑水印,为内容伪造检测和版权保护提供了新的技术选择。
🎯 建议动作: 研究跟进