本文研究大语言模型(LLM)生成文本的语义水印技术及其鲁棒性。现有语义水印将标记绑定到句子语义而非具体词元选择,理论上能抵抗改写等保留内容的编辑。但攻击者提供给检测器的文本可能经过改写、重排序或重新分段,这些操作都会导致嵌入位移——检测时使用的嵌入与嵌入水印时选择的嵌入不一致,从而使水印丢失。作者提出一种自适应的嵌入位移攻击(EDA),将改写、重排序和重新分段统一在一个优化目标下,最大化嵌入位移。该攻击仅需公共释义模型和代理编码器,无需访问提供方的生成器或秘密密钥。在 5% 误报率(FPR)和内容保留阈值 q=90% 下,EDA 在四个现有方案上成功移除水印的比例在 32.6% 到 47.9% 之间,是所有测试攻击中成功率最高的,证明比被动释义更能全面评估方案的鲁棒性。为应对这些漏洞,作者设计了 k-SwordStamp:一种基于子句单元的顺序鲁棒检测语义水印方案,通过降低对攻击者选择结构的敏感性,仅以较小的质量代价换取鲁棒性。实验表明,针对 k-SwordStamp 的最强无盒攻击(一种适配其设计的 EDA 变体)成功率仅为 10.8%;而能访问提供方检测器和秘密密钥的更强 EDA 成功率也仅达 39.7%,远低于对 k-SemStamp 的 65.5%。代码已开源。本文适合关注 LLM 内容溯源、水印稳健性和对抗攻击的研究人员及安全工程师阅读。
💡 推荐理由: 该研究首次系统揭示语义水印在重排序和重分段下的脆弱性,并提出了更强的攻击与更鲁棒的方案,对 LLM 内容溯源和防伪造有直接指导意义。
🎯 建议动作: 研究跟进