本文针对各国政府强制要求LLM生成内容添加水印(如欧盟AI法案、加州SB 942)的背景下,检验水印检测结果是否足以作为法庭证据的可靠性。作者选取三种代表性水印方法——KGW、Unigram以及MarkLLM实现的SynthID-Text,依据美国Daubert证据可采性标准以及NIST SP 800-86数字取证流程进行评估。为系统化评估,提出了包含12项标准、3个强制关卡和60分制评分的取证就绪度评分(FRS)框架。攻击向量选用保持语义的释义(paraphrase),因其在法律场景中真实且难以被归为证据篡改。实验对每种方法在15个多样提示下进行了846次有效释义测试,结果显示:KGW和Unigram的初始水印在释义后100%被移除(条件移除率100%),SynthID略好但移除率仍达98.3%。即使在未遭受攻击时,假阴性率已很高:KGW 70%、Unigram 83%、SynthID 80%。SynthID还将5.4%的释义人类文本误标为AI生成,且18.6%的自身纯净水印输出落入不确定死区。三种方法均未满足5项Daubert因素中的2项以上。FRS计分系统虽按设计工作,但无法完全捕捉取证无用性——这一局限对未来框架设计有参考价值。结论是这些配置下的水印方法无法达到法庭要求的证据门槛。
💡 推荐理由: 直接挑战各国AI监管法律(如EU AI Act、加州SB 942)中关于水印“可靠且鲁棒”的假设,揭示水印证据在司法场景下存在根本性缺陷,影响AI内容监管法律的可执行性。
🎯 建议动作: 研究跟进