大语言模型(LLM)水印技术是追踪生成文本来源的重要机制。现有的统计水印方法通常有效且鲁棒,但多数依赖私有检测密钥,导致验证集中化并难以进行公开审计。近年出现的公开或公开可验证水印方案改善了密钥管理,但许多方案依赖于精确恢复嵌入的密码学字符串,在文本编辑、截断、复制粘贴或低熵生成场景下十分脆弱。本文提出 DHMark,一个面向 LLM 生成文本的公钥水印框架。其核心思想是将载荷授权与噪声文本证据分离:签发者为绑定到公共上下文的短注册载荷签名,并将该载荷扩展为大量单比特方程。生成时,基于 Diffie-Hellman 的令牌标记接口为每个候选令牌分配一个公共方程投票,采样器柔和或选择性地提升那些与授权载荷一致的候选令牌。验证时,第三方验证者利用公共信息提取令牌投票,聚合成方程级证据,并仅对已签名的注册记录进行评分。该设计避免了精确恢复长嵌入签名,而是将水印检测视为注册表辅助的统计证据聚合。文章形式化了公开验证设置,分析了标签伪随机性、注册表支撑的可靠性和采样失真,并在截断、替换、复制粘贴、错误上下文和普通生成攻击下评估了原型。在默认 32 位配置下,DHMark 在八种编辑条件下保持至少 0.967 的有效率,同时在三个负向控制上达到 0.000 的接受率。该研究适合关注 LLM 内容溯源、公开审计和鲁棒水印的研究人员与安全工程师阅读。
💡 推荐理由: 该研究为 LLM 文本溯源提供了可公开验证的公钥水印方案,解决了私有密钥集中化和长签名脆弱性问题,有助于构建可信的 AI 内容审计生态。
🎯 建议动作: 研究跟进