本文针对大语言模型(LLM)生成文本的溯源与篡改检测问题,提出了一种新型互补水印方法。现有水印技术通常对文本编辑具有鲁棒性,能够保持溯源属性,但这种鲁棒性也带来安全漏洞:攻击者可以在保留水印归属的同时对关键内容进行篡改,即所谓的“piggyback spoofing”(搭便车欺骗)。为此,作者设计了一种同时提供溯源证据和篡改证据的水印方案。该方法在每个生成的token中共同嵌入两种信号:一种鲁棒信号和一种脆弱信号。两种信号共享相同的机制(无偏锦标赛重加权),但使用独立的密钥以及不同的基于归一化文本的种子窗口,从而使鲁棒信号对编辑不敏感,而脆弱信号对读者可见的改动敏感。通过多轮无偏锦标赛重加权保持预期的生成分布,并采用周期性的轮次分配模式来调节两种信号之间的权衡。在检测阶段,两种信号的得分构成二维空间,支持三种决策结果:完整(Intact)、被篡改(Tampered)和无水印(No-Watermark)。在两个大语言模型和两个提示数据集上的实验表明,该方法在评估的各类方法中取得了最高的篡改检测率,同时保持了具有竞争力的溯源鲁棒性和困惑度(perplexity)。消融研究进一步证明,可靠的三态检测需要明确定义的“完整性”概念、两种信号的共同嵌入以及对编辑的互补敏感性。本文适合关注LLM内容安全、模型溯源、数据完整性验证的研究人员与安全工程师阅读,为在开放环境中防止内容被恶意篡改同时保留责任归属提供了新思路。
💡 推荐理由: 该研究直接针对LLM输出水印的现有安全缺陷(piggyback spoofing),在不牺牲溯源鲁棒性的前提下实现篡改检测,对AIGC内容完整性验证和责任追溯具有重要价值。
🎯 建议动作: 研究跟进