推荐 5.6
Conf: 50%
大型语言模型(LLM)水印技术为文本溯源提供了机制,使模型所有者能够识别机器生成内容并归属到特定水印模型。然而,现有LLM水印方法主要依赖推理时采样器,且聚焦于密集模型。这类方法仅在文本通过模型所有者受控API显式生成时有效,在模型被窃取或泄露后即失效:一旦攻击者获得模型权重,可完全控制推理并直接运行未修改的采样器,绕过水印,使窃后归属无法实现。针对这一问题,本文提出了“专家水印”(Watermarking of Experts, WoE),一种利用稀疏混合专家(Mixture-of-Experts, MoE)模型独特结构特性的黑盒文本溯源方法。WoE通过偏置特定专家的词汇分布,将水印信号嵌入模型参数内部,而非依赖可绕过的推理封装,从而确保水印与模型参数固有绑定。即使攻击者使用被窃权重、泄露检查点,或从被窃架构蒸馏出次级密集模型,防御者仍可在无需访问攻击者部署环境或权重的情况下,对生成的文本进行归属。研究在8个MoE模型上评估WoE,结果显示在1%假阳性率下,平均真阳性率达90.1%,最高可达94.9%,同时基本保持模型通用能力。此外,WoE在对抗性监督微调、模型提取和输出级释义下仍保持可检测性,迫使恶意攻击者在削弱归属信号时不得不付出额外模型适配或文本重写代价,否则将牺牲输出质量。本文的方法为模型泄露后的文本溯源提供了一种不依赖推理时控制的新范式。
💡 推荐理由: 模型泄露已成为AI安全重大风险,现有水印在权重泄露后失效。WoE首次针对MoE架构实现参数内嵌水印,即使在黑盒场景下也能溯源,为蓝队、SOC和安全工程师提供了一种可落地的模型泄露归属手段,能显著提升AI供应链安全事件的事后取证能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)