#signature-filtering

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Chih-Duo Hong, Yen-Pang Chen, Fang Yu

本文提出了一种轻量级的检测时间模块——签名过滤(signature filtering),旨在提升大型语言模型(LLM)输出中统计水印的检测性能。现有的水印检测器在水印信号弱、文本重复或水印被编辑时往往表现不佳。签名过滤不修改水印嵌入和文本生成过程,而是学习一小部分“签名”标记,这些标记的存在会使水印测试不可靠,并在检测前将其移除。签名通过在一个小型训练集上求解混合整数线性规划获得,约束条件最大化真阳性率。作者还推导了在几种攻击者模型(色盲、色彩适应和分布相关)下的有限样本和渐近界。在四种知名水印族(Kgw、Sweet、Unigram、Exp)、四个基准语料库(C4、MBPP、HumanEval、Code-Search-Net)和六个LLM(Opt-1.3b、Opt-6.7b、Llama2-13b、Llama3.1-8b、Qwen2.5-14b、Phi-3-medium-14b)上的实验表明,2-gram和3-gram签名在弱信号和低熵设置下将检测率从无过滤时的8-31%提升到78-99%,同时保持假阳性率可控且通常可忽略。在压力测试中(句子打乱、25-50%的令牌被稀释、删除和替换),Kgw风格水印的2-gram过滤器保留了大部分干净文本的检测增益,通常匹配或优于先进的WinMax水印检测器。签名过滤提供了一种简单、可扩展且模型无关的附加模块,用于加强信息处理工作流中LLM文本的基于水印的溯源检查。

💡 推荐理由: 该研究为LLM输出溯源提供了一种轻量级增强方案,无需修改现有水印系统即可显著提升检测率,尤其适用于弱信号和低熵场景,有助于组织更可靠地归因AI生成内容。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)