推荐 5.6
Conf: 50%
该论文提出了一种名为多通道扩频码水印(Multi-Channel Spread-Spectrum Code Watermarking)的新方法,用于解决大型语言模型(LLM)生成代码的归属问题。现有方案分为生成时水印和事后水印:生成时水印需要访问产生模型且无法应用于第三方代码;事后水印虽可处理任意代码,但有效载荷最多仅4比特,不足以区分大量模型配置。本文首次实现了一种事后、无需训练、具有24比特有效载荷且具备形式化鲁棒性保证的代码水印方案。该方法在变量命名约定和八对语义等价的代码模式中编码比特,并通过密钥伪随机排列将每个位置映射到码字比特,使得每个比特获得多个独立投票。多数投票吸收分布式损坏,而外层的Reed-Solomon码在集中信道攻击破坏投票时恢复标识符,从而为格式化、句法和结构攻击提供了可证明的鲁棒性边界。在来自CodeNet、GPT-4.1和Llama-4生成的1750个Python文件上,该方法实现了100%的干净检测准确率和零误报。在17种攻击类型下,它能在8次变量重命名后以97.6%的准确率恢复标识符,在10%随机位置损坏下达到94.1%的准确率,而最强的事后基线在任何单变换攻击下准确率降至0%。嵌入和检测均在CPU上不到200毫秒完成,无需训练数据或GPU。
💡 推荐理由: 这是首个具有大容量(24比特)和形式化鲁棒性保证的事后代码水印方案,能有效区分大量LLM模型配置,对代码溯源、许可管理和滥用问责有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)