大语言模型(LLM)作为高价值资产,常面临通过重新部署、微调、量化或进一步对齐而衍生的窃取风险。由于部署后的LLM通常仅通过黑盒查询API对外暴露,所有权验证往往依赖于文本响应的比对。然而,黑盒环境下的开放式生成具有高度的表面形式可变性,重复查询结果可能不同,而现有指纹方法(如全文本匹配、软行为特征或依赖模型特定提示)在最终响应接口下较为脆弱,难以有效完成所有权验证。针对这一难题,本文提出目标反事实指纹识别(TCF)框架,将开放式生成比较转化为受限答案下的目标反事实迁移问题。具体而言,TCF将每个验证查询限制为有限的候选答案集合,从而降低表面形式差异对验证分数的干扰;同时,通过优化提示扰动,使受保护模型在扰动后的答案从原始干净答案迁移到一个预设的目标答案。验证过程只需检查嫌疑模型解析后的最终答案是否与记录的目标一致。文章进一步引入源模型反事实边际(SCM),利用仅基于受保护模型的计算度量,确保目标在扰动前出现的概率极低,而在扰动后高度可能出现,并以此控制目标选择、扰动停止及指纹筛选过程。基于局部行为接近性,作者还从理论上推导了派生模型与独立模型之间的目标准确率差距,为方法提供了可解释的保障。在四个LLM家族上的实验表明,TCF的平均AUC达到0.9861,相比TRAP、ProFLingo和ZeroPrint等方法提升0.07至0.19,验证了其较高的鲁棒性和有效性。
💡 推荐理由: 本文为LLM模型所有权验证提供了新的黑盒指纹方法,面对模型派生、微调等场景更稳健,有助于防御模型窃取争议,适合模型提供商和安全研究团队关注。
🎯 建议动作: 研究跟进