本文针对大语言模型(LLM)在指令微调、专用化、量化等变换后难以进行细粒度来源追溯的问题,提出了一种无需训练的模型指纹方法 BReF(Perturbation-Response Fingerprinting)。BReF 的核心思想是:对于四个答案选项标签 A/B/C/D,比较模型在受控文本扰动下概率分布的变化方向。具体而言,对每一对模型,BReF 选择 25 个共同响应的探针,通过计算扰动对数比率(PLR)响应方向的全局余弦相似度来衡量模型间的一致性。实验基于一个包含 34 个检查点、22 个文档化直接父系关系和 411 个疑似-候选对的统一基准进行。结果表明,BReF 在 22/22 个直接父系关系上成功检索到文档化父模型(MRR=1.0000),DP-DF AUC 达到 1.0000。同家族模型间的区分更为困难(DP-SF AUC 为 0.8969),配对检验显示,与仅基于幅度的 Top-25 控制方法相比,BReF 在精确检索方面有显著提升。此外,通过与静态、随机探针、置换、校准和变换级别控制等对照实验对比,研究发现强烈的池化分离并不能保证在相近检查点之间正确排序父模型,从而验证了所提方法的优越性。该研究为 LLM 来源归属与模型识别提供了新思路,适合从事模型安全、知识产权保护及 AI 治理的研究者和工程师阅读。
💡 推荐理由: LLM 在微调/量化后来源难以追溯,BReF 提供无需训练的概率响应指纹,可辅助模型版权保护、恶意篡改检测与供应链安全。
🎯 建议动作: 研究跟进