推荐 5.5
Conf: 50%
该论文研究了大语言模型(LLM)的来源追踪(provenance testing)问题,即判断一个待检模型是否与某个源模型属于同一训练或开发谱系。现有黑盒方法大多依赖于模型输出文本的表面特征,但这些特征在模型经过微调、适配或部署环境变化时容易发生漂移,即使模型的语义理解并未改变,导致来源判定的可靠性下降。为了克服这一局限,作者提出将模型对开放型问题的输出映射到有限且离散的决策空间,从而抽象掉表面形式的变化,将来源测试转化为对“诱导决策区域”(induced decision regions)继承性的度量。基于这一思路,论文提出了Stemma,一种实用的黑盒LLM指纹识别方法。Stemma将稳定性、鲁棒性和特异性作为互补的探针选择原则,以可靠地估计决策区域的继承程度。实验环节中,作者使用56个公开检查点构建了770对源-嫌疑模型对,覆盖多种模型权重变换,Stemma取得了0.967的AUC,以及1%假阳性率下87.8%的真阳性率,显著优于四种代表性基线。此外,在覆盖91个部署实例的1260对模型上,Stemma达到了0.995的AUC和1%假阳性率下93.5%的真阳性率,证明了其对多样化推理时部署设置的鲁棒性。该研究的主要贡献包括:提出决策区域继承作为LLM来源信号、设计三种互补的探针选择原则、构建大规模评测基准,并验证了方法在不同变换和部署条件下的有效性。适合AI安全研究者、模型治理与审计人员阅读。
💡 推荐理由: LLM来源追踪是模型知识产权保护和供应链安全的关键能力。Stemma通过决策区域继承提供了一种抗表面漂移的黑盒方法,显著提升溯源准确性,对检测模型盗用、违规微调或未经授权的衍生模型具有实际价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)