#model-fingerprinting

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Jichao Zeng, Yanli Chen, Hanzhou Wu

本文针对大语言模型(LLM)在指令微调、专用化、量化等变换后难以进行细粒度来源追溯的问题,提出了一种无需训练的模型指纹方法 BReF(Perturbation-Response Fingerprinting)。BReF 的核心思想是:对于四个答案选项标签 A/B/C/D,比较模型在受控文本扰动下概率分布的变化方向。具体而言,对每一对模型,BReF 选择 25 个共同响应的探针,通过计算扰动对数比率(PLR)响应方向的全局余弦相似度来衡量模型间的一致性。实验基于一个包含 34 个检查点、22 个文档化直接父系关系和 411 个疑似-候选对的统一基准进行。结果表明,BReF 在 22/22 个直接父系关系上成功检索到文档化父模型(MRR=1.0000),DP-DF AUC 达到 1.0000。同家族模型间的区分更为困难(DP-SF AUC 为 0.8969),配对检验显示,与仅基于幅度的 Top-25 控制方法相比,BReF 在精确检索方面有显著提升。此外,通过与静态、随机探针、置换、校准和变换级别控制等对照实验对比,研究发现强烈的池化分离并不能保证在相近检查点之间正确排序父模型,从而验证了所提方法的优越性。该研究为 LLM 来源归属与模型识别提供了新思路,适合从事模型安全、知识产权保护及 AI 治理的研究者和工程师阅读。

💡 推荐理由: LLM 在微调/量化后来源难以追溯,BReF 提供无需训练的概率响应指纹,可辅助模型版权保护、恶意篡改检测与供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhongrui Sun, Jiahao Chen, Oubo Ma, Yuwen Pu, Zhou Feng, Haibo Hu, Shouling Ji

本文针对大型语言模型(LLM)在再分发、适配和透明API服务场景下所有权难以验证的问题。由于模型可能被微调、量化或通过黑盒API提供服务,传统的基于内部权重或部署记录的验证方式不再可靠,因此需要一种可通过黑盒交互观察的行为签名。现有黑盒指纹方法通常依赖固定查询-密钥关联,将模型身份压缩为少数记忆化关联,与模型日常行为脱节,导致鲁棒性差且容易被察觉。为此,作者提出PROSE(Provenance through Relational Organization of Semantic Expression,通过语义表达的关系组织进行来源验证)方法。PROSE摒弃固定查询集,转而使用目标语义域,并把脆弱的响应密钥替换为模型内在化的语义结构,这些结构表现为域条件的响应行为。指纹不是体现在特定词汇或规定输出上,而是体现在模型如何语义组织其域内结论。具体地,PROSE构建一个私有域特定语义模板库,通过混合微调让模型在结构干净且经过验证的响应中内化这些模板;验证时,通过检测模型对保留的自然查询的响应中是否出现指定结构来判定所有权。作者在多种模型架构、规模和目标域上进行了大量实验,结果显示:在未修改的模型上指纹检测率达100%,且无误报;模型原有能力保持完好;在经历下游微调、量化等修改和输出变换后,指纹依然具有强可检测性。这表明PROSE以分布式、自然诱发的方式在高语义层面表达模型身份,比传统固定指纹更隐蔽、更鲁棒。该工作为LLM模型溯源和知识产权保护提供了新思路。

💡 推荐理由: 随着LLM被广泛复用和API化,模型所有权盗用和知识产权纠纷日益突出。PROSE提出基于语义结构的黑盒指纹,在不损害模型能力且难以被察觉的前提下实现高置信度溯源,为模型提供方、监管方和审计方提供了一种实用的技术验证手段,对AI资产保护具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

该论文针对专有文本到图像扩散模型的知识产权(IP)保护问题,提出了一种基于“塌缩生成”(collapsed generation)现象的非侵入式模型指纹识别框架。随着此类模型以托管服务和可下载检查点形式分发,模型泄露、复制或未经授权的微调纠纷日益增多,而传统的水印方法需要侵入性地修改模型或生成过程。作者发现,塌缩生成是扩散模型学习过程中固有的、依赖模型属性的现象——某些特定输入条件会在多个随机种子下产生高度一致的输出图像。这种塌缩倾向暴露了模型特有的行为签名,从而可作为可靠的归属验证依据,无需嵌入水印。框架首先在源模型上准备塌缩条件,然后在两种访问设置下验证可疑模型:一是白盒流水线访问,可注入优化的连续嵌入;二是黑盒仅API访问,仅通过自然语言提示查询服务接口。验证依据是可疑模型能否复现源模型在随机采样下的塌缩行为。实验覆盖UNet和Transformer架构的多种扩散模型,结果表明该指纹能以较低混淆度区分不同源模型,并且在微调派生模型以及常见或自适应模型级/查询级混淆下依然可验证,同时仅需适度的验证查询预算。总体而言,该工作为扩散模型所有权验证提供了可靠的内在证据来源,有助于防御者在不干扰生成过程的前提下识别模型盗用与未授权衍生。

💡 推荐理由: 为扩散模型IP保护提供了无需水印的非侵入式指纹方案,使防御者能够通过API即可验证模型是否被窃取或未授权微调,弥补现有检测手段的不足。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Keyu Zhang, Vadim Safronov, Andrew Martin

该论文研究了大语言模型(LLM)的来源追踪(provenance testing)问题,即判断一个待检模型是否与某个源模型属于同一训练或开发谱系。现有黑盒方法大多依赖于模型输出文本的表面特征,但这些特征在模型经过微调、适配或部署环境变化时容易发生漂移,即使模型的语义理解并未改变,导致来源判定的可靠性下降。为了克服这一局限,作者提出将模型对开放型问题的输出映射到有限且离散的决策空间,从而抽象掉表面形式的变化,将来源测试转化为对“诱导决策区域”(induced decision regions)继承性的度量。基于这一思路,论文提出了Stemma,一种实用的黑盒LLM指纹识别方法。Stemma将稳定性、鲁棒性和特异性作为互补的探针选择原则,以可靠地估计决策区域的继承程度。实验环节中,作者使用56个公开检查点构建了770对源-嫌疑模型对,覆盖多种模型权重变换,Stemma取得了0.967的AUC,以及1%假阳性率下87.8%的真阳性率,显著优于四种代表性基线。此外,在覆盖91个部署实例的1260对模型上,Stemma达到了0.995的AUC和1%假阳性率下93.5%的真阳性率,证明了其对多样化推理时部署设置的鲁棒性。该研究的主要贡献包括:提出决策区域继承作为LLM来源信号、设计三种互补的探针选择原则、构建大规模评测基准,并验证了方法在不同变换和部署条件下的有效性。适合AI安全研究者、模型治理与审计人员阅读。

💡 推荐理由: LLM来源追踪是模型知识产权保护和供应链安全的关键能力。Stemma通过决策区域继承提供了一种抗表面漂移的黑盒方法,显著提升溯源准确性,对检测模型盗用、违规微调或未经授权的衍生模型具有实际价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi

本文提出了一种针对文本到图像(T2I)扩散模型的高效、鲁棒且抗合谋的模型指纹识别方法。现有模型指纹技术通过向生成图像嵌入用户特定标识符来保护知识产权,但普遍存在一个未探索的系统性漏洞:它们缺乏对抗合谋攻击的鲁棒性。合谋攻击中,多个攻击者联合其模型以移除或隐藏指纹。为此,本文首次提出具有抗合谋能力的T2I模型指纹方法。该方法将二进制位字符串(指纹)编码到个性化归一化模块(PNM)的系数中,该模块被集成到T2I模型中,使得从任何生成图像中都能可靠地恢复指纹。为防御合谋攻击并防止未授权模型再分发,引入了一种基于无损函数不变参数变换的抗合谋机制,该机制显著降低合谋模型的图像生成质量(通过增加FID指标),使其实际上不可用。此外,该方法允许开发者通过重新参数化PNM高效地创建多个带指纹的T2I模型副本,而无需重新训练。还引入了一种最坏情况优化策略,以提高对模型级攻击的鲁棒性。实验表明,该方法在多个T2I图像生成和编辑任务中实现了高保真度和鲁棒性,指纹提取准确率超过99.5%。与现有方法相比,该方法首次通过显著增加合谋模型的FID,展现出对合谋攻击的主动鲁棒性。该研究适合AI安全研究人员、模型开发者及知识产权保护相关从业者阅读。

💡 推荐理由: 揭示了现有模型指纹方法在合谋攻击下的系统性漏洞,并首次提出有效的抗合谋方案,对保护生成式AI模型的版权和防止非法分发具有重要实践意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yijia Fang, Yiqing Feng, Bingyu Li, Mingxun Zhou

本文提出了一种名为 KBF(Knowledge Boundary as Fingerprint)的低成本黑盒审计协议,用于检测大型语言模型(LLM)API 中模型替换或混合路由攻击。在 LLM 生态中,转售 API 和中间商可能欺诈性地将用户请求转发到更便宜的模型(如用 GPT-3.5 代替 GPT-4),而用户无法直接验证。KBF 的核心思想是利用 LLM 在知识边界(knowledge boundary)附近的稳定数值召回率(recall)作为模型指纹。具体方法:设计一组专门的问题,这些问题考察模型对罕见事实或边界知识的回忆能力,通过统计模型回答的正确率,形成稳定的分布特征。作者在 16 个生产级 LLM 端点上进行评估,KBF 成功识别了所有 155 个经济上相关的模型替换案例,且未误报任何相同模型的控制测试。该方法对部署变化(如温度、批次大小)具有鲁棒性,并能检测到混合路由攻击(仅 5-10% 流量被替换时即可识别)。进一步,在针对六个平台 27 个模型单元的影子 API 审计中,发现其中 7 个单元与参考端点的统计特征不一致,不一致主要集中在高级 Claude 端点上。论文的核心贡献是提供了一种无需访问模型内部结构、仅需黑盒查询即可验证模型身份的方法,对于保障 LLM API 服务的透明性和可信度具有重要意义。

💡 推荐理由: LLM API 代理欺诈日益普遍,用户难以验证模型真伪。KBF 提供低成本的审计手段,帮助安全团队和用户检测模型替换攻击,保护服务质量和预算。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)