#model-supply-chain

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

本文提出 DiffSafeMerge (DSM),解决扩散模型 checkpoint 合并过程中的后门继承问题。在无条件下扩散模型合并场景中,通常假设来自公共仓库的 checkpoint 是良性来源,但攻击者可能发布一个包含休眠后门的恶意 checkpoint。当它与良性模型合并后,生成的图像在常规条件下表现正常,但一旦遇到特定触发器,就会产生攻击者指定的目标输出。由于防御方不知道哪个源是恶意的、触发器形状或目标类别,直接对合并后的模型进行广泛消毒(sanitization)又可能显著降低生成图像质量,因此缓解十分困难。DSM 的核心理念是:仅使用一个小的未标记干净数据集和一组固定的、与具体攻击无关的“压力探针”,对参与合并的源模型各个层块(blocks)进行评分,识别出可疑贡献;然后将其权重向一个可信的参考模型收缩,并在一个干净去噪损失预算的约束下选择衰减强度,从而在不破坏正常生成能力的前提下削弱后门。论文评估了四种不同的后门攻击、两个数据集和 21 个目标条件。结果表明,在 14 个源案例中,有 10 个案例的预期合并操作本身就已实现 worst-target ASR(最差目标攻击成功率)为零;DSM 能够保持这些良性结果,在其余 4 个案例中,三个不同随机种子下都没有记录到任何目标匹配,其中包括三个基线 ASR 高达 48%–100% 的案例。与在两个数据集上均能达到零 worst-target ASR 的其他防御方法相比,DSM 在 seed-0 的匹配比较中获得了最低的案例平均 FID,说明其在防御后门的同时保持了最好的生成质量。该研究面向模型供应链安全、扩散模型安全以及 AI 模型可信赖部署方向,适合模型安全研究员、ML 系统防御者和安全工程师阅读。

💡 推荐理由: 扩散模型合并已成为基础模型供应链中的常见操作,但也引入了隐蔽后门注入风险。DSM 提供了无需知道恶意源、触发器或目标的缓解思路,对保护模型集成流程有直接参考价值,可迁移到其他生成模型合并场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gabriel Hurtado

该论文研究一个关键的安全问题:在部署开源权重的大语言模型(LLM)检查点之前,如何判断其是否被恶意剥离了“拒绝机制”(refusal mechanism,即模型原本拒绝回答有害请求的能力)。现有的运行时防护手段仅能评估模型生成的输出,而无法检测模型工件本身是否被篡改。为此,作者提出了一种无阈值的检查点审计方法,结合两种廉价且互补的内部信号:一是基于参考锚定的激活拒绝差距(activation refusal-gap),通过比较目标模型与参考模型在拒绝相关神经元上的激活差异来度量拒绝能力的保留程度;二是权重恢复能量(weight-recovery energy),计算基础模型与候选模型权重差值的重建误差,以捕捉全局权重的异常变动。这两个信号呈负相关且标签互补:差距信号提供拒绝特异性,权重能量提供高召回率。作者在包含273个检查点的注册表上(涵盖Qwen、DeepSeek-distilled Qwen、Llama和Gemma系列)进行了评估,其中包括57个公开的“abliterated”(即被剥离拒绝机制)模型和37个良性微调、合并或指令微调模型。通过将两个信号进行z-score标准化并求和(z-sum),该方法在AUROC上达到0.95,显著优于单独使用任一信号(0.84和0.90)。使用Youden指数校准的阈值在保持的模型家族上实现了0.89的平衡准确率(假阳性率0.11),仅漏掉了57个恶意检查点中的4个。进一步,论文按严重程度分析了两种失败情形:(1)伪造参考攻击:攻击者提供精心构造的参考模型,使得权重差异ΔW=0且ρ=1,从而完全绕过两个信号;(2)白盒训练逃逸:拥有模型完整信息的攻击者通过训练使得检查点超过审计阈值,同时模型仍然保持不安全且连贯。作者强调,该方法是一种有效的分类工具,而非防篡改机制:它依赖于可信的参考模型,且其声明受限于评估所用的注册表。该研究为模型供应链安全提供了低成本、可操作的前置检测手段。

💡 推荐理由: 开源LLM的供应链面临恶意修改(如剥离拒绝机制)的风险,该方法提供了一种轻量级的预部署审计方案,有望集成到模型注册与分发平台中,提升模型安全评估的自动化水平。

🎯 建议动作: 研究与跟进:评估该方法在自己所用的模型体系上的表现,并考虑将其集成到模型导入管线中。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

该论文聚焦于机器学习模型执行过程中的安全威胁。随着预训练模型的广泛复用,攻击者可以将恶意行为嵌入模型文件,而现有基于静态规则或已知签名的方法难以泛化到不同框架且无法检测未知漏洞。作者提出一种动态生命周期感知分析方法,核心观察是ML模型在明确定义的阶段(如加载、预处理、推理等)内执行,且每个阶段与宿主系统的交互高度结构化、可预测。基于此,设计了Moat框架及其实例化实现Re-Moat。Re-Moat在模型执行期间动态监控系统调用,检测异常行为。实验使用来自Hugging Face Hub的77,974个真实模型工件、31个CVE的概念验证代码以及334个来自最新数据集模型进行评估,并与当前最先进的模型扫描方案对比。结果显示,该方法能检测所有评估的攻击类别,同时保持接近零的误报率,验证了动态分析在保障ML模型执行安全中的有效性。

💡 推荐理由: 该研究为ML供应链安全提供了动态分析方法,弥补了静态扫描的不足,有望防御未知的模型后门和利用,对依赖第三方模型的组织具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)