#model-supply-chain

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Gabriel Hurtado

该论文研究一个关键的安全问题:在部署开源权重的大语言模型(LLM)检查点之前,如何判断其是否被恶意剥离了“拒绝机制”(refusal mechanism,即模型原本拒绝回答有害请求的能力)。现有的运行时防护手段仅能评估模型生成的输出,而无法检测模型工件本身是否被篡改。为此,作者提出了一种无阈值的检查点审计方法,结合两种廉价且互补的内部信号:一是基于参考锚定的激活拒绝差距(activation refusal-gap),通过比较目标模型与参考模型在拒绝相关神经元上的激活差异来度量拒绝能力的保留程度;二是权重恢复能量(weight-recovery energy),计算基础模型与候选模型权重差值的重建误差,以捕捉全局权重的异常变动。这两个信号呈负相关且标签互补:差距信号提供拒绝特异性,权重能量提供高召回率。作者在包含273个检查点的注册表上(涵盖Qwen、DeepSeek-distilled Qwen、Llama和Gemma系列)进行了评估,其中包括57个公开的“abliterated”(即被剥离拒绝机制)模型和37个良性微调、合并或指令微调模型。通过将两个信号进行z-score标准化并求和(z-sum),该方法在AUROC上达到0.95,显著优于单独使用任一信号(0.84和0.90)。使用Youden指数校准的阈值在保持的模型家族上实现了0.89的平衡准确率(假阳性率0.11),仅漏掉了57个恶意检查点中的4个。进一步,论文按严重程度分析了两种失败情形:(1)伪造参考攻击:攻击者提供精心构造的参考模型,使得权重差异ΔW=0且ρ=1,从而完全绕过两个信号;(2)白盒训练逃逸:拥有模型完整信息的攻击者通过训练使得检查点超过审计阈值,同时模型仍然保持不安全且连贯。作者强调,该方法是一种有效的分类工具,而非防篡改机制:它依赖于可信的参考模型,且其声明受限于评估所用的注册表。该研究为模型供应链安全提供了低成本、可操作的前置检测手段。

💡 推荐理由: 开源LLM的供应链面临恶意修改(如剥离拒绝机制)的风险,该方法提供了一种轻量级的预部署审计方案,有望集成到模型注册与分发平台中,提升模型安全评估的自动化水平。

🎯 建议动作: 研究与跟进:评估该方法在自己所用的模型体系上的表现,并考虑将其集成到模型导入管线中。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

该论文聚焦于机器学习模型执行过程中的安全威胁。随着预训练模型的广泛复用,攻击者可以将恶意行为嵌入模型文件,而现有基于静态规则或已知签名的方法难以泛化到不同框架且无法检测未知漏洞。作者提出一种动态生命周期感知分析方法,核心观察是ML模型在明确定义的阶段(如加载、预处理、推理等)内执行,且每个阶段与宿主系统的交互高度结构化、可预测。基于此,设计了Moat框架及其实例化实现Re-Moat。Re-Moat在模型执行期间动态监控系统调用,检测异常行为。实验使用来自Hugging Face Hub的77,974个真实模型工件、31个CVE的概念验证代码以及334个来自最新数据集模型进行评估,并与当前最先进的模型扫描方案对比。结果显示,该方法能检测所有评估的攻击类别,同时保持接近零的误报率,验证了动态分析在保障ML模型执行安全中的有效性。

💡 推荐理由: 该研究为ML供应链安全提供了动态分析方法,弥补了静态扫描的不足,有望防御未知的模型后门和利用,对依赖第三方模型的组织具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)