#checkpoint-audit

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Gabriel Hurtado

该论文研究一个关键的安全问题:在部署开源权重的大语言模型(LLM)检查点之前,如何判断其是否被恶意剥离了“拒绝机制”(refusal mechanism,即模型原本拒绝回答有害请求的能力)。现有的运行时防护手段仅能评估模型生成的输出,而无法检测模型工件本身是否被篡改。为此,作者提出了一种无阈值的检查点审计方法,结合两种廉价且互补的内部信号:一是基于参考锚定的激活拒绝差距(activation refusal-gap),通过比较目标模型与参考模型在拒绝相关神经元上的激活差异来度量拒绝能力的保留程度;二是权重恢复能量(weight-recovery energy),计算基础模型与候选模型权重差值的重建误差,以捕捉全局权重的异常变动。这两个信号呈负相关且标签互补:差距信号提供拒绝特异性,权重能量提供高召回率。作者在包含273个检查点的注册表上(涵盖Qwen、DeepSeek-distilled Qwen、Llama和Gemma系列)进行了评估,其中包括57个公开的“abliterated”(即被剥离拒绝机制)模型和37个良性微调、合并或指令微调模型。通过将两个信号进行z-score标准化并求和(z-sum),该方法在AUROC上达到0.95,显著优于单独使用任一信号(0.84和0.90)。使用Youden指数校准的阈值在保持的模型家族上实现了0.89的平衡准确率(假阳性率0.11),仅漏掉了57个恶意检查点中的4个。进一步,论文按严重程度分析了两种失败情形:(1)伪造参考攻击:攻击者提供精心构造的参考模型,使得权重差异ΔW=0且ρ=1,从而完全绕过两个信号;(2)白盒训练逃逸:拥有模型完整信息的攻击者通过训练使得检查点超过审计阈值,同时模型仍然保持不安全且连贯。作者强调,该方法是一种有效的分类工具,而非防篡改机制:它依赖于可信的参考模型,且其声明受限于评估所用的注册表。该研究为模型供应链安全提供了低成本、可操作的前置检测手段。

💡 推荐理由: 开源LLM的供应链面临恶意修改(如剥离拒绝机制)的风险,该方法提供了一种轻量级的预部署审计方案,有望集成到模型注册与分发平台中,提升模型安全评估的自动化水平。

🎯 建议动作: 研究与跟进:评估该方法在自己所用的模型体系上的表现,并考虑将其集成到模型导入管线中。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)