#open-weight-models

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith

开放权重语言模型的安全护栏可被"拒绝特征消融"(Refusal Feature Ablation, RFA) 轻易绕过:该技术通过对比估计器在模型残差流中定位出一条线性"拒绝方向",并将其投影剔除,从而在几乎不损失模型通用能力的前提下获得很高的攻击成功率 (ASR)。针对这类攻击的传统防御通常需要对每一个新的模型检查点进行安全微调,计算成本高昂、难以规模化。本文提出"诱饵方向优化"(Decoy Direction Optimization, DDO),一种快速的事后权重编辑防御,无需对基座模型做任何微调。其核心机理洞察是:消融攻击依赖对比估计器来寻找拒绝方向,因此与其试图隐藏真实的拒绝回路,不如主动向网络 MLP 神经元中注入一个高幅值、非线性的诱饵信号。当攻击者尝试定位拒绝方向时,该诱饵会污染其估计器,诱导攻击者错误地消融一个无害的正交特征,而真实的安全机制仍保持完好。作者进一步给出了刻画这一效应的形式化谱界 (spectral bound) 证明。实验方面,DDO 在六个模型家族上进行了评估,在标准 RFA 攻击下 ASR 低于 10%;在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 与经过训练的防御基线表现相当(最坏情况 ASR 65% 对 58%),并将 Heretic 权重级攻击的 ASR 从 88.7% 降至 18%,而每配置的优化成本仅为训练式基线的 1/30 至 1/450。

💡 推荐理由: 开放权重模型一旦发布,任何人都能对权重做后处理,消融类攻击成本极低,而传统防御需逐检查点微调,难以规模化。DDO 提供了一种低成本事后加固路径,对模型发布方、模型托管平台与下游部署团队有直接工程价值,也提出"防御即扰动攻击者估计器"这一新范式。

🎯 建议动作: 研究跟进,并纳入内部模型发布安全评估流程试点

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)