#open-weight-model

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yi Shi, Tanyu Chen, Kai Shen

该论文研究的是:在开放权重语言模型上被广泛引用的「方向消融(directional ablation)」白盒攻击,是否在从前沿稠密模型迁移到大规模混合专家(MoE)架构后依然成立。所谓方向消融,是指不需要基于梯度的训练、也不需要任何优化,仅用几百条对比提示即可拟合出一个「拒绝方向」,并把它从写入残差流的权重中投影移除,从而让模型丧失拒绝有害请求的能力。此前该攻击只在大约 70B 参数以内的稠密模型上得到验证,而前沿 MoE 模型的残差流不再是单一张量,权重还以量化形式发布,因此其可迁移性与作用位置都成了未解问题。 作者将其应用于 GLM-5.3-Flash(320B 参数、288 个路由专家、四路宽度超连接残差、block-FP8 量化)。结论分三层:第一,攻击确实在 MoE 架构上存活,但它命中位置与原始配方读者预期的位置不同。分别编辑注意力写入者、稠密写入者和路由专家写入者,可消除的拒绝比例分别为 0.039、0.016 和 0.148;三者联合编辑才达到 0.776,也就是说 74% 的效果只在联合干预下才出现。第二,按模块名匹配的传统配方只能覆盖 0.776 中的 0.066,这正是它在 MoE 上「静默失效」的原因——表面看没有报错,实际几乎没有削弱对齐。第三,效果具有方向特异性:消融一个与该方向正交的随机方向并不会改变拒绝行为;同时存在一个按类别聚集的残差,对暴力、色情和仇恨内容拟合的子空间在 1 至 12 的所有秩上都能保留可测量的拒绝能力,说明单方向编辑无法彻底抹除安全对齐。作者报告该方法在七个有害基准上实现 41 至 89 个百分点的拒绝率下降,且未检测到能力变化,并给出了攻击失效的边界条件。适合安全研究员、对齐与可解释性研究者、以及负责开放权重模型发布前评估的工程师阅读。

💡 推荐理由: 它证明只需数百条对比提示的白盒对齐消融在 320B MoE 上仍然有效,且传统按模块名匹配的修复思路会静默失效,同时揭示了安全对齐在类别层面存在难以根除的残差,直接影响开放权重模型的安全评估与发布决策。

🎯 建议动作: 研究跟进:将联合写入者消融测试纳入内部分发前对齐评估流程,并复核现有开放权重模型的权重完整性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)