#white-box-attack

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Yi Shi, Tanyu Chen, Kai Shen

该论文研究的是:在开放权重语言模型上被广泛引用的「方向消融(directional ablation)」白盒攻击,是否在从前沿稠密模型迁移到大规模混合专家(MoE)架构后依然成立。所谓方向消融,是指不需要基于梯度的训练、也不需要任何优化,仅用几百条对比提示即可拟合出一个「拒绝方向」,并把它从写入残差流的权重中投影移除,从而让模型丧失拒绝有害请求的能力。此前该攻击只在大约 70B 参数以内的稠密模型上得到验证,而前沿 MoE 模型的残差流不再是单一张量,权重还以量化形式发布,因此其可迁移性与作用位置都成了未解问题。 作者将其应用于 GLM-5.3-Flash(320B 参数、288 个路由专家、四路宽度超连接残差、block-FP8 量化)。结论分三层:第一,攻击确实在 MoE 架构上存活,但它命中位置与原始配方读者预期的位置不同。分别编辑注意力写入者、稠密写入者和路由专家写入者,可消除的拒绝比例分别为 0.039、0.016 和 0.148;三者联合编辑才达到 0.776,也就是说 74% 的效果只在联合干预下才出现。第二,按模块名匹配的传统配方只能覆盖 0.776 中的 0.066,这正是它在 MoE 上「静默失效」的原因——表面看没有报错,实际几乎没有削弱对齐。第三,效果具有方向特异性:消融一个与该方向正交的随机方向并不会改变拒绝行为;同时存在一个按类别聚集的残差,对暴力、色情和仇恨内容拟合的子空间在 1 至 12 的所有秩上都能保留可测量的拒绝能力,说明单方向编辑无法彻底抹除安全对齐。作者报告该方法在七个有害基准上实现 41 至 89 个百分点的拒绝率下降,且未检测到能力变化,并给出了攻击失效的边界条件。适合安全研究员、对齐与可解释性研究者、以及负责开放权重模型发布前评估的工程师阅读。

💡 推荐理由: 它证明只需数百条对比提示的白盒对齐消融在 320B MoE 上仍然有效,且传统按模块名匹配的修复思路会静默失效,同时揭示了安全对齐在类别层面存在难以根除的残差,直接影响开放权重模型的安全评估与发布决策。

🎯 建议动作: 研究跟进:将联合写入者消融测试纳入内部分发前对齐评估流程,并复核现有开放权重模型的权重完整性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

本文针对大型基础模型(LFMs)在开放环境中部署时面临的新型安全威胁——白盒攻击。与传统的黑盒越狱不同,白盒攻击能够直接定位并破坏模型内部的安全神经元或安全路由,而现有防御方法通常依赖静态安全单元或固定的拒绝路径,在路由级别的白盒攻击下显得脆弱。为此,作者提出动态路由自适应对齐(DRAA)框架,其核心思想是引入动态补偿路由,在安全路由被攻击者破坏时仍能维持模型的拒绝行为。具体方法包括:首先,通过对比安全与不安全校准样本的内部激活,定位模型的安全路由;然后,DRAA对该安全路由进行掩码操作,人为诱发因果性失败案例,并从中选择性地挖掘防御失败样本,从而构建包含失败信息的偏好对;最后,利用这些偏好对进行对齐训练,重新调整模型安全行为对底层路径的依赖。大量实验表明,DRAA能够有效重构模型安全性的路径依赖,显著提升模型对路由级白盒攻击的鲁棒性,同时保持模型的一般实用性。本文适合关注大模型安全防御、对抗鲁棒性以及模型内部机制分析的研究人员和工程师阅读。

💡 推荐理由: 该研究针对大模型防御中易被忽视的“路径级”白盒攻击,提出动态路由补偿的新范式,为构建可抵御针对性内部攻击的安全机制提供了可行思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)