#refusal-training

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Andrey Labunets

本文研究大型语言模型拒绝行为的安全机制。背景是:为抵御越狱攻击,模型经过拒绝训练后会对不安全请求产生拒绝响应。已有研究发现拒绝行为往往集中于激活空间中一个低维子空间,通过向量消融即可解除拒绝,但低维结构形成的成因尚不明朗。作者以OLMo-2-0425-1B-Instruct为案例,揭示了拒绝几何本质上是拒绝训练的直接产物。具体而言,拒绝训练时模型对拒绝完成序列第一个token的损失所产生的梯度更新,其聚合方向就构成了后续的拒绝方向,并形成了拒绝子空间。通过分析不同拒绝数据集的训练动态,作者发现重复的拒绝开头(例如固定的“抱歉,我无法...”)会导致梯度和特征表示在低维子空间中高度集中,进而使拒绝向量变得脆弱,容易被消融攻击消除。进一步,通过冻结模型上的受控实验和合成微调,作者证明了“硬化杠杆”的存在:在训练中引入多样化的拒绝前缀,能够提高梯度和激活变化的稳定秩(stable rank),使拒绝特征分布到更高维的空间内,从而显著削弱单一方向消融攻击的有效性。这项研究从机制上解释了安全对齐模型中低维拒绝子空间的来源,并为训练更鲁棒的拒绝行为提供了新的原则性思路,即通过设计多样化的拒绝模板来提升安全特征的维度和鲁棒性。

💡 推荐理由: 该研究从激活几何角度解释了拒绝训练为何会产生低维弱点,并提出通过多样化拒绝前缀提高稳定秩来增强鲁棒性,为防御者设计更抗消融攻击的模型对齐提供了可操作的理论依据。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)