该论文研究了语言模型在安全对齐过程中,拒绝有害请求与回答良性请求之间的耦合关系。现有评估通常只关注模型的最终拒绝表现,但未能揭示模型是否真正学会了识别有害性、激活拒绝策略,还是仅将两者简单耦合。为此,作者提出了一种“双安全几何”协议,通过测量有害性载体(harmfulness carriers)、拒绝载体(refusal carriers)及其耦合程度,来深入分析安全微调的内部动态。实验基于Mistral-7B-v0.1模型,对比了标准监督微调(SFT)和鲁棒对抗微调(R2D2)两种训练轨迹,并使用了多个对齐锚点进行验证。主要发现包括:(1)对齐锚点验证了协议的有效性:拒绝侧的干预比仅有害性干预更能重新打开攻击成功,且有害性与拒绝载体近乎正交;(2)在R2D2轨迹中,早期阶段呈现高耦合状态,此时模型具有强固定源鲁棒性和饱和安全提示拒绝能力,但良性效用严重下降;后期阶段耦合降低,部分恢复良性效用,但同时攻击成功率重新上升;(3)SFT也达到了低耦合状态,但其鲁棒性显著弱于R2D2,说明低耦合本身并不能保证安全性。进一步的跨锚点诊断和稀疏GCG/AutoDAN迁移实验表明,在R2D2场景下,有害性-拒绝耦合(H/R coupling)是信息量丰富的指标,而SFT的迁移更适合用漂移或行为状态度量来解释。因果扫描支持固定协议的敏感性,但未能独立建立有害性与拒绝的通路。这些结果将H/R耦合定位为对抗微调下安全几何动态的操作性诊断工具,为后续研究如何评估和提升模型鲁棒性提供了新视角。
💡 推荐理由: 揭示了对抗微调下模型安全鲁棒性变化的内部机制,帮助安全从业者评估微调后的模型是否真正学到了拒绝有害请求,而非仅暂时耦合,对LLM安全对齐评估具有指导意义。
🎯 建议动作: 研究跟进