MoE(混合专家)是为扩展大语言模型而设计的架构,每个token仅激活少量专家模块,从而在计算量基本不变的情况下支持大规模参数增长。近年来的混合架构还引入共享专家以捕获有用的通用特征,进一步提升稳定性与泛化能力。MoE已被许多旗舰开源和商业模型采用,但在安全方面仍然脆弱。其关键问题在于,稀疏路由带来结构性脆弱性:模型的安全性取决于哪些专家被激活,而攻击者可以通过越狱提示、恶意微调,以及对安全关键神经元进行权重剪枝等手段,实际操纵这一路由选择过程。已有防御大多尝试加固路由模块,但路由过程本质上是非确定性的,一旦触发路径被操纵,仅靠路由层防御很容易失效。 本文作者首先从理论和实验上证明:共享专家是一个始终被激活的组件,内含少量安全关键神经元,能够克服稀疏激活路径带来的不确定性,可作为独立于路由器的安全锚点,从而加强模型整体的安全对齐。基于这一发现,他们提出SEAL——一种训练时的参数高效防御方法,产生一个附加到共享专家上的即插即用适配器;同时提出SEAL++变体,额外引入正交约束,在训练时保留模型原有安全子空间。在六个攻击场景下(涵盖有害提示、越狱、恶意微调三类对抗输入,以及是否叠加神经元剪枝),SEAL可将攻击成功率降低最高60%,而五个基准上的平均能力损失不超过1.4%,并且可与现有路由级防御方法无缝集成。论文为稳健的MoE安全对齐提供了新的设计方向,特别适合大模型安全研究者和引擎开发人员参考。
💡 推荐理由: MoE已成为主流大模型的架构选择,但现有安全防御多集中于路由层,容易被攻击者绕过。SEAL首次揭示共享专家可作为稳定的安全锚点,以极低训练成本显著降低攻击成功率,并与现有防御兼容,对实际大模型安全加固有直接借鉴意义。
🎯 建议动作: 研究跟进