#mixture-of-experts

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Qingyu Meng, Yiwei Zha, Jiahuan Pei, Koen Hindriks, Herbert Bos, Min Chen

MoE(混合专家)是为扩展大语言模型而设计的架构,每个token仅激活少量专家模块,从而在计算量基本不变的情况下支持大规模参数增长。近年来的混合架构还引入共享专家以捕获有用的通用特征,进一步提升稳定性与泛化能力。MoE已被许多旗舰开源和商业模型采用,但在安全方面仍然脆弱。其关键问题在于,稀疏路由带来结构性脆弱性:模型的安全性取决于哪些专家被激活,而攻击者可以通过越狱提示、恶意微调,以及对安全关键神经元进行权重剪枝等手段,实际操纵这一路由选择过程。已有防御大多尝试加固路由模块,但路由过程本质上是非确定性的,一旦触发路径被操纵,仅靠路由层防御很容易失效。 本文作者首先从理论和实验上证明:共享专家是一个始终被激活的组件,内含少量安全关键神经元,能够克服稀疏激活路径带来的不确定性,可作为独立于路由器的安全锚点,从而加强模型整体的安全对齐。基于这一发现,他们提出SEAL——一种训练时的参数高效防御方法,产生一个附加到共享专家上的即插即用适配器;同时提出SEAL++变体,额外引入正交约束,在训练时保留模型原有安全子空间。在六个攻击场景下(涵盖有害提示、越狱、恶意微调三类对抗输入,以及是否叠加神经元剪枝),SEAL可将攻击成功率降低最高60%,而五个基准上的平均能力损失不超过1.4%,并且可与现有路由级防御方法无缝集成。论文为稳健的MoE安全对齐提供了新的设计方向,特别适合大模型安全研究者和引擎开发人员参考。

💡 推荐理由: MoE已成为主流大模型的架构选择,但现有安全防御多集中于路由层,容易被攻击者绕过。SEAL首次揭示共享专家可作为稳定的安全锚点,以极低训练成本显著降低攻击成功率,并与现有防御兼容,对实际大模型安全加固有直接借鉴意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 10.5
Conf: 50%
👥 作者: Rui Zhang, Wenbo Jiang, Hongwei Li, Zihan Wang, Rui Zhang, Chaoshun Zuo, Jianfei Sun, Guowen Xu

本文提出了一种针对混合专家(Mixture-of-Experts, MoE)大语言模型的新型供应链攻击方法——Load Hijack。在MoE模型的专家并行(Expert Parallelism, EP)服务架构中,不同专家被分布到多个GPU上,路由器(router)根据每个token的输入决定将其分配到哪些专家,从而间接决定GPU上的计算负载。这种调度机制暴露了一个可被恶意模型提供者利用的攻击面。攻击者仅需修改模型checkpoint中的router权重,发布被污染的模型,并保留一个私有触发器;当触发器出现在输入中时,被篡改的router会将少量token的专家分配集中到与单个GPU上共置的目标专家,使该GPU成为“掉队者”(straggler),迫使其他GPU等待,而普通输入的路由行为几乎与原始模型一致,难以察觉。作者指出,实现这种条件行为存在固有冲突:直接奖励触发输入使用目标专家的优化目标,也会导致普通输入偏向同一批专家。为解决该问题,Load Hijack设计了包含三个阶段优化的流程,在维持普通输入路由与干净参考模型接近的同时,实现强触发器依赖的专家集中。实验覆盖三个MoE模型家族和四个语料库,结果显示92.3%到95.6%的触发token分配被定向到目标专家。在真实的EP服务场景中,触发流量使得首token时间(time-to-first-token)提升至普通流量的1.43倍,吞吐量降至0.86倍。该研究首次证明了被投毒的路由器可充当触发器控制的设备调度器,从而对GPU集群造成性能降级或资源耗尽,呼吁业界对模型分发过程中的路由权重与运行时负载进行安全审计。本文适合关注大模型供应链安全、MoE推理框架鲁棒性以及模型权重完整性的安全研究人员阅读。

💡 推荐理由: 对使用MoE架构的云推理服务构成新型供应链后门威胁,攻击者无需修改推理逻辑即可造成GPU负载失衡和性能下降,且普通输入下不易被察觉,防御者需重视模型来源与权重完整性验证。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mingjian Duan, Ming Xu, Shenghao Zhang, Weili Han

本文针对密码猜测任务中现有数据驱动模型对密码结构差异忽略导致训练偏差的问题,提出了一种混合密码专家框架(MoPE)。研究背景指出,当前密码强度评估方法通常将密码视为统一数据,忽视了不同密码的结构模式(如固定长度数字串、字母数字混合等),导致模型偏向于常见结构,降低了在非典型结构密码上的猜测性能。MoPE框架的核心思想是:首先,基于密码在潜在空间中的密度聚类现象,设计了一种结构感知的专家模型生成方法,将具有相似结构模式的密码分派给专门的子模型处理;其次,引入轻量级门控机制,根据输入密码的结构特征动态选择合适的专家模型输出可靠猜测,以匹配密码猜测任务的高计算频率需求。实验部分在多个真实密码数据集上评估了MoPE在离线与在线猜测场景下的表现,结果显示,相比当前最先进基线模型,MoPE在离线破解率上提升了最高38.80%,在线猜测率提升了9.27%。此外,作者基于离线MoPE实现了实时密码强度计(PSM),可在毫秒级响应延迟内帮助用户选择更强密码。该研究为密码猜测领域提供了一种结构感知的混合专家范式,显著提升了猜测效率和泛化能力。

💡 推荐理由: 密码仍是主要认证方式,MoPE通过结构感知的混合专家模型大幅提高密码猜测准确率,并支持实时密码强度评估,对提升账户安全防御、改进密码策略有直接实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jithin S., Roshin Sleeba C., Anvin Mariya P. B., Asmitha K. A., Vinod P., Serena Nicolazzo, Antonino Nocera

恶意软件分类因二进制文件的异构性、加壳技术的存在以及恶意软件家族的多样化分布而极具挑战性。传统的单任务检测模型难以泛化到各类数据,尤其在面对混淆和稀有样本时性能下降严重。本文提出了一种基于混合专家(Mixture of Experts, MoE)架构的统一多任务恶意软件分析框架,能够同时执行三个关键任务:恶意软件家族分类、加壳与未加壳检测、恶意与良性识别。框架支持两种输入表示:高维EMBER特征集和从可移植可执行文件中提取的原始一维字节序列。通过将问题分解为多个专门化的专家网络,并采用自适应门控机制,模型实现了高效的任务特定学习,同时保持整体可扩展性。作者研究了多种架构变体,包括同构MoE、异构MoE和多门MoE(MMoE),并在标准环境和对抗性环境下(使用原始样本和变异样本)评估性能。实验结果表明,多门MoE模型表现最佳,综合检测率达到0.9744,失败率仅为2.56%。此外,该配置在突变引起的分布偏移下展现出更强的鲁棒性。研究强调专家专业化和任务特定路由在处理复杂恶意软件分布中的有效性,为构建可扩展且鲁棒的恶意软件检测系统提供了有前景的方向。

💡 推荐理由: 该框架通过多任务学习和MoE架构同时解决家族分类、加壳检测和恶意识别,显著提升了对混淆和稀有样本的检测能力,为防御方提供了更全面、鲁棒的恶意软件分析方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Weisen Jiang, Shuhao Chen, Sinno Jialin Pan

该论文提出 MetaMoE,一个隐私保护的混合专家(MoE)模型统一框架。在现实场景中,训练数据通常分布在多个客户端且无法共享,导致无法直接训练统一的 MoE 模型。MetaMoE 利用公开的代理数据作为私有数据的替代,通过多样性感知的代理选择方法,从公开数据中挑选与各客户端领域相关且多样化的样本,以有效逼近私有数据分布并监督路由器的学习。这些代理还用于对齐专家训练,改善统一时的专家协调,同时上下文感知的路由器增强了跨异构输入的专家选择。在计算机视觉和自然语言处理基准上的实验表明,MetaMoE 持续优于现有的隐私保护 MoE 统一方法。该工作为隐私约束下的 MoE 模型训练提供了新思路,适用于联邦学习、分布式专家系统等场景。

💡 推荐理由: 解决了隐私约束下无法直接训练统一 MoE 模型的痛点,提出的代理选择方法具有通用性,可推动分布式机器学习在实际隐私场景中的应用。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)