📅 2026年7月31日(周五)
稀疏混合专家模型(Sparse Mixture of Experts, SMoE)是一种参数高效的神经网络架构,通过让不同的子模型(称为「专家」)处理不同类型的输入,实现了高效的条件计算。在大规模语言模型时代,SMoE因其能够大幅增加模型参数而不显著增加计算成本的特性,成为了构建超大规模模型的关键技术。
1. 路由稳定性问题:SMoE模型中,如何决定每个输入token分配给哪个专家是一个关键问题。常见的token-to-expert路由(Token选择专家)方式在训练后期会产生严重的「路由波动」——同一个token在不同时刻被分配给不同的专家,导致训练不稳定。
2. 负载均衡困境:简单的贪心路由容易导致某些专家被大量token选择,而其他专家利用率低。这种负载不均衡既浪费了模型容量,也增加了通信开销。
3. 可扩展性限制:在分布式训练中,MoE模型需要在多个GPU/TPU间交换token,通信成本成为了新的瓶颈,限制了模型的扩展性。
标准数据集:
常见指标:困惑度(Perplexity)用于语言建模任务,准确率(Accuracy)用于分类,路由效率指标(expert utilization, load balance ratio)用于衡量架构效率。
学术界在MoE设计上存在三个主要的技术分歧:
标题: Improving Routing in Sparse Mixture of Experts with Graph of Tokens
作者: Tam Nguyen, Ngoc N. Tran, Khai Nguyen, Richard G. Baraniuk
发表: arXiv:2505.00792, 提交于2025年5月
领域: 模型架构、效率、稀疏学习
这篇论文观察到稀疏混合专家模型在训练过程中存在一个被忽视但严重的问题:路由波动(routing fluctuations)。具体来说,同一个token在训练的不同阶段会被分配给不同的专家,而这种不稳定的路由导致了训练过程中的梯度噪声和模型性能下降。
作者通过概率图模型(Probabilistic Graphical Model, PGM)的视角重新审视了SMoE,指出传统token-choice路由的根本问题在于独立性假设——在决定每个token的专家分配时,完全忽视了同一个样本内其他token之间的关系和相似性。这种独立性假设导致了路由的不稳定性。
论文的核心洞察是:破除独立性假设,通过建立token间的相互依赖来稳定路由。
作者提出了两个创新的路由机制:
论文的叙事结构如下:
标准的token-choice路由可以表示为:
其中 u_i 是第i个token的表示,W_e 是可学习的gate权重矩阵。这个过程对每个token独立进行,没有考虑其他token。
在PGM的角度,这相当于在图中每个token节点是独立的、没有任何边连接。论文的关键贡献是引入了额外的结构:
方法1:计算token间的相似性矩阵
其中 τ 是温度参数。这个相似性矩阵表达了在序列内不同位置token间的关联程度。
然后,修改的gate函数变为:
直观地说,一个token的专家选择会被「邻近」(在相似性上)的token的选择所影响。这自然地降低了同一区域内token的路由多样性,从而稳定了整体的路由。
方法2:直接使用自注意力矩阵
其中 A_h 是第h个注意力头的注意力矩阵。这个做法的优势在于:
W_s 和 α),降低了计算开销。关键设计选择:
| 参数 | 说明 | 实验设置 |
|---|---|---|
| τ (温度) | 控制相似性分布的锐度 | 0.1 - 1.0, 论文用0.5 |
| α (S-MoE权重) | 相似性对gate的影响强度 | 0.1 - 0.5, 论文用0.3 |
| β (A-MoE权重) | 注意力对gate的影响强度 | 0.2 - 0.8, 论文用0.5 |
| top-k | 每个token选择的专家数 | k=2, 与Switch Transformer一致 |
重要设计选择:论文指出超参数(α, β, τ)在所有数据集上使用统一设置,未针对具体任务调优。这是一个关键的声称,见下文审视清单。
论文进行了全面的实验,涵盖三个主要领域:
数据集: WikiText-103, 103M tokens,常用于语言模型基准评测。
模型配置: Transformer with 2个专家(K=2),12层,hidden=768。
对比方法:
| 方法 | 类型 | 特点 |
|---|---|---|
| Dense Transformer | Baseline | 标准稠密模型,用于上界比较 |
| Switch Transformer | 基础SMoE | K=1, token-choice, 辅助loss |
| SMoE-Dropout | 改进方案 | 在training中随机drop专家 |
| Baseline SMoE | 本文baseline | K=2, 标准softmax gating |
主要结果(困惑度 / Perplexity):
| 方法 | 测试困惑度 | 改进 | 对抗攻击下的困惑度 |
|---|---|---|---|
| Baseline SMoE (K=2) | 34.84 | — | 43.59 |
| S-MoE (相似性感知) | 32.03 | ↓ 8.1% | 39.92 |
| A-MoE (注意力感知) | 32.23 | ↓ 7.5% | 40.85 |
注意对抗鲁棒性测试使用了word-swap攻击,测试了模型在面对输入扰动时的稳定性。改进的路由机制在这个场景下也表现更好。
模型: Vision MoE (V-MoE) backbone with 8 experts.
结果:
| 模型 | ImageNet-1K Top-1 | ImageNet-R | ImageNet-A |
|---|---|---|---|
| V-MoE Baseline | 72.71% | 42.15% | 28.60% |
| A-MoE | 73.33% | 43.92% | 30.78% |
| 改进幅度 | +0.62pp | +1.77pp | +2.18pp |
有趣的观察:在分布外数据集(ImageNet-R, ImageNet-A)上的改进幅度更大,暗示稳定的路由对模型的泛化性能特别重要。
数据集: SST-2 (情感分类), SST-5 (细粒度情感), Banking-77 (意图分类)
结果示例(Banking-77):
| 方法 | 准确率 |
|---|---|
| Baseline SMoE | 83.96% |
| A-MoE | 85.84% |
| 改进 | +1.88pp |
论文的一个核心贡献是量化了路由波动。通过追踪同一token在训练不同step的专家分配变化,发现:
同时,专家选择的熵(entropy)也显著下降,表明路由决策变得更加确定和一致。
这一部分是本报告的重点,进行独立的批判性分析。
发现: 论文主要报告困惑度和分类准确率,但没有直接报告以下关键效率指标:
影响: ⚠️ 重要。如果额外计算和内存开销超过了性能收益,这个方法在实际部署中的价值会大打折扣。
发现: 论文声称 α, β, τ 跨所有数据集和模型大小使用统一设置,未调优。这看起来很有吸引力。
疑问: 但在实验部分,我们看到:
隐性问题: 如何确定这些「统一」的超参是最优的?论文没有显示任何超参敏感性分析。很可能针对具体任务微调超参会带来额外的改进,但这样的话,性能提升有多少来自方法本身,多少来自调优?
影响: ⚠️ 中等。「无需调优」的说法需要对敏感性的证据支持,目前论文缺乏。
发现: 论文将改进归因于「路由稳定性提升」,但没有完全隔离这个因素。
质疑:
影响: ⚠️ 高。这影响了对该工作贡献大小的判断。
发现: 论文在固定的模型配置(12层, 768维, 2-8专家)上报告结果。
问题:
影响: ⚠️ 中等。限制了对该方法在超大规模模型上适用性的理解。
发现: 论文只展示了成功的案例。
缺失的分析:
影响: ⚠️ 中等。生产环境会遇到各种edge case,论文缺乏discussion。
论文的宣称: 「通过建立token间的依赖关系,我们提供了一个通用的、高效的、无需调优的方法来稳定MoE路由。」
证据范围:
「通用」的宣称基于有限的任务覆盖。同样,「高效」还没有充分证明(见第1点)。
影响: ⚠️ 低到中等。这是一个常见的夸大问题,但论文的实验在各自涉及的领域还是比较全面的。
发现: 论文提供了详细的超参数设置和数据集描述,但在arXiv发布时(2025年5月),代码和预训练权重是否公开未知。
评估:
影响: ⚠️ 低。科学贡献不依赖于代码公开,但工业应用会受阻。
概率图模型视角是这篇论文最有价值的部分。将MoE中的路由稳定性问题从图模型视角重新解释,为后续的路由设计提供了一个新的理论框架。这个贡献在5-10年内仍会有参考价值。
具体的S-MoE和A-MoE方法可能主要是工程类的增益。8%的困惑度改进在当前的LLM竞争中是显著的,但改进来自于「加入了额外信息」而非根本性的突破。如果换一个baseline架构(如Expert Choice Routing)或加入其他稳定化技术,这个8%的相对改进可能会缩小。
这篇论文不是一项MoE架构的根本突破,也不是一个可以直接应用到任意大规模系统的现成方案(因为还有效率问题待解)。它是一项增量改进工作,在特定的模型规模和任务上展示了稳定性和性能的提升。
基于这篇论文和相关工作,笔者认为值得深入的下一步方向如下(按预期收益÷实现难度排序):
作者: William Fedus, Barret Zoph, Noam Shazeer (Google)
发表: Journal of Machine Learning Research, Vol 23 (2022) | arXiv:2101.03961
基础的稀疏MoE工作,token-choice + 辅助loss范式的奠基者
作者: Nan Du, Yanping Huang, Andrew M. Dai, Simon Tran, Bobby Dolan, David So, others (Google)
发表: ICML 2022 | arXiv:2112.06905
大规模MoE模型(1.2T参数)的系统工程工作
作者: Yanqi Zhou, Tao Lei, Hanxiao Liu, Nan Du, Yanping Huang, Vincent Y. Zhao, Andrew M. Dai, Zhifeng Chen, Quoc V. Le, James Laudon (Google)
发表: NeurIPS 2022 | arXiv:2202.09368
arXiv | NeurIPS PDF | Google Research Blog
反向路由的突破性工作,完美负载均衡
作者: Carlos Riquelme, Joan Puigcerver, Basil Mustafa, and others (Google)
发表: NeurIPS 2021 | arXiv:2106.05974
Vision MoE的基础工作,将MoE扩展到ViT领域
作者: Xiaohan Ding, Yong Deng, and others
发表: arXiv:2309.04354 (2023)
高效的Vision MoE设计,针对移动设备优化
作者: (详见arXiv)
发表: arXiv:2408.15664 (2024)
无辅助loss的均衡方法,改进token-choice范式
作者: (详见arXiv)
发表: arXiv:2602.08019 (2026)
最新的MoE综述,涵盖了本报告发布前的全部关键工作
作者: (详见arXiv)
发表: arXiv:2506.14038 (2025)
同期的相似性感知路由工作,与本论文互补
本报告遵循严格的事实核查标准。以下是核实情况说明:
「价值与局限性分析」一节中的所有观点(7条审视清单)都是基于论文内容的独立分析,不代表论文作者立场,也不代表学术界的共识。这些是一位资深研究者对该工作的批判性评估。
建议:读者在引用本报告或依据本报告做决策时,应参考以下补充资源: