Latent MoE 正在成为新的方向

2026年上半年,人工智能领域出现了两个值得关注的大模型发布事件:NVIDIA推出了120亿参数的Nemotron 3 Super,而Moonshot AI则上线了2.8万亿参数的Kimi K3。这两款模型体量差距悬殊,但在核心架构上做出了相同的选择——Latent MoE(潜在混合专家模型)。作为一种兼顾简洁性与高性能的架构,Latent MoE正在成为基座模型研发的新方向。
传统MoE的结构性困境
过去几年,混合专家模型(MoE)已经成为大模型扩展参数规模的主流路径,核心优势在于可以在控制单token激活计算量的前提下,通过堆叠更多专家来提升模型总容量,多款主流大模型都采用了这一架构。但随着模型参数和专家数量不断增长,传统MoE的结构性问题逐渐暴露出来。
当一个token被路由到某个专家模块时,系统需要从内存中读取该专家的权重矩阵,其尺寸为d×m,其中d是模型的隐藏维度,当前主流大模型的d通常在4096到7168之间。在多机分布式部署的场景下,每次路由还需要执行All-to-All通信操作,通信开销同样与d成正比。如果想要激活更多专家以提升模型性能,这两部分开销都会线性放大,这就是传统MoE的核心困境:想要获得更好的模型效果,就要付出极高的部署和计算成本。
针对这一问题,研究团队提出了清晰的解决思路:想要同时解决延迟和吞吐瓶颈,必须缩小隐藏维度d,但又不能随意缩减d,否则会损害模型的特征表达能力,导致性能下降。在这一约束下,Latent MoE的方案应运而生:不在原始的高维隐藏空间进行专家计算,而是先将token投影到一个更小的潜在空间中,在压缩后的空间完成专家路由和计算,最后再将结果投影回原始维度。
Latent MoE的核心实现逻辑
Latent MoE的操作流程可以分为三个关键步骤:
- 首先,原始token(维度为d)通过可学习的下投影矩阵W↓,被压缩到低维潜在空间ℓ,通常ℓ的尺寸为d的四分之一,例如1024维度
- 其次,在低维潜在空间ℓ中完成token路由和专家模块的计算
- 最后,专家模块的输出通过上投影矩阵W↑,被投影回原始的d维度,完成维度恢复
这一压缩设计带来的核心收益非常明显:专家模块的权重矩阵尺寸从d×m缩小到ℓ×m,内存读取开销降低了四分之三;同时All-to-All通信量也减少了四倍。节省下来的计算和通信资源,可以用来部署更多的专家模块,同时激活更多的专家,让模型可以同时调用更多的专业知识来处理输入token。
需要注意的是,Latent MoE并不会对所有计算环节进行压缩:路由门控、共享专家、注意力层等非路由环节的计算都保持在原始的d维度,因为这些部分并非性能瓶颈,不需要为了压缩而牺牲模型的特征表达能力。
Latent MoE的性能优势
很多人会担心,将token压缩到低维潜在空间会导致信息损失,进而降低模型的准确率。但官方发布的Latent MoE原论文给出了明确的对比结果:在相同参数量的Transformer MoE基线模型上,Latent MoE在推理、知识、代码等所有评测任务上的准确率都更高,这一结论在Hybrid Mamba-Attention MoE架构上同样得到了验证。也就是说,在同等参数量和同等推理成本的前提下,Latent MoE的准确率稳定优于标准MoE架构。
从万亿参数规模的推算数据来看,如果标准MoE想要追上Latent MoE的准确率水平,需要额外增加约350亿的参数规模。反过来理解,在准确率对齐的情况下,Latent MoE的推理速度最高可以比标准MoE快3.5倍。当然,Latent MoE并非没有额外开销:需要在专家路由前后各增加一层线性投影操作,但实测显示这部分额外开销仅约9%,远低于标准MoE为了追上精度所需投入的参数成本,整体性价比非常可观。
两款模型的不同落地实践
NVIDIA的Nemotron 3 Super采用了512个专家模块,每个token激活22个专家(Top-22),潜在维度ℓ设置为1024,也就是原始d维度的四分之一。对比常规的标准MoE(通常为Top-8激活),这意味着在相同的推理成本下,Nemotron 3 Super激活的专家数量接近标准MoE的4倍。
除了Latent MoE架构,Nemotron 3 Super还搭配了多项关键优化设计:采用Mamba-2层承担主要的序列建模任务,利用其线性时间复杂度实现了1M长度的上下文窗口;加入少量Transformer注意力层作为全局锚点,处理需要精确关联召回的任务;同时使用共享权重的Multi-Token Prediction头实现投机解码,平均接受长度达到3.45,超过了同类模型的表现。最终的实测结果显示,Nemotron 3 Super的推理吞吐是GPT-OSS-120B的2.2倍,是Qwen3.5-122B的7.5倍,而模型准确率基本持平。
Kimi K3则将Latent MoE的应用推向了更极端的规模:该模型拥有896个专家模块,每个token仅激活16个专家(Top-16),稀疏比达到56:1。在如此高的稀疏度下,专家模块的负载均衡成为了影响训练稳定性的核心问题。Kimi K3团队为此专门提出了Quantile Balancing算法,不依赖启发式更新规则,直接通过Router的score分位数推导专家分配方案,消除了传统方法中敏感的超参数设置,让2.8万亿参数规模的训练保持稳定成为可能。最终Kimi K3的缩放效率相比前代模型提升了约2.5倍,在相同的计算投入下获得了更强的智能表现。
两款模型的核心配置对比
| 配置项 | Nemotron 3 Super | Kimi K3 |
|---|---|---|
| 总参数规模 | 120B | 2.8T |
| 专家数量/Top-K激活 | 512 / 22 | 896 / 16 |
| 稀疏比 | 23:1 | 56:1 |
| 负载均衡方案 | Aux-Loss-Free | Quantile Balancing |
| 核心序列建模模块 | Mamba-2 | Transformer注意力+Mamba |
| 推理加速方案 | MTP投机解码 | 动态路由优化 |
| 核心设计目标 | 高并发低延迟推理 | 极致模型规模与性能 |
虽然两款模型的落地方向不同,一个侧重高效推理,一个侧重超大模型规模,但两者的底层逻辑完全一致:通过压缩专家模块的计算维度,将节省下来的资源转化为更大的专家组合空间,从而实现更高的模型性能与更低的计算成本。
Latent MoE的未来演进方向
Latent MoE已经解决了传统MoE的部分工程瓶颈,但仍然存在很大的提升空间。当前的Latent MoE采用固定的压缩比,未来可以探索自适应压缩比的设计:对于信息密集的复杂token,保留更多的维度;对于简单的token,则进行更彻底的压缩,这一改进可以进一步提升模型的计算效率,且实现难度并不高。
在路由端,Kimi K3的Quantile Balancing算法将负载均衡从依赖超参数的黑盒方案,转变为基于统计的确定性过程。这一思路的泛化版本,例如多头路由、基于内容的动态Top-K选择,都是值得后续实验的优化方向。
在训练端,研究团队发现使用低精度训练时,后期会出现一定比例的零梯度参数,这其实是低精度训练下结构化稀疏性自然涌现的现象。与其将这一现象视为问题,不如在架构设计时主动利用它,专门设计感知这种稀疏性的专家模块结构,可能会成为新的研发路径。
从更长远的视角来看,Latent MoE与线性序列建模技术的结合,让“1M token上下文+稀疏激活”不再只是实验室中的实验设想,而是真正可以实现产品化部署的能力。将线性序列模型用于处理长程依赖,结合Latent MoE扩展知识容量,再通过低精度训练降低计算成本,这三者的组合正在成为下一代大模型架构的主流方向。
Latent MoE的出现,为大模型的高效扩展提供了全新的解决方案,通过巧妙的维度压缩平衡了模型性能与计算成本,无论是面向高效推理的场景还是超大模型的研发,都具备广泛的应用价值。随着相关技术的不断演进,Latent MoE有望成为基座模型研发的标准架构之一。


