文章摘要
近日多模态混合专家模型Qwen3.8-Flash正式发布,该模型主参数量1250亿,单token仅激活60亿参数,最高支持100万上下文长度,从多维度完成架构升级,训练开销仅为上代Qwen3.7-Plus的九分之一,性能更优。目前该模型已上线开放API服务,研发团队同时开源了作为下一代Qwen4技术雏形的Qwen3.8-Flash-Next权重,邀社区测试优化。

近日,一款全新的多模态混合专家模型正式对外发布,这款名为Qwen3.8-Flash的模型主参数量达到1250亿,额外搭载了510亿参数的N-gram嵌入模块,每处理一个token仅会激活其中的60亿参数。该模型原生支持262144个token的上下文长度,还可通过YaRN技术将上下文窗口扩展至100万token。

这款模型从四个核心维度进行了系统性升级,在提升综合能力的同时,进一步优化了计算效率、模型容量与训练稳定性。同时,相比上一代的Qwen3.7-Plus,Qwen3.8-Flash的训练开销仅为前者的九分之一,但在编码与办公类任务上的表现更为出色。

目前该模型已在官方AI服务平台上线并提供API调用服务,收费标准为每百万输入token 0.8元,每百万输出token 2.7元,缓存命中的场景则仅收取0.1元每百万token。同时,该模型首发落地办公类应用场景。

研发团队同时开源了Qwen3.8-Flash-Next的模型权重,这一新架构也是下一代Qwen4系列模型的技术雏形。提前开放该架构的目的是让社区先一步对其进行测试与验证,在正式构建完整的Qwen4模型家族前收集反馈与优化方向。更多关于该架构的设计细节、训练方法与实验数据,可查阅开源代码平台发布的技术报告。

注意力机制优化:GDN+QSA混合架构

传统的全局注意力机制虽然可以让模型直接访问所有历史上下文信息,但随着上下文长度增加,计算量与键值缓存的访存成本会快速攀升,成为长序列场景下的主要性能瓶颈。

Qwen3.8-Flash延续了Qwen3.5的混合架构设计思路,采用GDN+Attention的组合方案:在每四层网络中,三层使用Gated DeltaNet(GDN)模块,负责将历史信息持续压缩并存储在固定大小的循环状态中;剩余的一层则保留全局注意力,用于对全局信息进行精准检索。

针对这层全局注意力,研发团队进一步引入了Qwen Sparse Attention(QSA)模块。常规的稀疏注意力方案通常需要基于token级别的索引器来定位重要上下文,随着上下文长度增长,索引器本身的计算开销也会逐渐变得不可忽视。QSA则对这一流程进行了压缩优化:通过轻量级的索引器将序列聚合成micro-block,在块级别上评估上下文的重要性,再选择最相关的区域执行注意力计算。这种方式不仅减少了实际注意力的计算量,还大幅降低了寻找重要上下文的索引成本。

与跨层共享索引的方案不同,QSA在每一层内部独立完成序列压缩,对跨层注意力相似性的依赖更低,完美适配GDN与注意力交替出现的混合架构。可以简单理解为,GDN负责高效“记住”历史信息,QSA则负责精准“查找”所需的上下文内容。

实际性能测试显示,在100万token的超长上下文场景下,QSA的注意力内核在Prefill阶段实现了最高7.6倍的加速,在Decode阶段则实现了最高4.9倍的加速。在贴近线上高缓存复用的实验场景中(Prefix Cache命中率为90%),Qwen3.8-Flash在100万上下文下的Prefill吞吐达到Qwen3.7-Plus的8.6倍。

残差结构优化:Gated Residual多分支设计

在传统的Transformer架构中,所有网络层共享同一条残差流来进行信息的读写。随着网络层数加深,早期特征会不断与后续信息混合,重要信息更容易被逐渐稀释。

为解决这一问题,研发团队引入了Gated Residual(GR)机制,融合了两种前沿的架构思路:一方面借鉴Hyper-Connection的多分支残差流设计,另一方面将GatedNorm的逐元素动态门控融入残差读取流程。通过这种结合,原本单一的残差流被扩展为四条并行分支,模型可以根据当前输入内容,动态且精细地控制从各分支读取的信息比例,以及向各分支写入的信息比例。

通俗来说,这相当于将单一的信息通道扩展为多条车道:部分分支负责局部信息传递,部分分支则可以将早期信息直接保留到较深的网络层。实际分析中还观察到,其中一条分支会自然形成连接第一层注意力与大部分中后层的长距离信息通道。

此外,GR还对Hyper-Connection进行了简化:当信息的读取与写入已经足够灵活时,额外的分支混合操作并不会带来明显收益,因此可以直接省略。经过归一化的门控机制可以有效抑制激活异常值,显著提升模型训练的稳定性。同时,残差状态支持使用FP8格式存储,进一步降低了系统的访存开销。

嵌入模块优化:N-gram嵌入低成本扩展容量

研发团队参考了相关前沿工作,引入了N-gram Embedding模块,从Transformer参数之外的维度扩展模型容量。

常规的嵌入模块仅基于单个token进行查表,而N-gram Embedding则结合当前token与前几个token组成的局部上下文进行查表,能够为模型中常见的短语搭配与局部语言模式提供更丰富、更精准的额外表征。

该模块的核心优势在于,可以在几乎不增加每个token计算量的前提下,大幅增加模型的总参数量。Qwen3.8-Flash额外引入了510亿参数的N-gram Embedding,由于查询位置可以提前确定,这些参数可以存储在主机内存中,通过异步预取与模型计算重叠,无需长期占用GPU显存。最终,模型仅在前部使用一层N-gram Embedding,以极低的额外成本构建了一个大规模的“局部模式记忆库”。

训练优化:Muon优化器与架构协同设计

Qwen3.8-Flash使用Muon Optimizer进行训练,并围绕三个关键问题对Muon在大模型训练中的应用进行了优化:正交化精度、Muon与AdamW的参数分工,以及融合参数矩阵的拆分。

对于真正作为二维线性映射的参数,例如注意力、GDN与MoE专家中的主要权重,使用Muon优化器;而嵌入层、MoE路由门控、GR低秩参数等则继续使用AdamW优化器。对于工程实现中融合存储的QKV、SwiGLU与GDN Projection参数,先按照实际对应的独立线性变换进行拆分,再分别执行正交化操作。

针对新的模型架构与优化器组合,研发团队重新拟合了缩放定律,结果显示模型可以稳定使用更大的学习率与批次大小,进一步提升了收敛效率与大规模并行训练的吞吐能力。实验还发现,传统大模型训练中常用的批次大小预热流程已经不再必要:从小批次逐步增加到目标批次不仅不会改善最终效果,反而会多执行18.8%的优化器步数。因此在最终的训练配置中,直接从目标批次大小开始训练。

其他架构优化细节

除了上述四个核心优化方向,模型的其余组件沿用了Qwen3-Next确立的设计,并在Qwen3.5到Qwen3.8系列中不断打磨完善,主要包括以下几点:

  • 极致稀疏MoE:在全局负载均衡的前提下,固定每个token激活的专家数量,持续增加专家总参数量,可以稳定降低训练损失。Qwen3.8-Flash-Next采用了较大的专家池,每个token仅路由少量专家,并配合一个共享专家。
  • 多令牌预测模块:MTP模块采用多步训练方式,保持训练与推理流程的一致性,提升了推测解码场景下的接受率,同时也提升了主干模型本身的性能,其中的全注意力层也替换为QSA模块。
  • 训练稳定性设计:保留了Zero-Centered RMSNorm并对归一化权重施加权重衰减,加入注意力输出门控机制,以及对MoE路由参数进行归一化初始化。这些设计让小规模消融实验的结果更为可靠,也有助于大规模训练的平稳进行。

基础模型性能表现

研发团队将Qwen3.8-Flash-Next-Base与Qwen3.8-27B以及Qwen3.7-Plus的基础模型进行了对比测试。在仅激活60亿参数的前提下,Qwen3.8-Flash-Next-Base在14个基准测试中的8个取得了最优结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMLU;在MMLU、MMLU-Redux、GPQA、MATH与MultiPL-E这五个基准上的表现与Qwen3.7-Plus-Base接近。需要说明的是,510亿参数的N-gram Embedding采用确定性寻址方式,不计入每个token的矩阵乘预算。

总结

Qwen3.8-Flash-Next在Qwen3-Next引入的混合架构基础上,从注意力机制、残差结构、嵌入模块与训练优化四个方向进行了扩展升级:

  • QSA模块在每一层内部将序列压缩为micro-block,在保持精确检索能力的同时,降低了长上下文场景下的注意力开销与索引开销。
  • Gated Residual将残差流扩展为多条并行分支,通过逐元素动态门控控制信息读写,在几乎不增加算术开销的前提下改善了跨层信息传递与训练稳定性,同时残差状态支持FP8存储以降低访存成本。
  • N-gram Embedding通过确定性寻址的查表方式扩展模型容量,无需增加每token的计算量,且可将参数卸载到主机内存。
  • 优化方面,采用Muon作为主优化器,通过正交化精度优化、参数分工与融合矩阵拆分三个关键策略实现了更好的训练效果,并针对新架构重新拟合了缩放定律。

与此前发布Qwen3-Next时的策略一致,研发团队此次也提前开放了该架构的模型权重,希望社区能够对这一全新架构进行测试与验证。团队也将持续对该架构进行完善,逐步演进为下一代Qwen4系列模型。

以上内容不代表本平台立场,仅供读者参考