通义千问发布Qwen3.8-Flash-Next:125B参数仅激活6B

2026年8月26日,通义千问正式发布Qwen3.8-Flash-Next,这是阿里Qwen团队基于下一代Qwen4架构打造的多模态MoE开源模型。Qwen3.8-Flash-Next以125B总参数、每token仅激活6B的超高稀疏度,在SWE-bench Pro、MMLU-Pro等14项基准测试中的8项取得最优成绩。训练成本仅为前代Qwen3.7-Plus的九分之一,推理定价每百万输入Tokens仅0.16美元。作为Qwen4架构的“技术预告片”,Qwen3.8-Flash-Next彻底重构了注意力、残差、嵌入和优化四大核心模块。

一、Qwen3.8-Flash-Next是什么?Qwen4架构的“技术预告片”
1.1 定位:不是旗舰,胜似旗舰
Qwen3.8-Flash-Next的名字本身就透露了它的身份。“Flash”是Qwen系列中端、效率优先的品牌线——用部分原始算力上限换取显著更低的成本和更快的推理速度。“Next”则表明这是下一代架构的蓝图。
Qwen团队在官方公告中明确表示,Qwen3.8-Flash-Next扮演的角色与当年Qwen3-Next对Qwen3.5系列所起的作用完全相同——提前释放架构层面的革新,让全球AI开源社区在完整Qwen4模型家族推出之前,先对这些改动进行检验。换言之,Qwen3.8-Flash-Next并非Qwen4本身,而是Qwen4架构的“技术预告片”。
权重已在Hugging Face和魔搭社区(ModelScope)全面开源。官方同时发布了BF16和FP8两个版本。
1.2 核心规格一览
| 规格项 | Qwen3.8-Flash-Next |
|---|---|
| 模型类型 | 多模态MoE(带视觉编码器的因果语言模型) |
| 总参数 | 125B MoE + 51B N-gram Embedding + 4B MTP |
| 每Token激活参数 | 6B |
| 层数 | 48层(36层GDN + 12层QSA) |
| MoE专家数 | 512个专家(Top-10路由 + 1个共享专家激活) |
| 原生上下文 | 262,144 tokens |
| 扩展上下文 | 1M tokens(通过YaRN) |
| 许可协议 | qwen-community-1.0 |
二、四大架构革新:Qwen3.8-Flash-Next凭什么“四两拨千斤”?
Qwen3.8-Flash-Next在注意力(Attention)、残差(Residual)、嵌入(Embedding)、优化(Optimization) 四个方向进行了系统升级。
2.1 注意力:GDN + QSA混合架构
在注意力机制方面,Qwen3.8-Flash-Next采用GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。
GDN(Gated DeltaNet) 负责高效压缩历史信息,将长序列压缩为固定大小的状态。QSA(Qwen Sparse Attention) 则是此次架构升级的核心亮点——它通过轻量级Indexer在micro-block粒度上筛选重要上下文,大幅降低长序列的注意力计算开销。
具体来说,48层中36层采用GDN线性注意力层,12层采用QSA稀疏注意力层。这种3:1的混合比例,既保留了GDN的高效压缩能力,又通过QSA在关键位置进行精确的全局检索。
面对1M token的超长上下文,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。在90%前缀缓存命中率的实际服务场景中,Qwen3.8-Flash-Next的预填充吞吐量相比前代Qwen3.7-Plus提升了8.6倍。
2.2 残差:Gated Residual(GR)
Qwen3.8-Flash-Next引入Gated Residual(GR)机制,将残差流扩展为4条并行分支,通过动态Gate控制信息的读写。
这一设计的价值在于:传统残差连接是单一的信息通道,而GR通过4条分支并行处理、动态门控选择,显著强化了跨层信息流动和训练稳定性。残差状态支持FP8存储,大幅降低访存开销。通过FlashInfer的高性能Mix/Combine HyperConnection算子,实现了2.05倍的内核级加速。
2.3 嵌入:51B N-gram Embedding
Qwen3.8-Flash-Next在主模型125B参数之外,额外配备了51B参数的N-gram Embedding。
N-gram Embedding利用局部上下文查表来扩展模型容量。关键设计在于:这些嵌入参数可以卸载至Host Memory,通过异步Prefetch与模型计算重叠,不长期占用GPU显存。这使得在单张RTX PRO 6000(96GB显存)上就能跑满262K上下文。
2.4 优化:Muon Optimizer + 重新拟合Scaling Law
在优化层面,Qwen3.8-Flash-Next采用Muon Optimizer,并针对正交化精度、Muon与AdamW的分工协作、融合矩阵拆分等策略进行了精细化调整。针对新架构重新拟合了Scaling Law。
三、性能实测:6B激活参数如何打赢千亿级对手?
3.1 基准测试:14项中的8项SOTA
在仅激活6B参数的前提下,Qwen3.8-Flash-Next-Base在14个主流基准测试中的8项取得SOTA(最优)成绩,涵盖MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU等高难度评测集。
| 基准测试 | Qwen3.8-Flash-Next | Claude Opus 4.6 Max | DeepSeek-V4-Flash |
|---|---|---|---|
| MMLU-Pro | 73.23 | 68.60 | 70.90 |
| MMLU-Redux | 90.36 | 87.51 | 90.43 |
| SWE-bench Pro | 62.5 | 53.4 | 55.8 |
| DeepSWE 1.1 | 58.7 | — | 54.4 |
| LiveCodeBench v6 | 91.9 | — | — |
| CoWorkBench | 73.9 | 68.2 | — |
| JobBench | 55.7 | 36.6 | — |
3.2 与Claude Opus 4.6的正面交锋
Qwen3.8-Flash-Next在多项关键基准上全面超越Anthropic的Claude Opus 4.6 Max:
- SWE-bench Pro:领先9.1分(62.5 vs 53.4)
- JobBench:领先近20分(55.7 vs 36.6)
- AndroidWorld:领先22.5分(84.5 vs 62.0)
- MathVision:领先25.1分(90.6 vs 65.5)
- CoWorkBench:领先5.7分(73.9 vs 68.2)
3.3 与开源模型的横向对比
在开源模型阵营中,Qwen3.8-Flash-Next同样表现突出:
| 对比维度 | Qwen3.8-Flash-Next vs 开源模型 |
|---|---|
| 总对战记录 | 31胜 / 16负 |
| 中位百分位差距 | +8.7分 |
| 最大领先 | LiveCodeBench +83.0分 |
在BenchmarkList的综合能力指数(ECI)排名中,Qwen3.8-Flash-Next位列第15名(共871个模型) 。在指令遵循(Instruction Following)类别中高居第5名。
四、成本革命:训练九分之一,推理仅对手3%
4.1 训练成本:仅为前代的1/9
相比Qwen3.7-Plus,Qwen3.8-Flash-Next的训练成本仅约为前者的九分之一。这一成本降幅得益于全新架构在计算效率上的根本性突破——GDN的高效历史压缩、QSA的稀疏注意力、Gated Residual的FP8存储、N-gram Embedding的Host卸载,四大革新协同作用,使得每token的计算开销大幅降低。
4.2 推理成本:每百万Tokens仅0.16美元
生产版本Qwen3.8-Flash通过QwenCloud提供API服务:
| 定价项 | 价格 |
|---|---|
| 每百万输入Tokens | $0.16(约1元人民币) |
| 每百万输出Tokens | $0.47(约3元人民币) |
这一价格是Claude Opus 4.6的约3% ,是DeepSeek-V4-Flash闲时价格的约2/3。
4.3 部署成本:单卡跑满262K
在硬件部署方面,Qwen3.8-Flash-Next展现出惊人的效率。开发者报告显示:
- 单张RTX PRO 6000(96GB显存) 即可在满262K上下文下实现180-226 tokens/秒的单流解码
- 通过NVFP4量化,MTP模块仅占用0.51GB显存
- 2台DGX Spark(MTP4 + CUDA Graphs) 在智能体工作负载下可达**~70 tokens/秒**,超越4张RTX 3090的~43 tokens/秒
- 4张RTX 3090通过GGUF量化(~3-bit)可实现**~43 tokens/秒**的稳定解码
- 甚至可在75GB统一内存的设备上无GPU显存运行
五、多模态与长上下文:不止于文本
5.1 原生多模态能力
Qwen3.8-Flash-Next是一款原生多模态MoE模型,支持文本、图像和视频输入。在多模态智能体评测中表现亮眼:
| 多模态基准 | Qwen3.8-Flash-Next | Qwen3.8-27B | Claude Opus 4.6 Max |
|---|---|---|---|
| ClawEval-MM | 64.4 | 57.4 | 52.5 |
| Vision2Web | 64.0 | 62.9 | 42.1 |
| RealWorldQA | 88.5 | 86.9 | 73.9 |
| LVBench(长视频理解) | 76.6 | 76.2 | 63.0 |
| 多模态智能体平均 | 60.4 | 60.1 | 54.7 |
5.2 262K原生上下文,可扩展至1M
Qwen3.8-Flash-Next原生支持262,144 tokens的上下文窗口,通过YaRN可扩展至1M tokens。在1M token的超长上下文中,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。
5.3 智能体能力突出
Qwen3.8-Flash-Next在智能体(Agentic)类别中排名第13位(共138个模型) 。具体表现:
| 智能体基准 | Qwen3.8-Flash-Next | 竞品对比 |
|---|---|---|
| AndroidWorld | 84.5 | 领先Opus 4.6达22.5分 |
| OSWorld 2.0 | 52.3(Partial) | 远超Opus 4.6的21.5 |
| Toolathlon | 领先hy3达54.2分 |
六、行业影响与独到见解
6.1 “效率优先”正在改写游戏规则
Qwen3.8-Flash-Next最值得关注的信号不是“又一个大模型”,而是大模型竞争正在从“参数规模竞赛”转向“效率竞赛” 。
125B总参数、仅激活6B——这意味着Qwen3.8-Flash-Next在推理时只用了不到5%的参数。而它却在SWE-bench Pro上击败了Claude Opus 4.6,在MMLU-Pro上超越了参数量大得多的竞品。这证明:模型的智能水平不再与参数规模简单挂钩,架构效率才是决定性的变量。
正如Qwen团队在官方发布中所言:问题不再是能扩展多少,而是能多高效地扩展。
6.2 开源策略的“阳谋”
Qwen3.8-Flash-Next的开源策略值得深入解读。它不是Qwen4本身,而是Qwen4架构的“预览版”。Qwen团队选择在完整Qwen4推出之前,将架构改动提前交给全球开源社区检验。
这是一种极其聪明的策略:
- 降低风险:让社区提前发现架构问题,避免Qwen4重蹈覆辙
- 建立生态:SGLang、vLLM、llama.cpp等框架在发布当天就提供了Day-0支持
- 获取反馈:全球开发者的使用数据和反馈,为Qwen4的最终优化提供宝贵参考
6.3 价格战的“终极形态”
Qwen3.8-Flash的API定价——每百万输入Tokens仅0.16美元——已经将大模型推理成本推至新低。这不仅是商业竞争,更是技术能力的直接体现:只有架构足够高效,才能支撑如此低廉的定价而不亏损。
值得注意的是,生产版本Qwen3.8-Flash默认支持1M上下文并内置官方工具。这意味着企业用户无需自行处理上下文扩展和工具调用适配,开箱即用。
6.4 对开发者的启示
对于AI应用开发者而言,Qwen3.8-Flash-Next的出现意味着:
- 本地部署门槛大幅降低:单张消费级显卡即可运行顶级模型
- API调用成本断崖式下降:从“按token计费心疼”到“随便调用不眨眼”
- 长上下文应用成为现实:1M token的原生支持,让整本书分析、完整代码库理解成为可能
- 多模态能力“免费附赠” :文本、图像、视频一网打尽
七、常见问题(FAQ)
Q1:Qwen3.8-Flash-Next和Qwen3.8-Flash是什么关系?
Qwen3.8-Flash-Next是开源权重版本,基于Qwen4架构预览。Qwen3.8-Flash是在QwenCloud上提供的生产级API版本,默认支持1M上下文并内置官方工具。两者共享相同的底层架构,但Qwen3.8-Flash针对生产环境做了额外优化。
Q2:Qwen3.8-Flash-Next是Qwen4吗?
不是。Qwen3.8-Flash-Next是Qwen4架构的早期预览版。它提前释放了Qwen4的架构设计,让社区进行检验。完整的Qwen4模型家族将在后续推出。
Q3:Qwen3.8-Flash-Next能在普通电脑上运行吗?
可以。通过GGUF量化(~3-bit),可在75GB统一内存的设备上运行,无需GPU显存。通过NVFP4量化,单张RTX PRO 6000(96GB)即可跑满262K上下文。4张RTX 3090通过llama.cpp可实现~43 tokens/秒的解码速度。
Q4:Qwen3.8-Flash-Next支持哪些输入模态?
支持文本、图像和视频输入。它是一个原生多模态MoE模型。
Q5:Qwen3.8-Flash-Next的上下文窗口有多大?
原生支持262,144 tokens(约256K),通过YaRN可扩展至1,000,000 tokens(约1M)。
Q6:在哪里可以下载Qwen3.8-Flash-Next的权重?
权重已在Hugging Face(模型ID:Qwen/Qwen3.8-Flash-Next)和魔搭社区(ModelScope) 全面开源。
Q7:Qwen3.8-Flash-Next的API价格是多少?
生产版Qwen3.8-Flash通过QwenCloud提供API服务:每百万输入Tokens $0.16(约1元),每百万输出Tokens $0.47(约3元)。
Q8:Qwen3.8-Flash-Next的许可协议是什么?
采用qwen-community-1.0许可协议。这是开源权重许可,但非完全宽松的Apache 2.0。
Q9:Qwen3.8-Flash-Next在编程方面的表现如何?
非常出色。SWE-bench Pro得分62.5,超过Claude Opus 4.6 Max的53.4;LiveCodeBench v6得分91.9;DeepSWE 1.1得分58.7。
Q10:Qwen3.8-Flash-Next的推理速度有多快?
在单张RTX PRO 6000上,满262K上下文可达180-226 tokens/秒。在2台DGX Spark上配合MTP4+CUDA Graphs,智能体工作负载可达**~70 tokens/秒**。在TP4 B200上,NVFP4量化版本可达540 tokens/秒(batch size 1,MTP开启)。

