文章摘要
2026年8月26日,阿里通义千问发布基于下一代Qwen4架构的开源多模态MoE模型Qwen3.8-Flash-Next,定位为Qwen4架构的技术预览版。该模型总参数125B,每token仅激活6B,重构四大核心模块,在14项主流基准测试中8项取得最优成绩,多项性能超头部闭源模型,训练成本仅为前代九分之一,推理定价低廉,权重已在开源平台上线,部署门槛较低,推动大模型竞争转向效率竞赛。

2026年8月26日,通义千问正式发布Qwen3.8-Flash-Next,这是阿里Qwen团队基于下一代Qwen4架构打造的多模态MoE开源模型。Qwen3.8-Flash-Next以125B总参数、每token仅激活6B的超高稀疏度,在SWE-bench Pro、MMLU-Pro等14项基准测试中的8项取得最优成绩。训练成本仅为前代Qwen3.7-Plus的九分之一,推理定价每百万输入Tokens仅0.16美元。作为Qwen4架构的“技术预告片”,Qwen3.8-Flash-Next彻底重构了注意力、残差、嵌入和优化四大核心模块。

通义千问发布Qwen3.8-Flash-Next

一、Qwen3.8-Flash-Next是什么?Qwen4架构的“技术预告片”

1.1 定位:不是旗舰,胜似旗舰

Qwen3.8-Flash-Next的名字本身就透露了它的身份。“Flash”是Qwen系列中端、效率优先的品牌线——用部分原始算力上限换取显著更低的成本和更快的推理速度。“Next”则表明这是下一代架构的蓝图。

Qwen团队在官方公告中明确表示,Qwen3.8-Flash-Next扮演的角色与当年Qwen3-Next对Qwen3.5系列所起的作用完全相同——提前释放架构层面的革新,让全球AI开源社区在完整Qwen4模型家族推出之前,先对这些改动进行检验。换言之,Qwen3.8-Flash-Next并非Qwen4本身,而是Qwen4架构的“技术预告片”。

权重已在Hugging Face和魔搭社区(ModelScope)全面开源。官方同时发布了BF16和FP8两个版本。

1.2 核心规格一览

规格项 Qwen3.8-Flash-Next
模型类型 多模态MoE(带视觉编码器的因果语言模型)
总参数 125B MoE + 51B N-gram Embedding + 4B MTP
每Token激活参数 6B
层数 48层(36层GDN + 12层QSA)
MoE专家数 512个专家(Top-10路由 + 1个共享专家激活)
原生上下文 262,144 tokens
扩展上下文 1M tokens(通过YaRN)
许可协议 qwen-community-1.0

二、四大架构革新:Qwen3.8-Flash-Next凭什么“四两拨千斤”?

Qwen3.8-Flash-Next在注意力(Attention)、残差(Residual)、嵌入(Embedding)、优化(Optimization) 四个方向进行了系统升级。

2.1 注意力:GDN + QSA混合架构

在注意力机制方面,Qwen3.8-Flash-Next采用GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构

GDN(Gated DeltaNet) 负责高效压缩历史信息,将长序列压缩为固定大小的状态。QSA(Qwen Sparse Attention) 则是此次架构升级的核心亮点——它通过轻量级Indexer在micro-block粒度上筛选重要上下文,大幅降低长序列的注意力计算开销。

具体来说,48层中36层采用GDN线性注意力层,12层采用QSA稀疏注意力层。这种3:1的混合比例,既保留了GDN的高效压缩能力,又通过QSA在关键位置进行精确的全局检索。

面对1M token的超长上下文,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。在90%前缀缓存命中率的实际服务场景中,Qwen3.8-Flash-Next的预填充吞吐量相比前代Qwen3.7-Plus提升了8.6倍

2.2 残差:Gated Residual(GR)

Qwen3.8-Flash-Next引入Gated Residual(GR)机制,将残差流扩展为4条并行分支,通过动态Gate控制信息的读写。

这一设计的价值在于:传统残差连接是单一的信息通道,而GR通过4条分支并行处理、动态门控选择,显著强化了跨层信息流动和训练稳定性。残差状态支持FP8存储,大幅降低访存开销。通过FlashInfer的高性能Mix/Combine HyperConnection算子,实现了2.05倍的内核级加速。

2.3 嵌入:51B N-gram Embedding

Qwen3.8-Flash-Next在主模型125B参数之外,额外配备了51B参数的N-gram Embedding

N-gram Embedding利用局部上下文查表来扩展模型容量。关键设计在于:这些嵌入参数可以卸载至Host Memory,通过异步Prefetch与模型计算重叠,不长期占用GPU显存。这使得在单张RTX PRO 6000(96GB显存)上就能跑满262K上下文。

2.4 优化:Muon Optimizer + 重新拟合Scaling Law

在优化层面,Qwen3.8-Flash-Next采用Muon Optimizer,并针对正交化精度、Muon与AdamW的分工协作、融合矩阵拆分等策略进行了精细化调整。针对新架构重新拟合了Scaling Law。


三、性能实测:6B激活参数如何打赢千亿级对手?

3.1 基准测试:14项中的8项SOTA

在仅激活6B参数的前提下,Qwen3.8-Flash-Next-Base在14个主流基准测试中的8项取得SOTA(最优)成绩,涵盖MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU等高难度评测集。

基准测试 Qwen3.8-Flash-Next Claude Opus 4.6 Max DeepSeek-V4-Flash
MMLU-Pro 73.23 68.60 70.90
MMLU-Redux 90.36 87.51 90.43
SWE-bench Pro 62.5 53.4 55.8
DeepSWE 1.1 58.7 54.4
LiveCodeBench v6 91.9
CoWorkBench 73.9 68.2
JobBench 55.7 36.6

3.2 与Claude Opus 4.6的正面交锋

Qwen3.8-Flash-Next在多项关键基准上全面超越Anthropic的Claude Opus 4.6 Max:

  • SWE-bench Pro:领先9.1分(62.5 vs 53.4)
  • JobBench:领先近20分(55.7 vs 36.6)
  • AndroidWorld:领先22.5分(84.5 vs 62.0)
  • MathVision:领先25.1分(90.6 vs 65.5)
  • CoWorkBench:领先5.7分(73.9 vs 68.2)

3.3 与开源模型的横向对比

在开源模型阵营中,Qwen3.8-Flash-Next同样表现突出:

对比维度 Qwen3.8-Flash-Next vs 开源模型
总对战记录 31胜 / 16负
中位百分位差距 +8.7分
最大领先 LiveCodeBench +83.0分

在BenchmarkList的综合能力指数(ECI)排名中,Qwen3.8-Flash-Next位列第15名(共871个模型) 。在指令遵循(Instruction Following)类别中高居第5名


四、成本革命:训练九分之一,推理仅对手3%

4.1 训练成本:仅为前代的1/9

相比Qwen3.7-Plus,Qwen3.8-Flash-Next的训练成本仅约为前者的九分之一。这一成本降幅得益于全新架构在计算效率上的根本性突破——GDN的高效历史压缩、QSA的稀疏注意力、Gated Residual的FP8存储、N-gram Embedding的Host卸载,四大革新协同作用,使得每token的计算开销大幅降低。

4.2 推理成本:每百万Tokens仅0.16美元

生产版本Qwen3.8-Flash通过QwenCloud提供API服务:

定价项 价格
每百万输入Tokens $0.16(约1元人民币)
每百万输出Tokens $0.47(约3元人民币)

这一价格是Claude Opus 4.6的约3% ,是DeepSeek-V4-Flash闲时价格的约2/3

4.3 部署成本:单卡跑满262K

在硬件部署方面,Qwen3.8-Flash-Next展现出惊人的效率。开发者报告显示:

  • 单张RTX PRO 6000(96GB显存) 即可在满262K上下文下实现180-226 tokens/秒的单流解码
  • 通过NVFP4量化,MTP模块仅占用0.51GB显存
  • 2台DGX Spark(MTP4 + CUDA Graphs) 在智能体工作负载下可达**~70 tokens/秒**,超越4张RTX 3090的~43 tokens/秒
  • 4张RTX 3090通过GGUF量化(~3-bit)可实现**~43 tokens/秒**的稳定解码
  • 甚至可在75GB统一内存的设备上无GPU显存运行

五、多模态与长上下文:不止于文本

5.1 原生多模态能力

Qwen3.8-Flash-Next是一款原生多模态MoE模型,支持文本、图像和视频输入。在多模态智能体评测中表现亮眼:

多模态基准 Qwen3.8-Flash-Next Qwen3.8-27B Claude Opus 4.6 Max
ClawEval-MM 64.4 57.4 52.5
Vision2Web 64.0 62.9 42.1
RealWorldQA 88.5 86.9 73.9
LVBench(长视频理解) 76.6 76.2 63.0
多模态智能体平均 60.4 60.1 54.7

5.2 262K原生上下文,可扩展至1M

Qwen3.8-Flash-Next原生支持262,144 tokens的上下文窗口,通过YaRN可扩展至1M tokens。在1M token的超长上下文中,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。

5.3 智能体能力突出

Qwen3.8-Flash-Next在智能体(Agentic)类别中排名第13位(共138个模型) 。具体表现:

智能体基准 Qwen3.8-Flash-Next 竞品对比
AndroidWorld 84.5 领先Opus 4.6达22.5分
OSWorld 2.0 52.3(Partial) 远超Opus 4.6的21.5
Toolathlon 领先hy3达54.2分

六、行业影响与独到见解

6.1 “效率优先”正在改写游戏规则

Qwen3.8-Flash-Next最值得关注的信号不是“又一个大模型”,而是大模型竞争正在从“参数规模竞赛”转向“效率竞赛”

125B总参数、仅激活6B——这意味着Qwen3.8-Flash-Next在推理时只用了不到5%的参数。而它却在SWE-bench Pro上击败了Claude Opus 4.6,在MMLU-Pro上超越了参数量大得多的竞品。这证明:模型的智能水平不再与参数规模简单挂钩,架构效率才是决定性的变量。

正如Qwen团队在官方发布中所言:问题不再是能扩展多少,而是能多高效地扩展

6.2 开源策略的“阳谋”

Qwen3.8-Flash-Next的开源策略值得深入解读。它不是Qwen4本身,而是Qwen4架构的“预览版”。Qwen团队选择在完整Qwen4推出之前,将架构改动提前交给全球开源社区检验。

这是一种极其聪明的策略:

  • 降低风险:让社区提前发现架构问题,避免Qwen4重蹈覆辙
  • 建立生态:SGLang、vLLM、llama.cpp等框架在发布当天就提供了Day-0支持
  • 获取反馈:全球开发者的使用数据和反馈,为Qwen4的最终优化提供宝贵参考

6.3 价格战的“终极形态”

Qwen3.8-Flash的API定价——每百万输入Tokens仅0.16美元——已经将大模型推理成本推至新低。这不仅是商业竞争,更是技术能力的直接体现:只有架构足够高效,才能支撑如此低廉的定价而不亏损。

值得注意的是,生产版本Qwen3.8-Flash默认支持1M上下文并内置官方工具。这意味着企业用户无需自行处理上下文扩展和工具调用适配,开箱即用。

6.4 对开发者的启示

对于AI应用开发者而言,Qwen3.8-Flash-Next的出现意味着:

  1. 本地部署门槛大幅降低:单张消费级显卡即可运行顶级模型
  2. API调用成本断崖式下降:从“按token计费心疼”到“随便调用不眨眼”
  3. 长上下文应用成为现实:1M token的原生支持,让整本书分析、完整代码库理解成为可能
  4. 多模态能力“免费附赠” :文本、图像、视频一网打尽

七、常见问题(FAQ)

Q1:Qwen3.8-Flash-Next和Qwen3.8-Flash是什么关系?

Qwen3.8-Flash-Next是开源权重版本,基于Qwen4架构预览。Qwen3.8-Flash是在QwenCloud上提供的生产级API版本,默认支持1M上下文并内置官方工具。两者共享相同的底层架构,但Qwen3.8-Flash针对生产环境做了额外优化。

Q2:Qwen3.8-Flash-Next是Qwen4吗?

不是。Qwen3.8-Flash-Next是Qwen4架构的早期预览版。它提前释放了Qwen4的架构设计,让社区进行检验。完整的Qwen4模型家族将在后续推出。

Q3:Qwen3.8-Flash-Next能在普通电脑上运行吗?

可以。通过GGUF量化(~3-bit),可在75GB统一内存的设备上运行,无需GPU显存。通过NVFP4量化,单张RTX PRO 6000(96GB)即可跑满262K上下文。4张RTX 3090通过llama.cpp可实现~43 tokens/秒的解码速度。

Q4:Qwen3.8-Flash-Next支持哪些输入模态?

支持文本、图像和视频输入。它是一个原生多模态MoE模型。

Q5:Qwen3.8-Flash-Next的上下文窗口有多大?

原生支持262,144 tokens(约256K),通过YaRN可扩展至1,000,000 tokens(约1M)。

Q6:在哪里可以下载Qwen3.8-Flash-Next的权重?

权重已在Hugging Face(模型ID:Qwen/Qwen3.8-Flash-Next)和魔搭社区(ModelScope) 全面开源。

Q7:Qwen3.8-Flash-Next的API价格是多少?

生产版Qwen3.8-Flash通过QwenCloud提供API服务:每百万输入Tokens $0.16(约1元),每百万输出Tokens $0.47(约3元)。

Q8:Qwen3.8-Flash-Next的许可协议是什么?

采用qwen-community-1.0许可协议。这是开源权重许可,但非完全宽松的Apache 2.0。

Q9:Qwen3.8-Flash-Next在编程方面的表现如何?

非常出色。SWE-bench Pro得分62.5,超过Claude Opus 4.6 Max的53.4;LiveCodeBench v6得分91.9;DeepSWE 1.1得分58.7

Q10:Qwen3.8-Flash-Next的推理速度有多快?

在单张RTX PRO 6000上,满262K上下文可达180-226 tokens/秒。在2台DGX Spark上配合MTP4+CUDA Graphs,智能体工作负载可达**~70 tokens/秒**。在TP4 B200上,NVFP4量化版本可达540 tokens/秒(batch size 1,MTP开启)。

以上内容不代表本平台立场,仅供读者参考