Qwen3.8-Flash-Next开源:125B模型仅激活6B 支持百万上下文

近期,一款全新的开源多模态混合专家模型正式发布,这款名为Qwen3.8-Flash-Next的模型不仅实现了极低的激活参数成本,还带来了多项架构创新,同时作为下一代Qwen4模型的技术预览版本亮相。
该模型的主参数量达到125B,额外配备了51B的N-gram嵌入模块,实际每处理一个token仅需激活6B的参数。原生支持262,144个token的上下文长度,通过YaRN技术还可以扩展至1,000,000个token。相较于前代模型Qwen3.7-Plus,这款模型的训练开销仅为前者的1/9,在代码处理、办公文档分析等场景中取得了更优的表现,实现了模型能力、响应延迟与推理成本之间的平衡。
目前该模型已上架主流开源模型托管平台,开发者可以通过多种方式获取并部署。
本次模型的架构更新主要围绕注意力机制、残差连接、嵌入模块与训练优化四个核心方向展开,具体创新点如下:
<p><strong>混合注意力与记忆架构:GDN+QSA</strong></p>
<p>传统的全局注意力机制可以直接访问所有历史token,但随着上下文长度增加,计算开销与KV缓存的访存成本会显著提升。Qwen3.8-Flash-Next延续了Qwen3.5的架构设计,采用GDN+注意力的混合架构:每四层网络中,三层使用Gated DeltaNet(GDN)将历史信息持续压缩到固定大小的状态中,剩下一层保留全局注意力,负责精准检索全局上下文信息。</p>
<p>针对全局注意力模块,团队进一步推出了Qwen Sparse Attention(QSA)技术。常规的稀疏注意力方案通常需要基于token级别的索引器来定位重要上下文,随着上下文长度增长,索引器本身的计算开销也会逐渐变得不可忽视。QSA将这一流程进行了优化:通过轻量索引器先将序列聚合成micro-block,在块粒度上评估上下文的重要性,再选出最相关的区域执行注意力计算。这种方式不仅减少了实际注意力的计算量,还大幅降低了“寻找重要上下文”本身的索引成本。相较于跨层共享索引的方法,QSA在每一层内部独立完成序列压缩,对跨层注意力相似性的依赖更低,更适合GDN与注意力交替出现的混合架构。</p>
<p>在100万个token的上下文场景下,QSA的注意力内核在预填充和解码阶段分别实现了最高7.6倍和4.9倍的速度提升。在贴近线上高缓存复用的实验场景中,前缀缓存命中率为90%,Qwen3.8-Flash-Next在1M上下文下的预填充吞吐达到Qwen3.7-Plus的8.6倍。</p>
<p><strong>门控残差连接:拓展信息传递路径</strong></p>
<p>传统Transformer模型的各层始终在同一条残差流上读写信息。Qwen3.8-Flash-Next引入了门控残差结构,将残差流扩展为4条并行分支,并通过逐元素的动态读取门和按分支控制的写入门来调节信息的流动。其中一条分支会自然形成连接第一层注意力与多数中后层的长距离信息通道。</p>
<p>经过归一化后的门控机制还进一步简化了Hyper-Connection结构,用于抑制激活异常值。同时残差状态支持以FP8格式存储,有效减少了访存开销。</p>
<p><strong>协同优化的训练框架</strong></p>
<p>Qwen3.8-Flash-Next使用Muon优化器进行训练,并针对大模型训练的三个关键问题对Muon进行了优化:正交化精度、Muon与AdamW的参数分工、融合参数矩阵的拆分。</p>
<p>对于真正作为二维线性映射的参数,例如注意力、GDN和MoE专家中的主要权重,使用Muon优化器;而嵌入层、MoE路由门、门控残差的低秩参数等则继续使用AdamW优化器。对于工程实现中融合存储的QKV、SwiGLU和GDN Projection模块,先按照实际对应的独立线性变换进行拆分,再分别执行正交化操作。</p>
<p>针对新的模型结构与优化器,团队重新拟合了缩放定律,允许使用更大的学习率和批处理尺寸,进一步提升了收敛效率与大规模并行训练的吞吐能力。</p>
<p><strong>极致稀疏混合专家架构</strong></p>
<p>在全局负载均衡的前提下,固定激活的专家数量并持续增加专家总参数量,可以稳定降低训练损失。因此Qwen3.8-Flash-Next采用了较大的专家池,每个token仅路由少量专家,并配合一个共享专家模块。</p>
<p><strong>多token预测模块</strong></p>
<p>多token预测模块采用多步方式进行训练,保持训练与推理流程的一致性,从而提升实际场景下 speculative decoding的接受率,同时也提升了主干模型本身的性能。该模块中的全注意力层同样替换为QSA技术。</p>
<p><strong>基础模型性能表现</strong></p>
<p>将Qwen3.8-Flash-Next-Base与Qwen3.8-27B以及Qwen3.7-Plus的基础模型进行对比,在仅激活6B参数的前提下,Qwen3.8-Flash-Next-Base在14个评测基准中的8个取得了最优结果。</p>
Qwen3.8-Flash-Next已上架主流开源模型托管平台,开发者可以通过多种推理框架进行部署,包括SGLang、vLLM、TokenSpeed、Unsloth等。
<p><strong>模型下载</strong></p>
<pre><code>pip install -U modelscope
modelscope download --model Qwen/Qwen3.8-Flash-Next --local_dir ./Qwen3.8-Flash-Next
<p><strong>推理部署框架教程</strong></p>
<ul>
<li>
<p><a href="https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-Flash-Next">SGLang官方部署教程</a></p>
</li>
<li>
<p><a href="https://recipes.vllm.ai/Qwen/Qwen3.8-Flash-Next">vLLM官方部署教程</a></p>
</li>
<li>
<p><a href="https://lightseek.org/tokenspeed/recipes/models#qwen3-8-flash-next">TokenSpeed官方部署教程</a></p>
</li>
<li>
<p><a href="https://unsloth.ai/docs/models/qwen3.8-next">Unsloth官方部署教程</a></p>
</li>
</ul>
<p><strong>API调用指南</strong></p>
<p>Qwen3.8-Flash-Next默认运行在思考模式下,会先生成由<think>\n...</think>\n标识的思考内容,再输出最终回答。如果需要关闭思考内容,直接获取最终回答,可以参考以下配置示例。</p>
<p><strong>推荐采样参数</strong></p>
<ul>
<li>
<p>思考模式:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0</p>
</li>
<li>
<p>指令(非思考)模式:temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0</p>
</li>
</ul>
<p>不同推理框架对采样参数的支持范围可能存在差异。在多轮Agent任务中,降低推理强度不一定能够缩短任务的总完成时间:虽然单轮响应可能更快,但分析不足可能导致更多失败与重复尝试,反而增加总体延迟与token消耗。</p>
<p>该模型支持通过enable_thinking、preserve_thinking和reasoning_effort参数控制思考行为。</p>
<p><strong>Chat Completions API</strong></p>
<p>Chat Completions API可以配合多数推理框架使用,也可以通过官方云服务调用。使用前请安装所需依赖,并配置API Key和API Base URL,示例如下:</p>
<pre><code>pip install -U openai
export OPENAI_BASE_URL=“http://localhost:8000/v1”
export OPENAI_API_KEY=“EMPTY”
<p><strong>非思考模式配置示例</strong></p>
<pre><code>from openai import OpenAI
client = OpenAI()
messages = [
{
“role”: “user”,
“content”: [
{
“type”: “image_url”,
“image_url”: {
“url”: “https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png”
}
},
{
“type”: “text”,
“text”: “Where is this?”
}
]
}
]
chat_response = client.chat.completions.create(
model=“Qwen/Qwen3.8-Flash-Next”,
messages=messages,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
“top_k”: 20,
“chat_template_kwargs”: {“enable_thinking”: False},
},
)
print(“Chat response:”, chat_response)
如果使用官方云服务API,除修改model参数外,请直接使用"enable_thinking": False,而不需要嵌套在chat_template_kwargs中。
<p><strong>关闭保留思考功能</strong></p>
<pre><code>from openai import OpenAI
client = OpenAI()
messages = […]
chat_response = client.chat.completions.create(
model=“Qwen/Qwen3.8-Flash-Next”,
messages=messages,
extra_body={
“chat_template_kwargs”: {“preserve_thinking”: False},
},
)
print(“Chat response:”, chat_response)
如果使用官方云服务API,除修改model参数外,请直接设置"preserve_thinking": False,不需要将其包裹在chat_template_kwargs中。
ms-swift作为国内开源模型社区推出的官方大模型训练工具,已在首日就支持了Qwen3.8-Flash-Next模型的微调,其开源地址为:https://github.com/modelscope/ms-swift
<p><strong>环境准备</strong></p>
<pre><code>pip install git+https://github.com/modelscope/ms-swift.git
pip install git+https://github.com/modelscope/mcore-bridge.git
pip install git+https://github.com/huggingface/transformers.git
pip install -U flash-linear-attention --no-build-isolation
pip install -U git+https://github.com/Dao-AILab/causal-conv1d --no-build-isolation
pip install “flash-attn==2.8.3” --no-build-isolation
pip install deepspeed
Megatron训练的相关环境安装可以参考官方文档:https://swift.readthedocs.io/zh-cn/latest/Megatron-SWIFT/Quick-start.html
<p>以下以自我认知微调为例,介绍使用ms-swift对Qwen3.8-Flash-Next进行微调并推理的流程:</p>
<p>自我认知数据集链接:<a href="https://modelscope.cn/datasets/swift/self-cognition">https://modelscope.cn/datasets/swift/self-cognition</a></p>
<pre><code>megatron sft \
--model Qwen/Qwen3.8-Flash-Next \
--dataset 'swift/self-cognition#500' \
--model_name swift-robot \
--model_author swift \
--tuner_type lora \
--lora_rank 8 \
--lora_alpha 32 \
--target_modules in_proj out_proj linear_proj linear_qkv \
--tensor_model_parallel_size 2 \
--expert_model_parallel_size 4 \
--expert_tensor_parallel_size 1 \
--pipeline_model_parallel_size 2 \
--decoder_first_pipeline_num_layers 12 \
--sequence_parallel true \
--context_parallel_size 1 \
--moe_grouped_gemm true \
--moe_permute_fusion true \
--moe_aux_loss_coeff 1e-3 \
--micro_batch_size 1 \
--global_batch_size 8 \
--recompute_granularity full \
--recompute_method uniform \
--recompute_num_layers 1 \
--num_train_epochs 3 \
--finetune true \
--cross_entropy_loss_fusion true \
--lr 1e-4 \
--lr_warmup_fraction 0.05 \
--min_lr 1e-5 \
--max_length 2048 \
--split_dataset_ratio 0.01 \
--eval_steps 1000 \
--save_steps 50 \
--save_safetensors true \
--merge_lora true \
--use_precision_aware_optimizer true \
--no_save_optim true \
--no_save_rng true \
--attention_backend auto \
--padding_free false \
--vit_attn_impl sdpa \
--dataloader_num_workers 4 \
--dataset_num_proc 4 \
--load_from_cache_file true \
--logging_steps 1
命令行参数的详细含义及更多参数可以参考官方文档:https://swift.readthedocs.io/zh-cn/latest/Megatron-SWIFT/Command-line-parameters.html
<p><strong>验证集推理示例</strong></p>
<pre><code>CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
swift infer
–adapters output/vx-xxx/checkpoint-xxx-merged
–infer_backend vllm
–stream true
–load_data_args true
–enable_thinking false
–vllm_tensor_parallel_size 8
<p><strong>自定义数据集格式</strong></p>
<pre><code>{"messages": [{"role": "user", "content": "What is the capital of Zhejiang?"}, {"role": "assistant", "content": "The capital of Zhejiang is Hangzhou."}]}
{“messages”: [{“role”: “user”, “content”: “浙江的省会在哪?”}, {“role”: “assistant”, “content”: “浙江的省会在杭州。”}]}
更多自定义数据格式的说明可以参考官方文档:https://swift.readthedocs.io/zh-cn/latest/Customization/Custom-dataset.html
<p><strong>推送微调后的模型</strong></p>
<pre><code>swift export \
–adapters output/vx-xxx/checkpoint-xxx
–push_to_hub true
–hub_model_id ‘<your-model-id>’
–hub_token ‘<your-sdk-token>’

