Qwen3.8-2.4T-A95B:开放权重+多引擎部署+API指南

一款全新的超大规模混合架构大模型正式开放开源权重,这款模型总参数量达到2.4万亿,单Token激活参数为950亿,原生支持262144Token的上下文窗口,还可扩展至超过100万Token的超长上下文。
这款旗舰级模型延续了上一代的混合架构设计,重点优化了编程、办公、科研以及长周期智能体任务的端到端完成能力,官方推出的云端旗舰版本基于该开源权重打造,并补充了更多面向生产环境的实用能力。官方发布的评测覆盖了编程智能体、通用智能体、专业办公以及长上下文处理等多个方向,和其他同级别模型相比,这款模型在多项基准测试中表现突出,在多个权威评测中位列前列。
16天自主编程项目
在一项自主编程测试中,模型从空文件夹起步,搭建了oh-my-cli项目和一套可持续运行的编程测试框架,整合了问题状态机、任务分发、监控、自测试和异常恢复流程,还能自动将社区实践和用户反馈转化为新的开发任务。根据官方记录,这套流程在无人工干预的情况下连续运行了16天,累计产生265次代码提交和127个合并请求,完整的开发轨迹已公开在开源仓库中。
科研论文复现与改进
在另一项科研任务中,模型在没有初始代码的情况下,复现了《Unified Data Selection for LLM Reasoning》论文的训练与评测流程。整个过程中模型连续工作125小时,编写了超过7600行代码,执行了1100余步操作和33轮GPU训练。模型不仅完整复现了论文的六项核心结论,还通过四轮自主探索提出并验证了18种改进方法,最终在AIME24的受控实验中,比复现的基线模型提升了2.71分。
多专业场景适配
官方团队在数百种高经济价值的职业高频工作场景中对模型进行了测试,包括合规审查、产品原型设计、菜单规划、结构工程、康复演示以及体育数据分析等多个专业领域,验证了模型在真实工作流中交付生产级成果的能力。
端到端量化研发闭环
模型依托动态工作流能力,可以驱动数据处理、因子构建、回测和策略迭代,并行调度多个子任务,将单次对话转化为完整的自动化量化研发闭环。
365天电商经营模拟
在365天的电商经营模拟测试中,模型被置于包含12种店铺类型、60个商品类目、近600家供应商和7000种商品的经营环境中,需要在季节波动、供应链突发事件、议价和欺诈风险中持续调整采购、定价和库存策略。经过超过2000轮交互后,模型将10万元的初始资金运营至416252元的期末现金,证明了其长程连贯决策和自适应学习的能力。
这款模型采用2.4T参数量的混合专家(MoE)架构,每个MoE层包含512个专家网络,每个Token会选择10个路由专家,同时激活1个共享专家,单Token的计算激活参数为950亿。需要注意的是,“激活950亿”指的是单Token的计算路径,并不等同于模型总权重或运行时显存占用规模。
在上下文窗口方面,模型原生支持262144Token的上下文长度,还可以扩展至1010000Token的超长上下文。此外,模型还进行了多步Token预测(MTP)训练,能够为支持该机制的推理引擎提供多Token预测能力,实际的加速效果则取决于接受率、请求长度和具体的框架实现。
为了让模型在真实办公和智能体场景中更加稳定可靠,研发团队通过联合扩展强化学习的环境数量和训练算力,搭建了面向真实世界的强化学习系统。这套后训练流程分为三个核心环节:
- 持续扩展真实环境,并在任务、工作空间、测试框架三个维度进行解耦合,让环境数量可以通过组合方式自然增长,而非依赖逐一定制化集成。
- 构建统一的奖励系统,将异构的真实任务验证方式整合其中,包括基于执行的校验、文本和渲染视觉输出的评估,以及智能体行为检查,统一多种模态的奖励信号,消除不同任务验证器带来的不一致性。
- 搭建在线数据均衡器,对每个训练批次进行重构,保证任务、难度、工作区和测试框架的分布高度均衡,降低批次间的梯度方差,支撑强化学习训练的稳定扩展。
官方公布的评测结果覆盖了编程智能体、通用智能体、专业办公、长上下文处理和视觉智能体等多个方向。相较于上一代的Max级别模型,这款模型在多项编程和通用智能体任务上有明显提升。和其他同级别模型相比,各项评测结果各有优劣,但在多个权威基准测试中取得了领先位置。
例如在官方的模型测试数据中,这款模型在PaperBench上得分为93.0,Terminal Bench 2.1为86.6,FrontierSWE为73.5,CoWorkBench为74.8。需要说明的是,不同评测的测试框架、超时时间、采样参数和上下文长度并不完全一致,仅供参考。
这款模型的开源权重可通过国内主流开源模型平台获取,以下是部署和使用的相关信息:
模型下载
可以通过官方提供的工具下载模型,示例命令如下:
pip install -U modelscope modelscope download \ --model Qwen/Qwen3.8-2.4T-A95B \ --local_dir ./Qwen3.8-2.4T-A95B
推理框架支持
模型可以通过SGLang、vLLM和TokenSpeed等推理引擎进行部署,正式部署时需要使用针对该模型的最新配置方案,并根据权重精度、GPU型号和数量选择合适的并行策略。
API使用说明
模型默认启用思考模式,在生成最终回答前会生成由<think>和</think>标记的思考内容,目前该版本不支持关闭思考模式。推荐的采样参数为temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0。
模型原生支持reasoning_effort参数,用于调整推理深度和控制成本,包括三个档位:
- xhigh(默认):适用于需要深入分析的复杂任务
- medium:在准确性和速度之间取得平衡
- low:采用更高效的推理方式,侧重速度和成本
以下是使用Chat Completions API的示例代码:
pip install -U openai请根据实际情况设置以下变量
export OPENAI_BASE_URL=‘your-base-url’
export OPENAI_API_KEY=‘your-api-key’from openai import OpenAI
通过环境变量完成配置
client = OpenAI()
messages = [{“role”: “user”, “content”: “Write a Python function to merge two sorted linked lists.”}]
completion = client.chat.completions.create(
model=“Qwen/Qwen3.8-2.4T-A95B”,
messages=messages,
extra_body={
“chat_template_kwargs”: {
“enable_thinking”: True, # 默认开启,不应关闭
“preserve_thinking”: True, # 默认开启
},
},
reasoning_effort=“xhigh”, # 默认为 xhigh;支持 xhigh、medium 和 low
stream=True,
stream_options={“include_usage”: True},
)
reasoning_content = “”
answer_content = “”
is_answering = False
print(“\n” + “=” * 20 + “Reasoning” + “=” * 20 + “\n”)
for chunk in completion:
if not chunk.choices:
print(“\nUsage:”)
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, “reasoning_content”) and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end=“”, flush=True)
reasoning_content += delta.reasoning_content
if hasattr(delta, “content”) and delta.content:
if not is_answering:
print(“\n” + “=” * 20 + “Answer” + “=” * 20 + “\n”)
is_answering = True
print(delta.content, end=“”, flush=True)
answer_content += delta.content
如果使用官方云API,除了修改model参数外,请传入extra_body={"enable_thinking": True, "preserve_thinking": True},而非extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}。
官方还预告,参数量更小的27B版本模型正在研发中,敬请期待。

