阿里Qwen3.8-Max将首次开源:2.4万亿参数旗舰大模型全面解析

2026年8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,采用稀疏混合专家架构,单次推理仅激活950亿参数。阿里Qwen3.8-Max将首次开源其模型权重,这是Qwen-Max级别旗舰模型首次面向全球开发者开放。模型支持100万Token超长上下文,原生集成多模态视觉能力,在编程、办公、科研及长周期任务中表现跻身全球第一梯队。

一、Qwen3.8-Max的技术架构创新
1.1 稀疏混合专家架构:2.4万亿参数的效率密码
阿里Qwen3.8-Max将首次开源的模型基于Qwen 3.5架构打造,核心技术创新在于稀疏混合专家架构的应用。模型总参数量达到2.4万亿,但在实际推理过程中仅激活约950亿参数。
MoE架构的核心原理是将模型内部的FFN层复制为多个“专家”子网络,由轻量路由门控决定当前Token交由哪几个专家处理。这种设计使总参数规模与激活参数规模解耦——总参数决定模型的知识容量,激活参数决定推理的计算成本。阿里Qwen3.8-Max将首次开源这一架构的实现细节,为全球AI研究者提供了万亿参数级稀疏模型的可参考范本。
1.2 混合注意力机制与100万Token超长上下文
Qwen3.8-Max支持最长100万Token的上下文窗口。100万Token约等于75万字文本,可一次性处理完整的300页PDF合同、全年财务报表、百万行项目代码乃至100小时的视频字幕文本。
长上下文的显存瓶颈主要在于KV Cache随序列长度线性增长。Qwen3.8-Max采用混合注意力机制——在部分层保留全局注意力以记住关键语义,多数层使用滑动窗口注意力以节省KV Cache。这种设计使模型在处理百万级Token长文本时保持可接受的显存占用和推理延迟。
1.3 原生多模态视觉能力
作为多模态基座模型,Qwen3.8-Max原生支持视觉智能。模型能无缝处理过百页文件、整部电视剧集或长达100小时的直播内容,将其转化为可搜索且可交互的知识库。在视觉推理BabyVision评测中,Qwen3.8-Max在无工具条件下取得82.0分,超出部分主流模型近两倍。
二、性能评测与基准对比
2.1 Arena排行榜:全球第四
在权威第三方榜单Arena.ai的前端代码竞技场中,Qwen3.8-Max获得1668分,位列全球第四。排名仅次于Claude Opus 5 (Max)的1705分、Kimi K3 (Max)的1676分以及Claude Opus 5 (High)的1669分。在Text Arena中排名第五,Vision Arena中排名第二。整体性能处于全球大模型第一梯队。
2.2 编程能力:自主16天完成真实项目交付
编程能力是前沿大模型的核心指标之一。在CodeArena榜单中,Qwen3.8位居全球第四。
最引人注目的成就是在自动化编程测试中,模型在无人工干预的情况下独立运行16天,完成了oh-my-cli项目的自动建构与自进化harness搭建,并在GitHub上产出了265次代码提交。项目完整trace公开保存在GitHub仓库中,可供所有人查看。
在SWE-bench Pro测试中,Qwen3.8-Max得到67.7分。在评估电脑操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居参评模型首位。在参数化CAD基准中取得91.5分,超过Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。
2.3 科研能力:复现论文并超越
在科研复现场景中,Qwen3.8-Max连续自主工作约125小时,成功复现了AI Reasoning相关论文并进行了四轮自我进化探索,使AIME24基准测试得分再提升2.7分。在PaperBench评测中得分93.0,高于Fable 5的88.8。CoWorkBench得分74.8。
2.4 多模态与智能体能力
在WWW2025多模态对话意图识别挑战赛中,模型在24小时内击败了458支人类参赛队伍。在Agent’s Last Exam等通用智能体评测中,新模型分别取得81.9分和52.4分。
三、主流大模型横向对比
| 对比维度 | Qwen3.8-Max | Kimi K3 | DeepSeek V4-Flash | Claude Opus 5 (Max) |
|---|---|---|---|---|
| 总参数量 | 2.4万亿 | 2.8万亿 | — | — |
| 激活参数 | 950亿 | — | — | — |
| 架构类型 | 稀疏MoE | — | — | 稠密 |
| 上下文长度 | 100万Token | 100万Token | — | — |
| 开源状态 | 即将开源(Max级首次) | 已开源 | 开源 | 闭源 |
| Arena排名 | 全球第四(1668分) | 全球第三(1676分) | — | 全球第一(1705分) |
| 输入定价(百万Token) | 12元(国内) | ~21.6元(3美元) | 极低 | 较高 |
| 输出定价(百万Token) | 36元(国内) | ~108元(15美元) | 极低 | 约50美元 |
| 多模态支持 | 原生视觉理解 | 图像+视频 | — | 支持 |
说明:以上数据基于各厂商公开发布信息整理。“—”表示未公开披露或暂无明确数据。定价为参考值,实际以各平台公布为准。
四、开源战略:Max级模型的首次开放
4.1 开源时间与版本规划
2026年8月3日,Qwen3.8-Max随Qwen3.8系列一同正式发布。官方宣布,阿里Qwen3.8-Max将首次开源,模型权重预计于下周正式公布。除旗舰版Qwen3.8-Max外,轻量化版本Qwen3.8-27B也将同步开源,兼顾大规模算力部署与中小型本地私有化场景。
开发者可在ModelScope、Hugging Face等主流开源平台获取模型权重。截至权重正式发布前,模型已通过千问AI平台提供API服务。
4.2 从闭源到开源的战略转变
阿里Qwen系列自2023年推出至今已有多款开源模型,但Max系列此前一直是定位最高的闭源旗舰模型,仅支持API调用,用户无法下载权重。阿里Qwen3.8-Max将首次开源标志着这一策略的根本性转变。
这一调整反映出国内开源模型在技术成熟度与市场验证方面取得实质性突破。以DeepSeek为代表的国产开源方案已成功开辟出兼顾性能、成本与生态适应性的独立发展路径。开源有助于显著降低技术使用门槛,拓展国际应用范围,并提升在多云环境及多样化硬件平台上的部署灵活性。
4.3 开源对AI生态的意义
开源让开发者无需依赖特定云平台即可部署和定制模型。千问系列目前已是全球下载量最大的开源大模型之一,在Hugging Face上累计下载量超过10亿次。阿里Qwen3.8-Max将首次开源后,将进一步巩固这一领先地位。
五、API服务与定价体系
5.1 国内定价
自2026年8月3日起,全球开发者可通过千问AI平台获得Qwen3.8-Max的API服务。国内标准价格为每百万Token输入12元、输出36元。隐式缓存命中场景价格更低至1.5元/百万Token。在国产头部模型中处于中间价位。
5.2 国际定价与竞争力
国际市场定价具备较强竞争力,输入价格为Opus5的40%,输出价格仅为Opus5的24%。每百万输出Token的推理成本约为6美元,显著低于行业主流标杆模型的50美元水平。Qwen3.8-Max相比前代Qwen3.7-Max(输入2.5美元/百万Token、输出7.5美元/百万Token)也实现了价格下调。
5.3 成本优化的技术支撑
推理成本的大幅降低得益于多重技术保障:架构层面采用稀疏MoE与混合注意力机制;硬件层面依托自研AI芯片与通用处理器,构建覆盖芯片、软件与系统级的协同算力体系。阿里真武M890超节点已成功适配Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,在Agentic推理场景中最多可实现1.5倍性能提升。
六、企业级应用与产业落地
6.1 千问办公智能体平台
Qwen3.8-Max同步接入阿里巴巴当日推出的智能体产品“千问办公”(Qwen Work)。该平台是一站式AI办公智能体平台,面向企业和个人用户提供AI辅助服务。
6.2 多行业场景实测
通过扩展强化学习系统,Qwen3.8-Max在针对法律、UI设计、餐饮、结构工程及体育数据分析等数百种职业场景的实测中展现出显著提效能力。例如在法务审查中一小时内完成数百份文档1284条条款的标出;在量化投资领域调度约330个子智能体完成约6000次因子回测;在芯片设计沙箱内历经约500轮交互将硬件门数由8298门精简至678门;在365天长周期电商经营模拟基准中以416252元(4.16倍回报)的总资金成绩取得第一。
6.3 多模态智能体扩展
模型融合了多模态视觉反馈与GUI交互能力,推出了针对多模态Agent的扩展库Qwen-MM-Plugins,推动多模态智能体向复杂任务的端到端执行迈进。
七、行业影响与未来展望
7.1 国产大模型的密集突破
2026年8月1日至3日,国产大模型集中突破:阿里Qwen3.8-Max以2.4T稀疏MoE加1M上下文实现高效推理,MiniMax开源全模态视频模型H3,DeepSeek V4-Flash显著提升Agent能力。三大进展分别指向参数效率、长程自治与多模态生产,标志着大模型正从“辅助工具”迈向“端到端自主交付”。
7.2 开源与闭源的格局演变
阿里Qwen3.8-Max将首次开源的决定,连同Kimi K3的开源、DeepSeek V4-Flash的开源,使中国主要大模型厂商在开源路线上形成合力。这与美国Anthropic、OpenAI等主要采用闭源路线的策略形成鲜明对比。
业内认为,开源让阿里不必将利润压力全部压在API上,但开源之后的真正门槛转移到了“用不用得起”。开源有助于降低采用门槛、扩大海外覆盖、促进跨多云和异构硬件部署。
7.3 算力生态的竞争
阿里通过旗下芯片公司平头哥,实现从AI芯片到CPU、网卡、存储主控的自研。2026年7月,阿里云宣布灵骏真武M890超节点实例已成功适配Qwen3.8,系国内首个成功运行超2万亿参数大模型的超节点。
如果说DeepSeek代表了算法优化在极致成本控制上的极限,那么Qwen3.8-Max的开源则代表了国产模型在全场景应用与Agent生态上的突破。
常见问题(FAQ)
问:阿里Qwen3.8-Max将首次开源的具体时间是什么?
答:阿里巴巴于2026年8月3日正式发布Qwen3.8-Max,官方宣布模型权重预计于下周正式开源公布。届时开发者可在ModelScope、Hugging Face等平台获取模型权重。
问:Qwen3.8-Max的参数规模是多少?
答:Qwen3.8-Max总参数量达2.4万亿(2.4T),采用稀疏混合专家架构,单次推理仅激活约950亿(95B)参数。这种设计在保证旗舰级能力的同时控制了推理成本。
问:Qwen3.8-Max支持多长的上下文?
答:Qwen3.8-Max支持最长100万Token的上下文窗口,标准模式下为128K Token,可一键拓展至1M Token。100万Token约等于75万字文本。
问:Qwen3.8-Max有哪些版本会开源?
答:除旗舰版Qwen3.8-Max外,轻量化版本Qwen3.8-27B也将同步开源。
问:Qwen3.8-Max的API定价是多少?
答:国内标准价格为每百万Token输入12元、输出36元,隐式缓存命中场景仅1.5元。国际定价为Opus5的40%(输入)和24%(输出)。
问:Qwen3.8-Max在权威榜单中的排名如何?
答:在Arena.ai前端代码竞技场中,Qwen3.8-Max以1668分位列全球第四。在Text Arena中排名第五,Vision Arena中排名第二。
问:Qwen3.8-Max的编程能力有何突破?
答:Qwen3.8-Max在无人工干预情况下独立运行16天,完成oh-my-cli项目的自动建构,产出265次代码提交。在CodeArena榜单中位居全球第四。

