阿里发布2.4万亿参数大模型Qwen3.8-Max,跻身全球第一梯队

2026年8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8-Max,总参数量达到2.4万亿,这是千问家族迄今规模最大、能力最强的旗舰模型。Qwen3.8-Max采用稀疏MoE架构,激活参数约95B,在权威三方榜单Arena中排名全球第二,仅次于Anthropic的Claude系列。模型聚焦编程、办公、科研与长上下文等复杂长程任务的端到端交付能力,API已上线千问AI平台,权重将于下周开源。

一、阿里发布2.4万亿参数大模型:技术架构与核心突破
1.1 稀疏MoE架构:2.4万亿总参数与95B激活参数的平衡之道
阿里发布2.4万亿参数大模型Qwen3.8-Max,在模型架构上实现了重大突破。该模型通过稀疏MoE(混合专家)架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展至2.4T。MoE架构的核心思想在于“稀疏激活”——虽然模型总参数达到2.4万亿,但每次推理仅激活约95B(950亿)参数参与计算。
这种设计在扩大模型容量的同时有效控制了计算成本。稀疏MoE架构将模型划分为多个“专家”模块,每个专家专注于特定类型的知识或任务。当输入进入模型时,路由机制动态选择最相关的若干专家进行激活,而非调用全部参数。这使得阿里发布2.4万亿参数大模型在推理效率上获得显著提升,推理速度更快,整体性能迎来新突破。
混合注意力机制的引入进一步优化了模型对长序列的处理能力。Qwen3.8-Max支持长达1M Tokens的上下文窗口,能够一次性处理200页财报PDF或超过100小时的长视频内容。这种超长上下文能力,使得阿里发布2.4万亿参数大模型在科研论文综述、法律合同分析、长文档摘要等场景中具备显著优势。
1.2 从参数堆砌到能力重构:Qwen3.8-Max的设计哲学
阿里发布2.4万亿参数大模型并非简单的参数堆砌,而是核心能力的全面重构。Qwen3.8-Max打破了传统大模型仅能处理文本的局限,实现了视觉、文本、代码、文档的深度融合理解。
在模型定位上,阿里发布2.4万亿参数大模型面向复杂智能体、自主工程、长周期商业与科研任务,重点补齐AI从“简单问答”走向“自主完成完整项目”的能力短板。官方将其定义为具备“自主编码”、“实际工作”和“长远掌控”能力的智能体模型。
Qwen3.8-Max基于Qwen 3.5架构打造,是千问系列中尺寸最大、性能最强的旗舰版本。它支持视觉理解,能够处理图像、视频等多模态输入,并原生集成多模态能力于任务全流程——图像信息不仅是输入素材,更全程参与任务规划、执行校验和自我修正。
二、核心能力深度解析
2.1 自主编程:16天从零构建Hermes Agent
编程能力是前沿大模型的核心能力之一,阿里发布2.4万亿参数大模型在这一领域实现了突破性进展。
在权威CodeArena榜中,Qwen3.8位居全球第四。两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手;而如今,Qwen3.8可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人工干预。
最令人震撼的案例是:只需一句“创建一个自进化的智能体Harness”,Qwen3.8就像一位资深工程师,从零开始自主搭建循环工程框架,编排智能体自动领取和执行任务。人类工程师还可通过钉钉向Qwen3.8提出新要求。Qwen3.8独立编程运行约16天后,做出了一个Hermes Agent级别的、真实可用的自进化智能体框架“oh-my-cli”,该项目现已完全开源,完整过程公开保存在GitHub仓库中。
这一能力意味着阿里发布2.4万亿参数大模型已实现从“代码补全工具”到“自主软件工程师”的跨越。它支持超过10天的持续自我演化开发,可自主完成编码、自测、排错、迭代,直至项目生产部署。在权威CodeArena榜中,Qwen3.8-Max的前端代码能力排名全球第四。
2.2 专业办公(Cowork):数百类职业场景的生产级交付
阿里发布2.4万亿参数大模型可胜任广泛的、真实的专业工作任务(Cowork)。面对完全不同的专业任务、评判标准和计算需求,Qwen3.8通过真实环境和算力的联合强化学习扩展,实现了数百种高价值、高频专业任务的真实表现提升。
具体案例展示了其强大的办公自动化能力:
- 法务场景:一个法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间,Qwen3.8一小时内就能完成。
- 数据分析:一个篮球数据分析团队逐帧标注160小时以上的比赛录像,Qwen3.8数十分钟就可精准拆解8400多个攻防回合,并一次性输出球员战术画像和教练报告。
- 金融研究:一个金融研究团队基于数年的专业知识积累,搜集资本市场全面、实时的变动才能依次完成的量化策略研究,Qwen3.8自主调动并行的智能体,连续工作数小时后交付完整的ETF轮动策略,并持续分析回测、动态修正。
在主流智能体框架中,Qwen3.8均可稳定可靠地交付生产级成果。深度集成Office生态,能自动处理Excel数据分析、PPT智能排版、Word文档结构化提取等任务,支持跨文档关联推理与报告生成。
2.3 长时程任务与多模态智能体
阿里发布2.4万亿参数大模型在长时程复杂任务层面搭载了系统级自主规划与闭环自适应学习框架。公开测试案例显示,它可以完成500轮以上芯片设计持续优化,也能进行跨度365天的电商经营策略推演。长周期任务的最大难点在于模型容易遗忘目标、中途逻辑跑偏,而自适应闭环能够持续接收反馈、自主修正方案。
在视觉理解方面,阿里发布2.4万亿参数大模型同样表现出色。在权威Vision Arena榜单中,Qwen3.8-Max排名全球第二。Qwen3.8不仅能读懂200页的财报PDF、看懂超100小时的长视频,还能将这些“看到”的知识和信息反馈到工作全流程。在视觉推理BabyVision评测中,Qwen3.8-Max在无工具条件下取得82.0分,超出部分主流模型近两倍。在评估智能体电脑操作能力的OSWorld-Verified评测中,Qwen3.8-Max以86.1分位居主流模型首位。
在千问团队构建的“应用复刻”基准RecreationBench长程任务中,模型没有源代码也无法联网,只通过交互与反馈去理解应用,却能从头复刻出整个应用。这表明Qwen3.8已经展现出前沿水准的混合多模态智能体能力,通过“迭代编程—交互反馈”的反复循环,将视觉编程推向新的高度。
三、性能对标:全球大模型第一梯队
3.1 Arena榜单:全球第二,仅次于Claude
阿里发布2.4万亿参数大模型在权威第三方榜单Arena中取得了全球第二的排名,仅次于Anthropic的Claude系列。这意味着阿里发布2.4万亿参数大模型的整体性能已处于全球大模型第一梯队。
在具体评测维度上,Qwen3.8-Max同样表现优异:
- 指令遵循:在IF Bench评测中斩获82.8分
- 科学推理:GPQA Diamond取得92.6分
- 视觉推理:BabyVision评测无工具条件下取得82.0分
- 智能体操作:OSWorld-Verified评测以86.1分位居主流模型首位
3.2 横向对比:主流大模型参数与性能对照
下表对当前主流大模型的关键指标进行横向对比:
| 模型名称 | 发布方 | 总参数 | 激活参数 | 架构 | 上下文长度 | Arena排名 | 开源状态 |
|---|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4万亿 | 95B | 稀疏MoE | 1M Tokens | 全球第二 | 下周开源 |
| Kimi K3 | 月之暗面 | 2.8万亿 | — | MoE | 100万Token | 全球第三 | 已开源 |
| Claude系列 | Anthropic | — | — | — | — | 全球第一 | 闭源 |
| DeepSeek V4-Pro | 深度求索 | 1.6万亿 | 49B | MoE | 100万Token | — | 已开源 |
| 文心5.0 | 百度 | 2.4万亿 | — | — | — | — | — |
数据来源:综合各厂商公开信息
从对比中可以清晰地看到,阿里发布2.4万亿参数大模型在参数规模上已跻身全球前列。在Arena榜单中,Qwen3.8-Max排名仅次于Anthropic的Claude系列。在部分基准测试中,Qwen3.8-Max的表现甚至超越了月之暗面近期发布的Kimi K3。
值得注意的是,阿里发布2.4万亿参数大模型采用了稀疏MoE架构,激活参数仅95B。相比之下,DeepSeek V4-Pro的总参数为1.6万亿,激活参数49B。这种设计使得阿里发布2.4万亿参数大模型在保持超大参数容量的同时,实现了更高的推理效率和更快的推理速度。
四、定价策略与开源生态
4.1 API定价:高性价比的全球竞争力
阿里发布2.4万亿参数大模型的API服务已首发上线千问AI平台,全球开发者可直接调用。在定价策略上,阿里发布2.4万亿参数大模型展现了极具竞争力的性价比:
国内定价:
- 输入:每百万Tokens 12元
- 输出:每百万Tokens 36元
- 隐式缓存命中:每百万Tokens 1.5元
国际定价:
- 输入:2.0美元/百万Tokens
- 输出:6.0美元/百万Tokens
- 隐式缓存命中:0.25美元/百万Tokens
阿里发布2.4万亿参数大模型的输入与输出国际价格仅为Opus5的40%与24%,实现了相近智能、更高性价比。此外,阿里云百炼Token Plan全新升级,个人版39元起/月,团队版低至150元/席位/月,夜间调用低至0.2折。这种定价策略使得阿里发布2.4万亿参数大模型能够以更低的门槛服务全球开发者。
4.2 开源战略:首次开源Max级别模型
阿里发布2.4万亿参数大模型在开源策略上同样具有里程碑意义——这是千问首次将Max级别模型开源。官方宣布,Qwen3.8-Max的权重将于下周在开源社区Hugging Face和ModelScope发布。同时还将开源Qwen3.8-27B。
这一决定意味着阿里发布2.4万亿参数大模型将成为目前参数最大的开源模型之一。全球开发者将能够基于这一强大的基座构建自己的AI应用,推动AI技术的普惠应用。开源战略不仅有助于扩大模型的影响力,也将加速整个AI社区的创新步伐。
五、算力底座:真武M890超节点适配
阿里发布2.4万亿参数大模型的成功运行离不开强大的算力支撑。2026年7月23日,阿里云宣布真武M890超节点已成功适配Qwen3.8,并上线阿里云百炼平台提供模型推理服务。真武M890超节点成为国内首个成功运行超2万亿参数大模型的超节点。
跑通2.4万亿参数规模的模型,需要将参数分散到几十张甚至上百张高速互联的GPU卡上。普通AI集群因通信带宽的局限,无法满足高吞吐、低延迟、高并发的需求。而超节点通过高速互联技术将大量AI芯片紧密耦合,从训练与推理两端全面释放算力效率。
真武M890是平头哥新一代训推一体AI芯片,原生支持FP32到FP4等多种数据精度,可应用于高精度训练、低精度和超低精度推理的全场景。真武M890的磐久AL128超节点服务器搭载自研互联芯片ICN Switch 1.0,可让128张AI芯片组成一台计算机,P2P时延低于150ns。
通过芯片、云平台与千问大模型的全链路优化,阿里发布2.4万亿参数大模型的推理效率显著提升、推理成本有效降低,在Agentic推理场景中最多可实现1.5倍性能提升。这一技术突破标志着国产AI算力体系正式跳出单芯片性能比拼的旧框架,迈入系统级算力架构协同的新阶段。
六、行业影响与战略意义
6.1 “两万亿参数俱乐部”的格局演变
阿里发布2.4万亿参数大模型标志着国产大模型正式迈入“两万亿参数俱乐部”。2026年以来,国产大模型参数规模快速攀升:
- 4月,DeepSeek V4-Pro预览版以1.6万亿总参数、490亿激活参数开局
- 7月,月之暗面Kimi K3以2.8万亿参数登顶全球开源模型规模之王
- 7月19日,阿里上线Qwen3.8-Max预览版,参数量2.4万亿
- 8月3日,阿里正式发布2.4万亿参数大模型Qwen3.8-Max
国产AI大模型在参数规模上取得重大突破,其性能已接近部分国外顶尖闭源模型,与国外领先模型的差距被认为已缩短至数月内。曾走访过Kimi的美国AI研究者判断中美模型差距已缩至3~5个月。
6.2 从“简单问答”到“自主完成完整项目”
阿里发布2.4万亿参数大模型的一个重要战略意义在于推动AI从“简单问答”走向“自主完成完整项目”。这一转变意味着大模型不再仅仅是对话工具,而是能够独立规划、执行和交付复杂项目的智能体。
Qwen3.8-Max能够以极少的人工介入将复杂、开放的目标端到端完成,交付值得信赖的成果。在长周期任务中,模型涌现出系统级自主规划与全栈闭环自适应学习能力。这为AI在软件开发、科研探索、商业运营等领域的深度应用打开了新的空间。
6.3 企业级市场布局:千问办公同步公测
在阿里发布2.4万亿参数大模型的同一天,阿里巴巴旗下企业级Agent产品“千问办公”(QwenWork)开启公测。个人和企业用户均可通过“千问办公”官网体验,目前网页版和独立PC客户端已开放。
新的“千问办公”由QoderWork、MuleRun、悟空三款产品全面整合而来,是业内首款同时支持桌面端Agent、云端Agent、企业协同Agent的产品。它已初步打通钉钉IM,未来将全面连接企业真实的数据库和工作流。
不同于市面上已有的Agent产品,“千问办公”除了帮助个人提效外,其核心差异在于全面瞄准企业级市场。用户可在“千问办公”中直接体验阿里最新旗舰模型Qwen3.8。这一布局使得阿里发布2.4万亿参数大模型能够快速触达企业用户,实现技术与商业场景的深度融合。
受此消息提振,阿里巴巴港股当日拉升,股价涨幅达6.75%,报124.9港元/股。
七、总结与展望
阿里发布2.4万亿参数大模型Qwen3.8-Max,是国产AI发展历程中的一个重要里程碑。从技术架构上看,稀疏MoE与混合注意力机制的联合优化,使2.4万亿总参数与95B激活参数实现了效率与能力的平衡。从能力维度看,自主编程、专业办公、长时程任务与多模态智能体四大能力的全面提升,使模型从“问答工具”进化为“自主执行复杂项目的智能体”。从行业竞争看,Arena榜单全球第二的排名,使阿里发布2.4万亿参数大模型跻身全球大模型第一梯队。
展望未来,随着Qwen3.8-Max权重的下周开源,全球开发者将能够基于这一强大的基座模型构建各类AI应用。真武M890超节点的成功适配也为更大规模模型的训练和推理提供了算力保障。阿里发布2.4万亿参数大模型不仅是一次技术突破,更是推动AI从“能聊”走向“能干”的关键一步。
常见问题(FAQ)
问:阿里发布2.4万亿参数大模型的具体名称是什么?
答:阿里发布2.4万亿参数大模型的正式名称为Qwen3.8-Max,是千问大模型家族中尺寸最大、性能最强的旗舰模型。
问:Qwen3.8-Max的总参数和激活参数分别是多少?
答:Qwen3.8-Max的总参数达到2.4万亿(2.4T),采用稀疏MoE架构,每次推理激活约95B(950亿)参数参与计算。
问:阿里发布2.4万亿参数大模型在权威榜单中排名如何?
答:在权威第三方榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列,排名全球第二,整体性能处于全球大模型第一梯队。
问:Qwen3.8-Max的上下文长度支持多少?
答:Qwen3.8-Max支持长达1M Tokens的上下文窗口,能够一次性处理200页财报PDF或超过100小时的长视频内容。
问:阿里发布2.4万亿参数大模型何时开源?
答:阿里官方宣布Qwen3.8-Max的权重将于下周在Hugging Face和ModelScope开源,同时还将开源Qwen3.8-27B。
问:Qwen3.8-Max的API定价是多少?
答:国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元;国际价格为输入2.0美元/百万Tokens、输出6.0美元/百万Tokens。
问:阿里发布2.4万亿参数大模型与Kimi K3相比如何?
答:Qwen3.8-Max在部分基准测试中的表现超越月之暗面近期发布的Kimi K3。在Arena榜单中,Qwen3.8-Max排名全球第二,而Kimi K3排名全球第三。
问:真武M890超节点与Qwen3.8-Max的关系是什么?
答:真武M890超节点是阿里自研的训推一体AI芯片超节点,已成功适配Qwen3.8-Max,是国内首个成功运行超2万亿参数大模型的超节点。通过全链路优化,在Agentic推理场景中最多可实现1.5倍性能提升。
问:阿里发布2.4万亿参数大模型主要面向哪些场景?
答:Qwen3.8-Max聚焦编程、办公、科研与长上下文等复杂长程任务的端到端交付能力,面向复杂智能体、自主工程、长周期商业与科研任务。

