阿里发布2.4万亿参数Qwen3.8-Max开源视觉大模型

当前开源大模型的竞赛正朝着参数规模持续扩张、综合性能不断跃升的方向加速推进。不久前,知名开源模型团队推出了Kimi K3,成为当时公开权重模型中规模与性能顶尖的作品;而在短短几周后,国内科技企业随即推出了自家的巨型视觉语言模型作为回应,进一步推动开源大模型的竞争升级。
8月2日,该企业正式发布了Qwen3.8-Max,这是一款参数规模达2.4万亿的视觉语言模型,专为长时间运行的编码与知识密集型工作任务设计。在发布后的一周内,团队同时推出了Qwen3.8-Max与更小尺寸的Qwen3.8-27B的公开权重。其中,Qwen3.8-27B此前就已开放权重,而Qwen3.8-Max则是该系列首款对外开放权重的顶级型号,不过其公开版本仅支持文本交互,无法完整使用100万token的上下文窗口能力。
模型核心参数与基础能力
- 输入输出:支持文本、图像与视频输入(最长支持100万token上下文),文本输出最长可达13.1万token,推理时可生成最多26.2万token,单秒推理速度约77.6token
- 架构:采用混合注意力机制的混合专家Transformer架构,总参数2.4万亿,每个token仅激活约950亿参数,占总参数的4%
- 功能特性:支持多档位推理模式(无、低、中、超高,默认超高),默认保留推理文本,具备函数调用、结构化输出、前缀补全与上下文缓存能力
- 性能表现:在第三方综合评测指标中排名第五,开源权重模型中位列第二(得分58);在𝜏³-Banking测试中综合排名第一(得分51.3%);在Arena.ai的Vision Arena榜单中排名第二(1301 Elo);在WebDev Code Arena榜单中排名第四(1667 Elo)
- 可用性与价格:通过云服务商Model Studio API提供服务,输入、缓存、输出token的单价分别为每百万2.00美元、0.25美元与6.00美元;可通过QwenWork订阅使用(目前仅中国地区公开测试免费,美国地区可通过订阅获取);公开权重可在Hugging Face与ModelScope获取,采用自定义许可协议
- 未披露信息:模型的知识截止时间、训练数据与训练方法均未公开
技术实现细节
关于Qwen3.8-Max的技术细节,官方尚未发布正式的技术报告或模型卡片,但官方说明显示,该模型基于此前的视觉语言模型Qwen3.5构建,重点强化了智能体工作场景下的强化学习能力,同时支持模型利用自身视觉能力对输出结果进行视觉验证。
- 混合专家架构适配:Qwen3.8-Max的混合专家Transformer在处理每个token时,仅激活约4%的总参数,大幅降低了单token的计算成本。其混合注意力机制延续了Qwen3.5的设计,将标准注意力层与门控Delta网络层结合,相比标准注意力方案更节省内存资源
- 多模态预训练设计:与Qwen3.5一致,Qwen3.8-Max在预训练阶段就同时处理文本与图像数据,而非在预训练好的语言模型外挂视觉编码器,这一设计让模型在规划、执行与验证任务时,可以直接检查渲染后的输出结果
- 专用智能体框架:团队同步推出了QwenWork,这是专为运行该模型设计的智能体执行框架
- 强化学习微调方案:模型通过QwenWork与其他智能体环境进行强化学习微调,训练过程从三个维度进行扩展:任务时长(单次、多次或持续数日)、工作空间复杂度(单文件、多文件或层级文件夹)、所用工具框架(不同工具、版本与已安装技能)。训练过程中,一套奖励系统通过执行代码、依据评分标准评判文本与渲染图像,并借助智能体检查结果来为每个输出打分;同时通过数据平衡器保持每个训练批次中的任务、难度与框架组合均衡,以稳定训练效果
- 许可协议差异:Qwen3.8-Max的公开权重仅支持文本交互,不包含视觉输入与100万token上下文窗口功能,采用自定义许可协议,类似MIT许可证,但如果使用场景的月活跃用户超过1亿或月营收超过2000万美元,则需要进行署名。基于Qwen3.8-Max构建的模型即服务或编程助手,如果年营收超过5000万美元,也需要另行申请许可。而Qwen3.8-27B的权重包含模型全部能力,采用标准Apache 2.0许可证
实测性能表现
在发布时的独立第三方评测中,Qwen3.8-Max的综合智能表现仅落后于少数顶级闭源模型与Kimi K3,在前端编码、视觉处理与智能体工作场景中表现突出,几乎在所有基准测试中都优于Qwen3.7-Max。不过性能提升也伴随着成本代价:该模型生成的token数量比竞品更多,尽管单token成本较低,但完成每项基准任务的总体成本仍有所上升。
- 在第三方综合评测指标Intelligence Index中,设置为超高推理模式的Qwen3.8-Max得分58,每个任务成本约1.13美元,相比上一代Qwen3.7-Max的47分(每个任务0.54美元)提升了11分,综合排名第五,开源权重模型中位列第二。这一成绩高于设置为最高推理模式的Claude Opus 4.8(57分,每个任务2.03美元)与设置为超高推理模式的Muse Spark 1.2(57分,每个任务0.40美元),但低于设置为最高推理模式的Kimi K3(60分,每个任务0.86美元)
- 在𝜏³-Banking测试中,Qwen3.8-Max在模拟客户银行请求的任务中取得了51.3%的得分,成为所有受测模型中的最高分。在GDPval-AA v2测试中,这一针对经济核心领域任务的正面对决排名,Qwen3.8-Max取得了1739 Elo,仅次于设置为最高推理模式的Claude Opus 5(1846 Elo)与设置为最高推理模式并带回退机制的Claude Fable 5(1743 Elo)
- 在Arena.ai的盲测一对一对比榜单中,Qwen3.8-Max在WebDev Code Arena首秀即取得第四名(1667 Elo),落后于设置为最高推理模式的Claude Opus 5(1686 Elo)与设置为最高推理模式的Kimi K3(1675 Elo);在Vision Arena榜单中首秀即取得第二名(1301 Elo),仅次于Claude Fable 5(1315 Elo)
- 目前,Qwen3.8-27B在开源权重模型中排名第三,综合得分52,表现与GPT-5.6 Luna相当,是当前为数不多可以在消费级机器上本地运行的高性能开源模型
行业背景与战略转向
Qwen3.8-Max的公开权重标志着该科技企业的战略转变:从此前将顶级模型仅通过API与官方应用提供服务,转向重新开放顶级模型的权重。自Max系列于2025年1月启动以来,企业一直通过API与官方聊天应用提供这些模型,最新的Qwen3.7-Max也仅对小尺寸模型开放权重,比如Qwen3.6-27B。在企业暂停开放顶级模型权重的这段时间里,国内其他开源模型团队一直在轮流争夺开源权重的领先地位,包括此前推出Kimi K3的团队与Z.ai。在Kimi K3推出几天后,该企业就在上海世界人工智能大会上预览了Qwen3.8-Max,并于8月2日通过API正式发布;而Z.ai则在8月14日推出了GLM-5.3,这款模型在第三方综合评测指标中取得了60分的平均分。
开放权重的核心价值
开放顶级模型的权重为开发者带来了更多选择空间:既可以选择自建部署,也可以使用官方工具与API服务。尽管能够自行托管2.4万亿参数模型的团队数量极少,但真正的收益将来自第三方托管服务商之间的降价竞争,以及像Qwen3.8-27B这样的轻量化蒸馏后继模型。同时,公开权重也让开发者可以为隐私条款争取更有利的条件,因为任何服务商都可以提供该模型的部署服务,包括那些不保留客户数据的厂商。
行业观察
值得注意的是,Qwen3.8-Max的公开版本并未包含API版本的全部能力,但可以在本地运行的Qwen3.8-27B依然为开发者提供了不错的体验,尽管该模型有时会出现过度思考的情况。

