阿里巴巴发布Qwen3.8大模型,编程办公能力跃升全球第二梯队

8月3日,国内科技企业正式推出新一代基座大模型Qwen3.8,该模型总参数量达到2.4万亿,在代码开发与专业办公场景下的性能实现了显著跃升。根据最新公布的权威第三方评测榜单Arena显示,该模型的综合表现仅次于Anthropic的Claude系列,跻身全球大模型第一梯队。目前,Qwen3.8的API接口已上线官方AI服务平台,并同步接入企业当日推出的智能体产品“千问办公”。官方透露,Qwen3.8-Max预计将于下周正式开源,同时还将同步开源Qwen3.8-27B版本。
即日起,全球开发者均可通过官方AI服务平台获取Qwen3.8的API服务。国内地区的计费标准为每百万Tokens输入12元、输出36元,若触发隐式缓存则仅需1.5元;面向海外的输入与输出价格,仅为同类产品Opus5的40%与24%,在保持相近智能水平的前提下实现了更高的性价比。
本次推出的Qwen3.8-Max是千问大模型系列中规模最大、性能最强的旗舰版本,支持视觉理解能力,上下文长度可达1M Tokens。在模型架构层面,Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化,首次将系列总参数量拓展至2.4T,激活参数量达95B,不仅获得了更出色的推理效率与运行速度,整体性能也实现了突破性提升。在科研复现评测PaperBench等代码智能体专项测试中,Qwen3.8-Max较上一代模型提升了28.2分,以93.0分创下该评测的新高;在WideSearch、Agent’s Last Exam等通用智能体评测中,新模型分别取得81.9分与52.4分的成绩,处于行业前沿水平。同时,Qwen3.8在指令遵循IF Bench评测中斩获82.8分,科学推理GPQA Diamond评测拿下92.6分,系列通用能力均位居全球前列;在视觉推理BabyVision评测中,Qwen3.8-Max在无需额外工具的条件下取得82.0分,超出多数主流模型近两倍;在评估智能体电脑操作能力的OSWorld-Verified评测中,Qwen3.8-Max以86.1分位居主流模型首位。
编程能力是前沿大模型的核心竞争力之一,Qwen3.8实现了全新的自主编程突破。在权威CodeArena榜单中,Qwen3.8位列全球第四。与两年前只能完成函数编写、代码补全的早期模型不同,如今的Qwen3.8可以从空白文件夹起步,自主完成长达十数天的真实项目交付,全程无需人工干预。当开发者提出“创建一个自进化的智能体Harness”的需求时,该模型就如同资深工程师一般,从零开始搭建循环工程框架,编排智能体自动领取并执行任务,研发人员还可通过即时通讯工具向其提出新的调整要求。Qwen3.8独立运行约16天后,成功打造出一款达到Hermes Agent级别、可实际落地的自进化智能体框架“oh-my-cli”,目前该项目已完全开源,完整开发过程公开保存在GitHub仓库中,可供所有开发者查看学习。
Qwen3.8可胜任广泛的真实专业工作任务。针对不同类型的专业任务、评判标准与算力需求,该模型通过真实环境与算力联合强化学习的方式,实现了数百项高价值高频专业任务的性能提升,可在主流智能体框架中稳定交付生产级成果。举例来说,一支法务助理团队需要一周时间才能完成数百份法律文档中千余个相关条款的标注工作,Qwen3.8仅需一小时即可完成;一个篮球数据分析团队需要逐帧标注160小时以上的比赛录像,该模型仅需数十分钟就能精准拆解8400多个攻防回合,并一次性输出球员战术画像与教练分析报告;一个金融研究团队需要依托数年专业知识积累,全面搜集资本市场实时变动才能完成的量化策略研究,Qwen3.8可自主调动并行智能体,连续工作数小时后即可交付完整的ETF轮动策略,并持续完成分析回测、动态修正,最终实现规模化盈利。
在长周期复杂任务中,Qwen3.8还涌现出系统级自主规划与全栈闭环自适应学习能力。无论是在高精密、强物理约束的数字芯片设计场景,还是在高度动态、博弈激烈的商业模拟运营环境中,该模型都能通过“执行-反馈-迭代”的自适应闭环机制,在数千轮的超长程交互中实现算法与策略的深度重构。
除了出色的文本与推理能力,Qwen3.8还进一步突破了AI视觉理解的极限。在权威Vision Arena榜单中,Qwen3.8-Max排名全球第二。该模型不仅能够读懂200页的财报PDF、解析时长超100小时的长视频,还能将这些通过视觉获取的知识与信息反馈到全工作流程中,帮助模型做出更周全的思考。在官方团队构建的“应用复刻”基准RecreationBench长程任务中,模型在没有源代码、无法联网的情况下,仅通过交互与反馈理解目标应用,就能从零开始复刻出完整的应用程序。这一表现证明Qwen3.8已具备前沿水准的混合多模态智能体能力,通过“迭代编程—交互反馈”的反复循环,将视觉编程技术推向了新的高度。
据了解,国内自研的真武M890超节点已成功适配Qwen3.8,通过芯片、云平台与大模型的全链路优化,显著提升了推理效率并降低了推理成本,在Agentic推理场景中最多可实现1.5倍的性能提升。


