文章摘要
8月3日,阿里巴巴推出新一代旗舰基座大模型Qwen3.8,总参数量2.4万亿,综合性能居全球大模型第一梯队。其API接口已上线,Qwen3.8-Max预计下周开源。该模型在编程、专业办公等场景能力跃升,可自主编程、处理专业任务、理解视觉内容。阿里自研超节点适配此模型,提升推理效率、降低成本。

8月3日,阿里巴巴正式推出新一代旗舰基座大模型Qwen3.8,这款总参数量达到2.4万亿的大模型,在编程与专业办公场景下的能力实现了大幅跃升。根据近期发布的权威三方评测榜单Arena,Qwen系列模型的综合性能仅次于Anthropic的Claude系列,稳居全球大模型第一梯队。

目前,Qwen3.8的API接口已经上线相关AI服务平台,同时接入了阿里同日推出的企业级Agent产品“千问办公”。官方透露,Qwen3.8-Max预计将于下周开源,同时还将同步开源Qwen3.8-27B版本。

从即日起,全球开发者都可以通过该平台获取Qwen3.8的API服务。国内区域的定价标准为每百万输入Tokens收费12元,输出Tokens收费36元,若命中隐式缓存仅需1.5元;国际区域的输入与输出价格分别仅为同类顶级模型Opus5的40%与24%,在保持相近智能水平的前提下实现了更高的性价比。

与此同时,阿里旗下的企业级Agent产品“千问办公”正式开启公测。个人用户与企业客户均可通过其官方指定渠道体验,目前网页版与独立PC客户端已经开放,相关办公软件PC端与手机端的内置入口也将在近期上线,用户可以在该产品中直接体验最新的Qwen3.8旗舰模型。

旗舰模型架构与性能突破

本次推出的Qwen3.8-Max是千问大模型系列中体量最大、性能最强的旗舰版本,支持视觉理解能力,上下文长度达到1M Tokens。在模型架构层面,Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化,首次将总参数量拓展至2.4万亿,激活参数量为95B,不仅获得了更高的推理效率与更快的推理速度,整体性能也实现了全新突破。

  • 在PaperBench等科研复现编程智能体评测中,较上代模型提升28.2分,以93.0分创下评测新高;
  • 在WideSearch、Agent's Last Exam等通用智能体评测中,分别斩获81.9分与52.4分,位居行业前沿;
  • 在指令遵循IF Bench评测中拿下82.8分,科学推理GPQA Diamond评测取得92.6分,系列通用能力均处于全球第一梯队;
  • 在视觉推理BabyVision评测中,Qwen3.8-Max在无额外工具辅助的条件下取得82.0分,超出多数主流模型近两倍;在评估智能体电脑操作能力的OSWorld-Verified评测中,以86.1分位居主流模型首位。

自主编程能力实现全新突破

编程能力是前沿大模型的核心竞争力之一,Qwen3.8在该领域实现了突破性进展。根据权威CodeArena榜单,Qwen3.8位居全球第四。官方介绍,该模型可以从一个空文件夹起步,自主完成长达十数天的真实项目交付,全程无需人工干预。

以创建自进化智能体Harness为例,只需一句需求指令,Qwen3.8就如同一位经验丰富的资深工程师,从零开始自主搭建循环工程框架,编排智能体自动领取并执行任务,研发人员还可以通过企业内部沟通工具向模型提出新的优化要求。Qwen3.8独立运行约16天后,成功打造出一个达到Hermes Agent级别的、可实际落地的自进化智能体框架“oh-my-cli”,目前该项目已经完全开源,完整的开发过程公开保存在公开代码托管仓库中,可供所有开发者查看学习。

专业办公场景高效落地

除了编程领域,Qwen3.8还能够胜任广泛的真实专业工作任务。针对不同类型的专业任务、评判标准与算力需求,该模型通过真实环境与算力联合强化学习的扩展优化,实现了数百种高价值高频专业任务的性能提升,可以在主流智能体框架中稳定交付生产级成果。

  • 一支法务助理团队需要花费一周时间,才能在数百份法律文档中标注千余个相关条款,而Qwen3.8仅需一小时即可完成全部工作;
  • 一个篮球数据分析团队需要逐帧标注超过160小时的比赛录像,Qwen3.8仅需数十分钟就能精准拆解8400多个攻防回合,并一次性输出球员战术画像与教练分析报告;
  • 一个金融研究团队需要依托数年的专业知识积累,搜集资本市场的全面实时变动,才能逐步完成量化策略研究,而Qwen3.8可以自主调动并行智能体,连续工作数小时后交付完整的ETF轮动策略,还能持续进行回测分析、动态修正,最终实现规模化盈利。

在长周期任务场景中,Qwen3.8还涌现出系统级自主规划与全栈闭环自适应学习能力。无论是在高精密、强物理约束的数字芯片设计领域,还是在高度动态、博弈激烈的商业模拟运营场景中,Qwen3.8都可以通过“执行-反馈-迭代”的自适应闭环,在数千轮的超长程交互中实现算法与策略的深度重构。

视觉理解能力大幅跃升

Qwen3.8不仅拥有强大的文本与推理能力,还进一步突破了AI视觉理解的能力上限。在权威Vision Arena榜单中,Qwen3.8-Max排名全球第二。

据官方介绍,该模型可以读懂200页的财报PDF,也能够解析超过100小时的长视频内容,并将这些通过视觉获取的知识与信息反馈到全工作流程中,帮助模型做出更周全的思考。在研发团队构建的“应用复刻”基准RecreationBench长程任务中,模型在没有源代码、无法联网的情况下,仅通过交互与反馈理解目标应用,最终从零复刻出了完整的应用程序。

算力适配与成本优化

此外,阿里自研的真武M890超节点已经成功适配Qwen3.8大模型,通过芯片、云平台与大模型的全链路优化,显著提升了推理效率并降低了推理成本,在Agentic推理场景中最多可实现1.5倍的性能提升。

作为本次发布的核心旗舰版本,Qwen3.8-Max将在下周开源,同时推出的还有Qwen3.8-27B版本,将为全球开发者提供更多选择。

以上内容不代表本平台立场,仅供读者参考