文章摘要
近日官方推出全新旗舰大模型Qwen3.8-Max,团队计划下周开源其权重文件及Qwen3.8 - 27B模型。该模型参数达2.4万亿,在多核心场景能力跃升,能端到端完成复杂工作。在编程、科研、办公等多领域表现出色,性价比高。用户反馈其可稳定承接长链路任务、交付高质量结果,团队欢迎社区反馈。

近日,官方正式推出全新旗舰大模型Qwen3.8-Max,作为当前系列中性能最强的版本,团队计划于下周开放该模型的权重文件开源权限,同时还将同步开源Qwen3.8-27B模型。

这款模型基于前代架构进行深度优化与扩展,总参数规模达到2.4万亿,激活参数为950亿,支持最长100万Tokens的上下文窗口。在编程、专业办公、科研攻坚以及长周期复杂任务等多个核心场景中,其能力实现了全面跃升,不仅能够应对更高难度的挑战,还可以在极少人工介入的情况下端到端完成复杂工作,输出值得信赖的最终成果。

目前全球开发者均可通过官方AI服务平台获取该模型的API调用服务:国内区域每百万Tokens输入费用为12元,输出费用为36元,隐式缓存命中仅需1.5元;海外区域每百万Tokens输入为2美元,输出为6美元,隐式缓存命中0.25美元,对比海外同级别前沿模型,该模型拥有更高的性价比。

模型性能与三方榜单

根据公开的Arena榜单数据,Qwen3.8-Max在多个核心赛道均有出色表现:

  • Text Arena:覆盖数学、代码、创意写作等领域的文本能力综合榜单
  • CodeArena:考察多步骤推理与工具调用能力的前端编程智能体榜单
  • VisionArena:包含视觉推理等核心项目的视觉能力榜单

编程能力:独立交付全链路项目

当下顶尖大模型的编程能力早已超越了简单的代码编写,而是能够从空文件夹起步,独立完成跨多天的真实项目交付。团队通过两项挑战测试了Qwen3.8-Max的编程实力,所有成果均由模型独立完成代码编写、测试运行与BUG修复,全程无人工干预。

从零构建自进化Harness项目

在一项测试中,Qwen3.8-Max被要求从零创建oh-my-cli项目,并在十天级的长程自动编程流程中构建一套自进化的测试工具集。模型将用户反馈、社区先进实践与自身测试结果统一纳入工程循环,将需求自动转化为标准化issue,由智能体自动领取执行,并在代码迭代、测试验证、预览反馈与日志追踪中持续优化。截至2026年7月30日,在模型自主运行约16天后,代码仓库累计产生265次提交、127个合并请求与151个issue,展现出极强的持续演进自动编程能力。

科研能力:复现前沿论文并实现超越

团队将一篇最新的《Unified Data Selection for LLM Reasoning》研究论文交给模型,要求其用代码复现论文中的实验,并在此基础上探索优化方案。复现的难点在于,模型仅能依靠该论文与一批GPU资源,所有代码与流程都需要从零搭建。

Qwen3.8-Max连续独立工作约五天,仅用37小时就从零搭建起完整的训练与评测流水线,完整复现了论文的六项核心结论,并在高难度数学基准上验证了效果。随后的88小时中,模型像人类研究员一样开展科研循环:提出假设→编写代码→运行GPU训练→分析结果→迭代优化。经过四轮迭代,模型独立提出并测试了18种改进方向,最终找到一种超越原论文方法的新方案,在竞赛级数学基准AIME24上提升了2.7分。整个过程中,模型累计编写约7600行代码、执行超过1100步操作、完成33轮GPU训练,成功实现了论文复现与性能超越的目标。

办公场景:覆盖广泛且交付可靠

除编程领域外,模型在依赖多步骤工具调用的日常办公任务中也表现出色,这也是团队的核心优化目标之一。为实现这一目标,团队对真实世界的强化学习系统进行了扩展,并解决了三个关键的耦合挑战:

  1. 环境解耦:扩展工作场景广度:将工作环境拆分为任务复杂度、工作空间规模、工具链配置三个独立维度,每个维度均可独立沿复杂度递进,互不干扰。环境总数随任一维度的扩展自然倍增,无需为每种组合单独搭建,大幅提升了场景覆盖范围。
  2. 统一奖励系统:标准化验收标准:不同类型任务的验收方式存在天然差异,代码需要跑通、文档需要符合格式、截图需要核对渲染效果、操作路径需要审计。团队将执行校验、文本评判、视觉检查与行为审计整合为一套统一的评分标准,让模型在多样化的RL环境中始终收到一致的反馈信号。
  3. 在线数据均衡:稳定训练信号:模型的训练依赖批量数据输入,如果某一批次全为简单代码题、下一批次全为高难度文档题,模型收到的反馈信号差异极大,算力投入无法有效转化为能力提升。团队开发的均衡器会在每个批次组装时自动按任务类型、难度、工作区与工具链配平数据分布,让模型每一步收到的训练信号保持均匀,确保训练算力能够持续稳定地转化为能力提升。

这三项优化共同提供了场景广度、可靠奖励与训练稳定性,通过“环境×算力”的联合扩展,提升了模型在主流办公工具链上的通用工作能力,让模型不仅能够覆盖更多办公场景,还能交付高质量的工作成果。

跨职业场景:覆盖数百个高价值工作领域

团队在覆盖数百种高价值职业的高频工作场景中对Qwen3.8-Max进行了压力测试,验证其交付生产级成果的广度,以下是几个代表性案例:

  • 企业合规律师:面对数百份合规文档的语料,模型仅需单次通读即可标记出1284条相关条款,全部审阅工作可在一小时内完成。而同等规模的文档审查通常需要法务助理团队协作一周才能完成。
  • 结构工程师:仅凭借一份建筑图纸,模型即可在浏览器中还原出30层写字楼的抗震结构模型,周期、基底剪力、层间位移角等参数均支持实时悬停查看。传统流程需要工程师在专业建模软件中手工搭建,通常耗时一周以上。
  • 体育数据分析师:模型可将每名球员约8400个攻防回合的数据解析为可直接使用的球员战术画像与教练报告,仅需数十分钟即可完成。而传统分析团队需要手工完成战术切片、成因归纳与报告撰写,通常需要数个工作日。

量化研发:端到端交付可盈利策略

Qwen3.8-Max具备强大的动态工作流构建能力,能够通过编程驱动任务规划,精准编排大规模子智能体系统,将一次对话转化为端到端的自动化量化研发闭环。

深度层面:从零搭建完整策略

仅通过一句任务描述,模型即可连续自主工作数小时,交付一套完整的ETF轮动策略,包括搭建数据管道、生成候选因子、多轮迭代筛选、回测验证与方向修正。整个过程中,模型会根据证据自主判断而非遵循固定脚本:当验证期指标与设计期不符时,会自动剪枝冗余因子以避免过拟合;当不同路径收敛到同一信号时,会加入多种子并集验证以消除路径依赖;当小截面上三模型集成效果不如定向合成时,会主动切换策略框架以提升稳健性。

广度层面:规模化并行化研发

量化研究中最耗时的环节是“试因子”,传统流程中研究员需要顺着单一思路逐步尝试,完成一条路径后再切换到下一条。而Qwen3.8-Max可将这一环节并行化:从动量、价值、质量等6个方向出发,每个方向拆出50条研究路径,同时调度约330个子智能体并行运行,累计完成约6000次历史回测。最终入选的因子超额年化收益与风险之比达到0.64-1.48,预测稳定性指标均为正,介于0.010-0.014之间。原本需要研究员数周甚至数月串行推进的工作,现在可以在一次对话中规模化交付,展现出模型在长时程自主工作领域的巨大潜力。

长程任务:系统级自主规划与迭代

面对极其复杂的长周期、多约束任务,Qwen3.8-Max展现出超越以往的系统级自主规划能力,无论是高精密、强物理约束的芯片设计,还是高度动态、博弈激烈的商业经营,模型都能通过“执行-反馈-迭代”的自适应闭环,在数千轮超长交互中完成算法与策略的深度重构。

芯片设计:全链路自主优化

模型独立完成了芯片设计中的逻辑重构、多约束优化与后端布局全流程。团队要求模型独立完成一款GCD/RSA密码硬件加速器的设计,这是一类高度紧凑、逻辑密集的数字电路。在无参考设计、无人工干预的条件下,模型在集成了仿真、综合与物理设计工具链的沙箱环境中,独立完成了从算法架构、RTL代码到多轮优化的全过程。在单次不间断运行中,模型历经约500轮交互、71次评估与13个关键里程碑,将设计从首个跑通的8298门优化至678门,在所有参评模型中表现最优。即使在数百轮交互后,模型仍能发起重大的结构性演进,未陷入早期局部收益的瓶颈。更关键的是,这套前端架构优化在真实物理实现中同样成立,证明了架构级别的深度演进可以无缝、高效地转化为更小、更快、布线更优的实体芯片。

长程电商经营:持续学习与前瞻规划

E-Commerce Bench是一个基于真实脱敏交易数据构建的365天长周期电商经营模拟基准,还原了12种店铺、60个商品类目、近600家供应商与7000种商品的复杂生态。模型手握10万元启动资金,需要独立完成选品、供应链议价、库存管理、动态定价与退货处理等全链路决策,目标是实现年末总现金最大化。

Qwen3.8-Max展现出两大过人优势:一是持续学习能力,能够将与特定供应商谈判得到的议价经验泛化到同类商品场景,而其他模型的议价效率往往在中期就陷入瓶颈;二是前瞻规划能力,在经营初期就投入最多资金进行布局,让后续资产增长更快,年终大促期间净利润突破10万元,是第二名模型的近2.4倍。最终模型以高达416252元的总现金胜出,比第二名高出38%,相较上一代旗舰模型提升了152%。这一结果证明,Qwen3.8-Max不仅具备长程连贯决策优势,还拥有从交易反馈中自适应学习的能力。

多模态智能体:从看懂到动手交付

Qwen3.8-Max展示的不只是“看懂图片、文档和视频”的基础能力,而是一套贯穿任务全流程的视觉生产力:

  • 海量信息一次吃透:模型可以跨页读懂超过200页的财报、复杂PDF中的文字、图表与版面结构,直接提炼结论并生成可交付的报告与网页;对于超过100小时的长视频,不仅可以定位关键片段,还能将人物、事件与时间织成一张可查询的“视频Graph记忆”,将原本难以一次性消化的海量信息转化为可检索、可追溯、可交互的知识结构。
  • 理解之外的动手交付能力:模型可以将生活素材剪辑为Vlog,将一道题目转化为沉浸式教学动画,将一张界面截图还原为完整的前端项目,将户型图转换为三维装修效果,甚至可以根据一句需求开发出可交互的游戏与应用。
  • 边做边看的自主纠错能力:视觉能力不仅体现在任务的输入端,在执行过程中,模型会持续观察自己的中间产物,检查页面布局、物体朝向、空间关系、动画与交互效果;一旦发现布局错位、效果异常等问题,会自动定位偏差、重新规划并自主修正。

在数字世界中,独立完成复杂任务往往需要同时兼顾代码实现底层逻辑与GUI操作推进任务、观察结果。这种混合智能体能力,即编程与GUI操作的结合,让两条路径彼此互补:编程可以高效且大规模地完成繁重工作,GUI操作则可以触达人类所能看见、所能操作的一切场景,更关键的是可以将真实运行系统中的实际反馈带回,用于检查与优化产物,实现真实运行应用的验证。

为衡量这一能力,团队构建了RecreationBench基准,要求模型面对一个正在运行的真实应用,在没有源码、不能联网的情况下,仅像普通用户一样点击、查看、尝试,然后从零复刻出整个应用,覆盖桌面、移动端与Web五大平台。Qwen3.8-Max在此基准上已展现出前沿水准,能够通过“写代码-看效果-再修改”的循环逐步逼近原版应用。此外,团队还推出了即插即用的多模态扩展库,可让不同的智能体框架直接获得图像处理、视频剪辑、3D建模等视觉能力,无需从零搭建。

用户反馈:来自真实场景的验证

对Qwen3.8-Max最真实的评价来自实际使用它完成工作的用户。无论是头部智能体应用平台、领先的开源算法团队,还是来自法律、金融、制造等领域的专业公司、新兴创业团队、个人开发者与学术科研者,都在持续将复杂、关键、长链路的任务交给该模型处理。

企业用户用它搭建和驱动大规模智能体系统,白领工作者将图片、手稿、视频等繁杂材料一次性交给它处理,开发者直接让它承担高强度工程任务,科研团队则用它跑通“文献-数据-仿真”的完整研究闭环。在不同领域、不同工作流中反复使用后,所有用户都得到了一致的结论:Qwen3.8-Max既能稳定承接长链路的自主任务,也能一次生成可直接交付的高质量结果。

总结

Qwen3.8-Max是当前团队推出的最强旗舰模型,也是首个Max规模的开源权重模型。其总参数规模达到2.4万亿,在编程、专业办公、长程任务与多模态智能体等多个领域都实现了全面提升,能够以极少的人工介入将复杂、开放的目标端到端完成,交付值得信赖的成果。模型权重将于下周开源,团队欢迎社区反馈,期待看到社区的创造性应用。

以上内容不代表本平台立场,仅供读者参考