文章摘要
文章通过两组实测对比了Qwen 3.8-Max与另一款主流模型的长程开发能力。Qwen 3.8-Max将重心放在长程Agent能力打磨上,基于Qwen 3.5架构,通过真实环境强化学习训练提升能力。测试显示,它能将复杂需求推进到前端MVP阶段,但完成度高也带来高成本。其定位是抬高Qwen体系上限,阿里已将其能力落地产品,分工明确。

我们通过两组实测对比了两款旗舰大模型的长程开发能力:从零搭建3D大模型演进宇宙网站,以及在现有项目基础上迭代优化。结果显示,其中一款模型展现了远超对手的交付细节,但高完成度背后也伴随着效率与成本的代价。这就是近期发布的Qwen 3.8-Max与另一款主流模型的实测对比。

8月正式推出的Qwen 3.8-Max,拥有2.4万亿总参数、约950亿激活参数与百万级Token上下文窗口,官方计划开放其权重以及27B小模型版本。单纯依靠参数规模、榜单表现已经难以支撑这款旗舰模型的差异化定位,相比其他竞品通过全新架构打造独特叙事,Qwen 3.8-Max将更多重心放在了长程Agent能力的打磨上。

这款模型并非基于全新架构打造,官方技术报告显示其基于Qwen 3.5的架构基础构建,Agent能力的核心提升来自真实环境的强化学习训练。区别于传统的题库训练模式,这种训练将模型放入接近真实工作的场景中:模型需要读取项目、调用工具、执行代码、观察页面、接收测试结果,再根据反馈持续修正。训练目标不再只是生成符合标准答案的文本,而是让模型学会完整的工作闭环:规划任务、采取行动、检查结果、发现问题并调整下一步。

为了扩展这种能力,官方公开了三项训练工程:一是环境解耦,将任务、工作空间和Agent Harness拆分为三个可独立扩展的维度;二是统一奖励系统,将代码执行结果、文本质量、视觉效果、Agent行为合理性纳入同一套评价机制;三是在线数据均衡,动态配平不同任务类型、难度、工作空间和测试框架中的训练数据,避免模型仅在少数场景中展现长程能力。

我们首先测试了Qwen 3.8-Max从零搭建可交互3D网站的能力,要求使用React、Vite和Three.js,将不同模型公司设计为宇宙中的星系,历代大模型作为沿轨道分布的星球,支持场景旋转缩放、模型检索、节点聚焦、档案展示和时间轴筛选等功能,且必须使用真正的WebGL三维场景,不能用静态元素冒充3D效果。

最终项目成功搭建了完整的WebGL三维场景,将6家主流AI机构设计为六个星系,28个模型分布在不同轨道上,实现了联动的时间轴筛选功能——切换2022到2026的时间轴后,场景中的模型数量会实时变化,选中的模型若不在当前年份范围内,对应的档案面板也会自动关闭。不过项目仍存在不少细节问题:球体在部分角度下有明显的低模感,场景中偶尔出现悬浮的白色方块,点击主体星球没有预期反馈;UI层面存在名称标签遮挡、镜头拉近时星球占据过大屏幕、边缘标签被裁切等问题,星球材质变化有限,整体空间层次还有优化空间。工程层面也存在包体积接近1MB、自动验收脚本硬编码等问题。

整体来看,Qwen 3.8-Max已经能够独立完成技术选型、项目搭建、多文件协作、三维交互、错误修复和交付验证,将复杂需求推进到可运行的前端MVP阶段,短板主要集中在视觉精修、复杂空间构图、性能优化和长期可维护性上。

第一轮测试完成后,我们在现有项目基础上发起了第二轮迭代,分别通过Qwen Code和ChatGPT桌面版Codex调用Qwen 3.8-Max与GPT-5.6,要求两者完成三类工作:优化3D视觉与整体氛围,补全最新模型数据并改进搜索和时间轴交互,增加“返回全景”、搜索飞行高亮和深度档案等产品级功能,以此对比两者对已有项目的理解、修改、验证和收敛能力。

需要说明的是,Agent框架和工具链也会影响表现,所以结果代表两款模型在各自官方开发环境中的综合能力,而非完全隔离工具后的裸模型成绩。

先看GPT-5.6的表现:它仅用37分钟就完成了任务,Codex额度消耗约6%。这款模型的优势是效率极高,快速识别项目结构和需要修改的文件,完成了球体材质、点击交互、时间轴和比较功能的调整,还编写了本地截图与验证脚本,列出了移动端、低性能GPU和构建分包等未验证项。但打开页面后可以发现,虽然核心功能可用,但视觉质感和空间纵深有限,更像结构完整的3D数据面板而非科幻宇宙导航界面,2026年的最新模型数据没有完整补上,原有示例内容也没有彻底清理,整体完成度低于提示词要求。它更像高效的工程助手,擅长快速落地功能修改,但对视觉质量、数据完整性和产品交付状态的判断相对宽松。

再看Qwen 3.8-Max的表现:整个迭代过程累计运行3小时29分钟,发起195次模型请求,处理约1664万输入Token和21.6万输出Token,其中约1475万输入Token命中缓存,缓存率为88.6%。任务最终因Token滚动额度耗尽而中断,当时100万Token的上下文窗口仅使用了约21.86万,中断并非因为上下文不足,而是持续的工具调用、多轮验证和反复修改带来的时间与额度消耗。

从最终效果来看,Qwen 3.8-Max的页面完成度明显更高:球体的体积、纹理和空间层次得到加强,公司主体与普通模型节点的区分更加清晰,搜索与镜头聚焦更接近“宇宙导航”的产品定位,整体氛围更符合深空科幻的要求。在数据更新上,模型也尝试联网补充2026年的模型信息,并清理了原有的示例内容。但相比GPT-5.6快速达到可运行状态,Qwen 3.8-Max花费了更多时间打磨细节,最终也没有完成最终的项目验收。

两轮测试显示,两款模型对“完成”的定义截然不同:GPT-5.6追求快速交付可用的最小可行性产品,更像手头项目众多的高效外包商;而Qwen 3.8-Max则更像追求极致的顶级架构师,不满足于“代码能跑”,而是投入大量时间打磨球体质感、光影折射和镜头平滑度。这种“过度思考”带来了更高的完成度,但也伴随着更高的时间和算力消耗,且后续每一轮修改带来的收益正在递减。

社区将这种现象称为“过度思考”,本质上包含两类消耗:一类是模型推理阶段投入过多Token分析、检查和修正,另一类是Agent执行阶段系统反复读取文件、调用工具、运行测试和返回结果。本次测试可以明显看到第二类消耗的存在,但无法完全区分其中多少来自基座模型,多少来自Qwen Code的任务策略。

对于长程Agent来说,仅拥有足够长的上下文窗口只是解决了持续理解项目的基础问题,工具调用是否有效、验证是否重复、任务能否及时结束,才是决定这份能力最终需要付出多少成本的关键。进入真实工作流后,多一轮读取、验证和重试,都会转化为Token费用、等待时间和人工验收压力。Qwen 3.8-Max已经证明自己能够将复杂项目推向更高完成度,但接下来需要解决的是如何减少收益有限的循环,在可控预算内完成验收并结束任务。

从商业层面来看,Qwen 3.8-Max的定位并非面向普通开发者直接本地部署,而是负责抬高整个Qwen体系的能力上限。官方已经开始将这种能力落地到具体产品中:8月3日,千问办公与Qwen 3.8-Max正式版同步开放,这意味着阿里希望这款模型能够进入代码、文档、表格、网页和企业知识库的真实工作场景,而非仅停留在聊天框和排行榜中。

阿里的整体策略是让不同模型和产品分担不同角色:Max负责前沿能力探索,小模型扩大开发者覆盖,Qwen Code和千问办公承接具体任务,阿里云负责API、部署和企业交付。这种分工已经开始在产品侧显现,而Qwen 3.8-Max能否产生规模化价值,最终取决于这份能力能否通过模型之外的执行系统,以稳定且适配场景的方式进入真实工作流。

这种“不计代价”的闭环迭代,为高预算、高复杂度的场景提供了另一种解法:在人工成本极高、或人类专家难以处理的复杂系统工程中,比如大规模代码重构、芯片级底层优化,这种持续自我修正的能力或许正是跨越AGI落地鸿沟的有效路径。

以上内容不代表本平台立场,仅供读者参考