文章摘要
阿里推出全新一代基座大模型Qwen3.8 - Max,打破“高性能必高价”惯例。该模型参数量达2.4万亿,在多核心场景表现全面升级,跻身全球第一梯队。其定价极具竞争力,实测反馈超预期,能独立完成复杂任务全流程。此外,Qwen系列开源成果显著、迭代速度快。目前Qwen3.8的API已上线多平台,可直接体验。

还在发愁找不到兼顾性能与性价比的大模型?不少用户都在吐槽,市面上要么模型能力拉胯,要么价格高到用不起,难道真的没有两全其美的选择吗?

就在近期,阿里正式推出了全新一代基座大模型Qwen3.8-Max,这款产品直接打破了「高性能必高价」的行业惯例,用「能打」和「便宜」两个关键词就能概括核心优势。

这款模型总参数量达到2.4万亿,在编程、专业办公、长程任务、多模态智能体等多个核心场景的表现都实现了全面升级。根据最新发布的权威第三方榜单,Qwen3.8-Max已经跻身全球大模型第一梯队,综合表现直追海外主流的Claude系列模型。

尤其在编程赛道,Qwen3.8-Max的表现甚至超过了同级别高端竞品的High版本,实力远超不少同级别模型。

性能拉满的同时,这款模型的定价也做到了极具竞争力:国内环境下,每百万Tokens输入仅需12元,输出费用为36元,隐式缓存命中更是低至1.5元;国际市场的输入和输出价格,仅为同级别高端产品的40%和24%,真正做到了便宜大碗。

不少抢先体验预览版的用户已经晒出了实测反馈:有开发者用Qwen3.8-Max复刻了《愤怒的小鸟》游戏,坦言一周使用下来额度消耗还不到九成,性价比拉满;还有用户只用一条提示词,就搭建出了完整可交互的开发者作品集,评价直接用一个「夯」字概括,认可程度拉满。更有用户调侃,这款模型的表现直接倒逼海外竞品,足见用户对其实力的认可。

作为长期体验Qwen系列模型的用户,我这次也对Qwen3.8-Max进行了全方位测试,结果远超预期。这款模型已经能够独立拆解复杂真实问题,从需求理解到最终交付全流程自主完成,完全可以作为靠谱的开发和办公助手。

贴心总结一下Qwen3.8-Max的核心亮点能力:

  • 编程能力:支持复杂任务端到端自主交付,从需求理解、工程搭建、实验运行到结果检查与优化全流程独立完成,官方案例显示其可从空文件夹起步,在无人干预下自主推进十余天,交付可用的完整项目。
  • 长线程任务:具备系统级自主规划与执行能力,即便数千轮超长交互也不会迷失目标。
  • 专业办公:可一次性交付经过多轮迭代优化的APP原型,还能在一小时内处理数百份法律文档,完成上千个条款标注。
  • 多模态智能体:可轻松处理数百页复杂材料、上百小时视频内容,并整理为直接可用的成果。

首先测试了它的AI Coding能力。我当时正愁每周的AI热点分享会内容整理,索性直接化身产品经理,给Qwen3.8-Max提交了满满一页的详细产品需求,要求从零开发一个可运行的AI资讯网页,不仅明确了核心功能,还对数据展示、页面体验、技术约束、验收标准等提出了严格要求。

仅仅过了5分钟,模型就交付了接近正式产品水准的全链路成果:从需求拆解、技术选型、项目结构搭建到功能实现,完整覆盖了真实开发的全流程,甚至还主动整理了开发过程中的问题与解决记录,连我都没发现中间出现过的报错和调整细节。

更让人惊喜的是,在交付前模型还主动完成了功能验收:从安装依赖、本地启动到生产构建、页面预览,甚至连数据量、分类覆盖、搜索恢复等细节都逐一验证,最终确认项目完全符合需求。我打开代码运行后,页面布局、资讯分类、搜索、收藏等功能全部正常,完全匹配最初的需求,整个工程流程全部由模型独立完成,真正实现了端到端的交付。

除了编程场景,长文本交叉分析也是不少用户的刚需痛点。此前我就喂给过其他主流模型一份包含几十页的技术文档,往往只能做简单总结,一旦涉及跨章节的细节对比就会直接宕机。这次我选择了AI大神卡帕西参与撰写的ImageNet大赛复盘论文,包含正文、图表和附录在内的数十页内容,并提出了一个需要跨章节交叉分析的问题:结合正文、表3和附录B的图16,对比ILSVRC和PASCAL VOC两套评测体系,哪套更难?为何看平均值和困难类别会得到不同结论?

这个问题的答案散落在文档多个位置,需要整合多组数据才能得出结论。仅仅33秒,Qwen3.8-Max就给出了明确答案:仅看整体平均值,PASCAL VOC难度更高;但对比困难子集时,ILSVRC的难度反而不低于甚至超过了PASCAL VOC。我对照原文逐一验证后发现,这个回答完全准确,模型甚至还生成了详细的分析报告,从物体大小、位置变化、定位难度、画面复杂度等多个维度对比了两套评测体系,还直接引用了原文表格作为佐证,定位精准清晰。对于需要啃论文、处理大量文档的用户来说,这款模型无疑能大幅提升工作效率。

日常工作中,多模态内容分析也是一块硬骨头,尤其是长视频内容的梳理。这次我拿到了一期近70分钟的播客,嘉宾从AI创业聊到相关行业战略和未来社会,话题跨度大、内容多,手动梳理时间轴和定位片段需要花费大量时间。我给Qwen3.8-Max的任务是生成完整的主题时间轴,并按「话题观点」定位原始片段。

这个任务不仅需要识别人物、事件和观点的关联,还要重建整个播客的叙事结构,精准映射每个观点到对应的时间点。仅仅两三分钟,模型就交付了按核心观点划分的播客内容,每个话题都采用「先总结、再展开」的结构,既提炼了核心观点,又梳理了具体内容,还一一标注了对应的时间戳。想要回看某个话题,直接点击对应时间点就能精准空降,极大节省了梳理时间。

当前的大模型市场,往往陷入「能力、覆盖、价格不可兼得」的怪圈:有些模型编程能力强,但在专业办公、长文本分析等场景表现拉胯;有些模型效果不错,但价格高昂,长期使用成本让人望而却步。但Qwen3.8-Max打破了这个僵局,不仅实现了全场景的高性能交付,还做到了极具竞争力的定价,真正做到了好用又不贵。这种兼顾能力、场景和价格的产品,在整个大模型行业都属于稀缺存在。

Qwen系列能做到这样的突破,并非偶然。从2023年开源至今,阿里已经累计开源超过400个模型,衍生模型数量超过20万,累计下载量突破10亿次,成为全球规模最大、覆盖最全面的开源大模型家族。

过去一年,Qwen系列的迭代速度从未放缓:从Qwen3到Qwen3.5,再到如今的Qwen3.8,每一次更新都对应着新场景的落地,从基础推理延伸到编程、专业办公、多模态理解、长程Agent,再到这次的端到端交付,这种持续迭代的节奏,在全球范围内都少有对手。

可以说,真正好用的大模型未必昂贵,真正便宜的模型也不必在能力上妥协,Qwen3.8-Max正是做到了这两点的平衡。

目前,Qwen3.8的API已经上线相关平台,同时还接入了阿里同步推出的Agent产品,感兴趣的用户可以直接上手体验。相关平台包括千问AI平台、QwenStudio平台以及千问办公平台。

以上内容不代表本平台立场,仅供读者参考