文章摘要
9月22日,2026云栖大会开幕,阿里巴巴披露旗下千问系列大模型矩阵的全链路最新进展,大语言模型、多模态模型多个赛道斩获多项全球第一,开源千问已成为全球AI开源社区核心基座,获全球多家知名企业采用,多项技术创新推动其性能与性价比跻身全球前沿。

9月22日,2026年云栖大会正式开幕,阿里巴巴对外披露了旗下大模型矩阵的全链路最新进展,涵盖大语言模型、多模态模型两大核心赛道的多项突破与落地成果。

在大语言模型领域,Qwen3.8-Max表现亮眼,在编程与办公场景中斩获第三方AI评测平台Agentic智能体榜单第一、CodeArena前端编程竞赛冠军,其在第三方AI性能评测平台的得分从40分提升至45分。基于下一代架构的Qwen4模型已经启动训练,后续的Qwen4.5、Qwen5等版本的模型参数规模将扩展至5万亿到10万亿区间。

多模态赛道同样收获丰硕成果:Qwen-Image-3.1的性能有望逼近全球顶级的GPT-Image系列,跻身全球第一梯队;Qwen-Audio-3.1在语音转写、语音合成、实时语音交互三大核心赛道均位列国际第一梯队、国内第一,表现超越Gemini 3.1 TTS等国际顶尖模型;全新亮相的世界模型HappyOyster-2.0-Preview,推动世界模型从实验室阶段走向真实可用场景;视频生成模型Wan3.0拿下第三方AI评测平台文生视频与视频编辑双榜全球第一,下一代视频模型也正在训练中,将具备更强的生成能力、控制精度与理解水平,助力AI从工具属性迈向创作智能。

作为最早布局AI大模型的中国科技企业,阿里从2019年就启动了大模型相关研究,先后推出千问Qwen大语言模型系列,以及万相Wan、HappyHorse等多模态模型矩阵。进入2026年,阿里大模型的发布节奏全面提速,仅最近一个多月时间,Qwen3.8系列就完成了4个不同模型与重大版本的迭代更新,整体性能与性价比均进入全球前沿水平,成为全球AI开发者与企业用户关注度最高的中国大模型之一。本次云栖大会上,阿里还披露大模型自我进化(RSI)技术已经初步应用于模型训练、推理以及芯片与模型协同等环节,这一前沿技术探索大幅加速了Qwen系列模型的迭代升级速度。

传统的大模型迭代流程属于单向流水线模式:研究人员从评测结果或用户反馈中发现问题,准备训练数据、完成模型训练后再发布新版本,整个过程需要反复循环,每一轮新版本的研发都需要从人工分析环节重新开始。而Qwen3.8-Max已经可以实现全自主迭代:无需人类参与,就能自主搭建训练流程、构造训练数据集,自主设计实验方案并定位模型缺陷,已经完成了超过1个月的持续迭代,累计实现33轮有效升级。依托RSI、后训练等一系列技术创新,Qwen3.8-Max的第三方评测得分提升了12.5%至45分,与Claude、GPT等顶尖模型处于同一前沿梯队。此外,千问RSI技术的探索范围还在不断拓展:向上支撑推理环节的自主优化,向下协同芯片与模型的联合创新。在推理优化方面,Qwen3.8在从未适配过的平头哥新款GPU上,自主完成了下一代架构的Qwen3.8-Flash模型的SGlang推理框架优化,实现单实例推理吞吐量提升96%;在芯片模型协同设计环节,Qwen3.8仅基于一份真实的总线模块规范,自主完成前端、验证、后端的全链路自迭代,在自主运行超60小时、调用EDA工具超万次后,实现了物理实现面积减少42%、标准单元数量降低29%、功耗降低59.5%的优化成果。

追求更高智能水平与加速自我进化,是千问大模型最重要的核心目标。本届云栖大会披露的大语言模型系列技术进展主要涵盖三大方向:在架构优化层面,Qwen3.8-Flash提前开源下一代千问大模型架构,通过注意力机制与模型内信息传递机制等核心技术创新,在实现前沿模型性能的同时,将训练成本降低近90%,同时依托极低的参数激活量,将推理计算效率推至全新的帕累托前沿,成为行业性价比标杆模型;在模态扩充层面,全模态模型Qwen3.8-Omni-Flash正式亮相,将视频、音频、图片与文字等不同模态高效纳入统一理解框架,为大模型开辟了全新的思考分区;在参数扩展层面,模型参数量与性能正相关的规律依然成立,未来千问大模型的总参数量将扩展至5万亿甚至10万亿的规模。这些技术创新将成为新一代千问大模型的核心基石,目前Qwen4模型已经采用全新架构启动训练,Qwen4.5、Qwen5的研发工作也在稳步推进中。

追求极致性价比、推动AI普惠落地,是千问大模型的另一核心目标。Qwen3.8系列模型中,Qwen3.8-Max被Arena评为前沿编程模型中性价比最高的模型之一,相比Qwen3.7的Token调用量提升12倍,可应用于全栈开发、自动化运营、法律文书、投研分析、工程设计、科学研究等多个真实场景;Qwen3.8-Flash通过结构创新,将缓存命中输入的成本降至每百万Tokens仅0.1元,开启了大模型低成本使用的全新时代;Qwen3.8-27B被全球开发者称为“本地Opus4.6”,将智能密度压缩至可在消费级显卡上流畅运行的水平,将智能体验与性价比推至新高度。

全球范围内的企业与开发者都在基于阿里大模型探索AI应用落地:硅谷AI独角兽Perplexity基于Qwen3.8打造本地Agent;爱彼迎CEO布莱恩·切斯基直言公司正“大量依赖阿里巴巴的千问模型”,并表示其体验比OpenAI的产品更好且成本更低;“美国版小红书”Pinterest利用Qwen搭建了AI购物助手与聊天机器人,其CEO比尔·雷迪透露使用Qwen的成本仅为Anthropic、OpenAI等闭源同类模型的8%;路透社也为降低对Claude等闭源模型的依赖、减少长期使用成本,基于Qwen开发了自有模型。

Qwen3.8系列模型均面向全球开源,短短一个月时间,Qwen3.8相关模型的下载量就超过5600万次,衍生模型数量超过1900个,其中Qwen3.8-27B超越DeepSeek-R1、Meta-Llama3.1等热门模型,成为Hugging Face历史上最受欢迎的大模型,登顶全球榜首。截至目前,阿里已经开源超过460个千问大模型相关项目,Qwen模型的整体下载量超过30亿次,衍生模型数量超30万个。Hugging Face官方报告指出,Qwen已经成为全球AI开源社区的核心基座模型,包括DeepSeek、英伟达、AWS、微软等全球知名企业都基于Qwen进行二次开发,开展AI业务的落地探索实践。

如果说大语言模型是机器的“大脑”,目标是变得更聪明、更强大,推动通用人工智能(AGI)乃至超级人工智能(ASI)的实现;那么多模态模型则是机器与人类、真实世界交互的“中枢”,核心目标是实现感知、理解甚至创造新事物,帮助机器可靠平稳地进入真实物理世界。本次云栖大会上,阿里多款多模态模型实现重磅升级,整体从单模态生成逐步迈向全模态理解与生成一体化的发展阶段。

在视频生成领域,阿里的技术迭代始终处于行业前沿:2025年,Wan2.6就在国内首次支持视频参考生成,可生成15秒时长的视频并实现智能多分镜;进入2026年,阿里视频模型的研发持续提速,4月发布的Wan2.7与HappyHorse1.0实现了电影级质感与视觉表现力的跃升;8月正式上线的Wan3.0支持单次生成30秒视频,可接收文档、表格、网页等结构化输入,实现原生音画同步,拿下第三方AI评测平台文生视频与视频编辑双榜全球第一。全新的下一代视频模型将于11月发布,将朝着更长时长、更强可控性、更完整叙事、更高智能的方向演进:不仅能在更长的视频周期内保持视觉一致性,让创作者精准掌控人物、场景与镜头,还将具备导演级的创作思维,从单个镜头生成迈向完整叙事的理解与创作。

语音模型赛道,阿里发布了Qwen-Audio-3.1系列语音大模型,实现了语音转写(ASR)、语音合成(TTS)与实时语音交互(Realtime)三类核心模型的全面升级。其中Qwen-Audio-3.1-Realtime的实时交互能力进一步提升,能够实现边听、边想、边说的流畅交互,还增强了多语言交互、角色扮演与共情能力,目前该系列模型已经应用于千问办公、Qoder等产品,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人与千问AI眼镜等硬件设备。同时,阿里还推出了基于下一代架构的两款全新音频模型:音频创作模型Qwen-Audio-3.1-TTS-Next,用户仅需提供一段文本即可一次性生成融合人物对白与环境声的完整音频内容,可满足有声书、影视剧、播客、游戏、广告等专业创作需求;音频理解模型Qwen-Audio-3.1-ASR-Next,能够理解人物情绪、音乐、环境声与机械声,完成声音描述、事件定位、音频问答与推理,可准确回答“这段录音中人的情绪如何”这类需要语义理解的问题。

图像生成模型方面,Qwen-Image-3.1正式亮相,针对电商、设计等真实商用场景进行了全面优化升级,将原本需要数小时的视觉设计流程压缩至秒级交付,设计水准可媲美专业设计师,同时支持精准的图像编辑操作。同时,参数量仅7B的Qwen-Image-2.1全面开源,它是千问图像系列当前能力均衡性与性价比最高的开源生图模型,在Qwen-Image-Bench公开评测中超越大部分闭源模型,位居开源榜单第一,推理速度也实现了大幅提升;该模型原生支持透明图生成,可根据用户提示自动决定输出普通图还是透明图,还能直接将RGB实拍图抠取为RGBA图层。此外,模型支持最高10张参考图的多图编辑,以及圈选、涂抹、掩码三种局部编辑方式,重点强化了人像与商品的编辑保真度,文字渲染与人物光影表现相比前一代产品有明显提升。

音乐模型Happy Shrimp 1.1版本正式发布,在音乐审美建模与强化学习、世界知识与音乐领域知识融合两大技术方向上实现了进一步升级,在音乐表现、人声质量、多语种演唱与指令理解四个专业维度取得突破,支持百余种曲风与十余种主流语言,覆盖人声歌曲与纯音乐两大生成场景。

同声传译模型Qwen3.8-LiveTranslate正式亮相,该模型采用Interleave架构,创新重构了实时同传流程,在准确度、流畅度与简洁度上均实现全面提升,字均延迟(LAAL)从2.8秒降至2.3秒,而人类同传的平均时延约为4秒。Qwen3.8-LiveTranslate新增三项核心能力:可实现实时说话人分离,让每句话的归属清晰明确,音色复刻更稳定;支持原文译文同帧同出,实现双语同屏显示;面对长上下文可自主高质量消除歧义,结合前文理解当前语境,让人名、术语的翻译更加精准。依托一系列技术创新,Qwen3.8-LiveTranslate不仅翻译速度更快,听清与译准的能力也更强,在真实场景中的表现更加出色。

世界模型最新版本HappyOyster 2.0 Preview正式亮相,通过对模型架构、训练方法与数据体系的全面升级,显著提升了智能实时交互、记忆能力、实时响应速度与物理规律遵循能力,让世界模型真正从实验室走向真实可用的落地场景。

本届云栖大会上阿里展现的从大语言模型到多模态模型的全链路突破,背后是阿里长期在AI与云计算领域的持续投入与厚积薄发。过去十七年,阿里巴巴是中国唯一具备软硬一体垂直整合能力的全栈AI公司,阿里云在云技术沉淀与大模型研发上的投入位居行业前列,是目前中国唯一同时在基础设施与模型研发上具备全球一流能力的云平台。阿里组建的Token Foundry是当前中国AI人才最密集、AI产出最丰厚的AI实验室,覆盖了语言模型与最丰富的多模态模型领域。同时,阿里巴巴还拥有AI时代最重要的应用场景,包括千问办公、Qoder等Agent工具,为各行各业提供AI生产力工具。目前,阿里巴巴已经成为中国最重要的AI基础设施企业与AI应用公司之一。

以上内容不代表本平台立场,仅供读者参考