阿里云栖大会发布千问大模型系列进展,5-10T参数规划

9月22日的行业技术盛会中,相关企业公布了大模型赛道的多项核心进展:递归自我改进(RSI)技术已初步落地模型训练、推理以及芯片与模型协同设计等关键环节;基于全新架构的Qwen4模型已进入训练阶段,后续的Qwen4.5、Qwen5等版本的参数量将拓展至5万亿到10万亿级别;同时,视频生成、语音、图像、世界模型、音乐模型以及全模态模型等多条产品线,均在本次大会或近期推出了更新版本。
自主迭代技术突破,Qwen实现全链路自进化
当前大模型正加速走向自主迭代阶段,本次大会上,企业系统展示了千问大模型在自主进化领域的最新探索成果。
模型自主训练层面,Qwen3.8-Max实现了全流程的人类零参与迭代:通过自主搭建训练流程、构建训练数据集,自主设计实验方案并定位模型缺陷,在无人工干预的情况下持续迭代超过1个月,完成了33轮有效优化。结合RSI技术与后训练等多项技术的联合优化,该模型在Artificial Analysis评测中的得分从40提升至45,与Claude、GPT系列的顶级模型处于第一阵营,领先于GLM5.3、Kimi-K3等所有国产同类模型。
推理性能优化层面,Qwen3.8-Max在未适配过的平头哥新款GPU上,自主完成了下一代架构的Qwen3.8-Flash模型推理框架的适配与优化,实现单实例推理吞吐量提升96%的显著效果。
芯片与模型协同设计层面,Qwen3.8-Max仅依托一份真实的总线模块规范,自主完成前端、验证、后端的全链路自迭代,经过超过60小时的自主运行、调用超万次EDA工具后,最终实现了物理实现面积减少42%的优化目标。
据项目相关负责人介绍,扩大模型规模是迈向通用人工智能的关键路径,Qwen4.5、Qwen5的参数量规划目标为5万亿至10万亿级别。
大会现场还展示了大模型核心领域的多项技术创新。架构优化方面,Qwen3.8-Flash提前开源下一代千问大模型架构,通过注意力机制与模型内信息传递机制等核心技术创新,在实现前沿性能的同时将训练成本降低近90%;同时依托极低的参数激活量,将推理计算效率推至全新的帕累托前沿,成为行业内极具性价比的标杆模型。模态扩充方面,全模态模型Qwen3.8-Omni正式亮相,将音视频等多模态信息高效纳入统一理解框架,为大模型开辟了全新的思考分区。参数规模扩展方面,模型参数量越大往往能带来更强的性能表现,未来千问大模型的总参数量将拓展至5万亿甚至10万亿级别。这些技术创新将作为新一代千问大模型的核心基石,目前Qwen4模型已采用全新架构启动训练,Qwen4.5、Qwen5的研发工作也在稳步推进中。
在持续探索大模型性能边界的同时,企业通过全模态、全尺寸的大模型开源策略,与全球开发者和产业伙伴共享前沿AI技术红利。在全球知名的AI开源社区中,Qwen3.8-27B模型超越多款热门开源模型,成为该平台历史上最受欢迎的开源大模型。公开数据显示,目前已累计开源超过460个Qwen系列大模型,总下载量突破30亿次,衍生模型数量超过30万个,稳居全球第一开源大模型家族阵营。
视听生成模型全面升级,新一代视频生成模型将于11月发布
在创意性极强的视觉生成领域,企业通过持续迭代升级各类生成模型,推动AI创作作品质量与用户体验的双重提升。
面向电商、创意设计等真实商用场景优化的图像生成模型Qwen-Image-3.1正式亮相,将原本需要数小时的视觉设计流程压缩至秒级交付,创作水准可媲美专业设计师,同时支持高精度的图像编辑功能。
音乐生成模型Happy Shrimp 1.1版本同步发布,在音乐表现力、人声质量、多语种演唱以及指令理解四个专业维度完成了全面升级,支持百余种曲风与十余种主流语言,覆盖人声歌曲与纯音乐两大创作场景。
世界模型最新版本HappyOyster 2.0 Preview也在本次大会亮相,通过对模型架构、训练方法与数据体系的全面升级,显著提升了智能实时交互、记忆能力、实时响应速度以及物理规律遵循性等核心能力,让世界模型真正从实验室走向可落地的实用场景。
相关技术高管在现场表示,三年内将会出现原生的全模态统一模型,AI体验将不再受限于单一模态的边界。
全新的下一代视频生成模型也将于11月正式发布,该模型将朝着更长时长、更高可控性、更完整叙事、更强智能性的方向演进:在更长的生成时长内仍能保持内容一致性,创作者可以精准掌控人物、场景与镜头细节;同时模型将具备导演级的创作思维,从单一镜头生成迈向完整叙事的理解与创作。
新一代语音模型发布,Qwen大模型加速落地智能终端
当前语音交互正成为AI与用户之间最自然的交互入口之一,Qwen系列模型已经在手机、AI眼镜、桌面机器人等多个硬件终端实现落地应用。
语音模型家族Qwen-Audio-3.1完成全面升级,涵盖语音转写(ASR)、语音合成(TTS)以及实时语音交互(Realtime)三大产品线。
基于下一代架构的音频理解模型Qwen-Audio-3.1-ASR-Next正式发布,该模型能够理解人物情绪、音乐、环境声与机械声,支持完成声音描述、事件定位、音频问答与推理等任务,例如可以准确回答“这段录音中人的情绪如何”这类问题。
音频创作模型Qwen-Audio-3.1-TTS-Next也同步亮相,采用全新架构设计,可以根据一段脚本直接生成融合对白与环境声的完整音频内容,大幅提升有声书、影视剧、播客等专业音频创作的效率。
Qwen-Audio-3.1-Realtime的实时交互能力进一步提升,能够实现边听、边思考、边回应的流畅交互体验,同时增强了多语言交互、角色扮演与共情能力。目前该系列模型已应用于千问办公和Qoder工具,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人以及千问AI眼镜等多款硬件产品。
此外,同声传译模型Qwen3.8-LiveTranslate首次登场,人类同传的平均时延通常在4秒以上,而该模型将时延压缩至不到2.5秒。据介绍,这款模型已接入千问AI眼镜、QwenNote A2、钉钉耳机等AI硬件产品。
企业的大模型正加速走向终端落地:AI手机全栈解决方案Qwen Intelligence正式发布,该方案专为手机场景深度优化,为合作伙伴提供基于千问大模型的Agent技术平台,让手机能够更可靠地完成跨应用的复杂任务。
阿里巴巴AI大模型全景图

