国内开源模型更新:2026年这波浪潮,到底变了什么?

国内开源模型更新在2026年进入前所未有的密集期。从年初到9月,DeepSeek、阿里Qwen、智谱GLM、Kimi、腾讯混元、华为盘古、MiniMax、面壁智能、科大讯飞等厂商接连发布或开源旗舰模型,节奏从过去的半年一次压缩到一两个月一轮。国内开源模型更新不再只是“发个新版本”那么简单,而是一场涉及架构选择、部署策略和算力生态的系统性变革。

一、这轮国内开源模型更新,为什么值得认真看?
如果你只关注参数排行榜,很容易错过这轮国内开源模型更新真正重要的东西。
2026年上半年,Hugging Face报告显示中国自研开源模型下载占比达到41%,首次超过美国,累计下载量突破100亿次。阿里Qwen系列上半年全球下载量达到20.45亿次,同期Google模型约4.18亿次、Meta约2.27亿次。OpenRouter平台数据则显示,开源模型处理的词元占比从1月的34%升至6月的65%。
但更值得注意的是,这轮国内开源模型更新释放了一个关键信号:厂商不再把最强模型藏起来,而是直接把第一梯队基座交给社区。 7月底Kimi K3以2.8万亿参数全量开源,8月阿里开放Qwen3.8-Max权重,腾讯混元Hy4、智谱GLM-5.3、华为盘古openPangu 2.0紧随其后。过去开源只是“吸引开发者的赠品”,现在它变成了主战场。
二、旗舰模型的参数与架构全景
这轮国内开源模型更新的核心,是旗舰基座的大规模开放。下表整理了2026年主要的旗舰级开源模型,方便横向对比。
| 模型 | 厂商 | 总参数/激活 | 上下文 | 协议 | 核心定位 |
|---|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 2.8T/104B | 1M | Modified MIT | 全球最大参数开源模型,原生视觉+长文档 |
| Qwen3.8-2.4T-A95B | 阿里 | 2.4T/95B | 256K可扩至1M | 开放权重 | 旗舰MoE,Agent与多模态 |
| openPangu-2.0-Pro | 华为 | 5050B/180B | 超长上下文 | 开源 | 昇腾生态最佳实践 |
| GLM-5.3 | 智谱 | 基座同5.2 | 1M | MIT(后训练增强) | 编程能力最强开源模型 |
| Hy4 preview | 腾讯 | 770B/49B | 1M | Apache 2.0 | 代码、办公、科学任务 |
| DeepSeek V4.1 Flash | DeepSeek | 552B/8B输入16B输出 | 1M | 开源权重 | KV缓存极致压缩,Agent成本优化 |
| Qwen3.8-Flash-Next | 阿里 | 125B/6B | 256K扩至1M | 开源权重 | 新架构雏形,训练成本仅前代1/9 |
| MiniMax H3 | MiniMax | 全模态生成 | — | 开源 | 2K视频+立体声生成 |
这些模型的共同特征很明显:MoE架构成为默认选择,百万上下文成为旗舰标配,激活参数远小于总参数。 万亿级总参数搭配百亿级激活,已经成为国产旗舰的标准配方。
但比参数更值得琢磨的是路线分化。万亿级MoE旗舰负责承接大型集团的复杂业务;10B级稠密模型主攻PC和终端本地部署;轻量化模型则把办公智能体和自动化流程作为主战场。 一个覆盖云端、终端和边缘的分层开源矩阵已经成型。
旗舰参数很大,但“智能密度”才是新战场
国内开源模型更新有一个容易被忽略的转折:厂商开始比拼的不是“谁更大”,而是“谁更省”。
阿里Qwen3.8-Flash-Next的训练成本仅为前代的九分之一,却能在MMLU-Pro、SWE-bench Pretrain等8项基准上取得最优结果。DeepSeek V4.1 Flash的KV缓存相比初代缩小了437倍,对HBM的需求降至上一代的四分之一。这些数字说明,效率正在取代规模,成为国内开源模型更新中最核心的竞争力指标。
三、端侧模型:国内开源模型更新的另一条主线
如果说旗舰模型代表“上限”,端侧模型代表的就是“覆盖面”。这轮国内开源模型更新在端侧同样密集。
9月8日,面壁智能联合OpenBMB开源新一代MiniCPM5-2B,在34项基准评测中平均得分超越4B档最优模型。9月1日,科大讯飞旗下词元星火开源星火X2.5-4B和1.7B,成为端侧模型中首个原生支持100万Token上下文的产品。
实际用起来是什么感受?在个人办公场景中,用户上传销售明细表并提出中英文报告交付需求,星火X2.5-4B能自主完成数据汇总、关键指标提取、趋势分析,生成约3000字的中文报告,再沿用同样结构生成英文版,最后完成内容和排版校验。整个过程不需要云端连接,全在本地完成。
智能家居场景中,星火X2.5-1.7B在Domux测试集上的控制指令端到端执行正确率达到90.3%,平均响应时间0.85秒。机器人场景中,两款模型可以部署在机器人本体或边缘设备上,支持操作控制、目标追踪和导航决策,减少对云端连接和固定预设程序的依赖。
端侧小模型的意义在于让智能从“问一句答一句”变成“自己动手把事情办了”。 这是国内开源模型更新在终端侧带来的实质性改变。
四、架构创新:国内开源模型更新的技术底座
国内开源模型更新之所以能在性能和效率上同时推进,底层架构的突破是关键。
稀疏注意力:百万上下文的技术支撑
百万上下文从“亮点”变成“标配”,靠的是各家自研的稀疏注意力机制。传统Transformer的长序列计算量呈平方级膨胀,处理100万Token时算力消耗不可承受。这轮国内开源模型更新中,厂商给出了不同的解法。
智谱GLM-5.2的IndexShare机制将四层稀疏注意力模块共享一套Top-K索引筛选器,处理百万文字时计算量减少三分之二。MiniMax M3的分块稀疏算法将百万上下文的整体计算量压缩至前代的二十分之一,预填充和解码速度分别提升9倍和15倍。阿里Qwen3.8-Flash-Next的QSA注意力在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。
Kimi K3则采用KDA增量Delta注意力搭配跨层残差补偿,解决长文本读到后半段容易遗忘前文信息的问题,KV缓存占用削减75%。
后训练Scaling:不换基座也能大幅升级
智谱GLM-5.3是这轮国内开源模型更新中最值得研究的案例之一。它的基座模型和GLM-5.2完全一样,但仅通过后训练Scaling——数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间——编程能力就提升了50%。
在Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;DeepSWE v1.1上从46.2提升至66.9。在Z.ai Code Bench的High档位下,GLM-5.3达到31.4%准确率,超过Claude Opus 4.8最高档位的29.5%,每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens。
这意味着模型能力的增长曲线正在从“堆算力堆参数”转向“拼工程拼方法”。 国内开源模型更新的节奏从半年压缩到一两个月,很大程度上就是因为后训练优化的迭代速度远快于基座重训。
多模态融合:从文本到全模态
自2025年2月起,国内开源模型的类型已不再限于文本。这轮更新中,MiniMax H3瞄准AI视频赛道,打通文本、图像、视频、音频统一理解链路,支持2K分辨率、原生立体声视频成片。DeepSeek V4.1 Flash原生具备多模态视觉理解能力。智谱则推出了GLM-4.6V系列的原生视觉智能体基座。
全模态不再是实验室概念,而是国内开源模型更新中实际交付的能力。
五、开源协议的变化:从“放开权重”到“有边界的开放”
这轮国内开源模型更新在协议层面有一个需要厘清的变化。
大部分厂商采用开放权重模式,而非完全开源训练代码和原始数据。协议选择上呈现分化:智谱GLM-5.2采用MIT协议,这是现行常见协议中最宽松的一种,没有使用条款和地区排除。腾讯混元Hy3走Apache 2.0协议,Kimi K3采用Modified MIT,允许商用但在特定条件下有附加条款。
各家还配套差异化商业许可,区分个人研究、中小团队免费使用和大型企业商用分成。这种适度保留边界的开放方式,是国内厂商在技术共享和商业可持续之间找到的平衡点。
从开发者的实际使用角度看,GLM-5.2和DeepSeek V4系列的MIT协议商用故事最清晰。 如果你计划基于开源模型构建商业产品,协议兼容性应该是选型时优先考虑的变量。
六、国产算力适配:国内开源模型更新的隐藏主线
国内开源模型更新中,有一条容易被忽略但影响深远的主线:开源与国产算力的深度绑定。
DeepSeek V4发布当天,华为昇腾超节点全系列产品宣布全面支持,寒武纪、海光信息、摩尔线程、沐曦、百度昆仑芯、阿里平头哥等国产AI芯片同日完成适配。智谱GLM-5.2上线首日即完成华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞8大国产算力平台的全适配。
阿里Qwen3.8-2.4T-A95B发布当天,基于智源FlagOS实现了在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、燧原等9款AI芯片上的适配,其中8款为国产芯片。Kimi K3开源时,华为昇腾即实现0day极速适配,昇腾950超节点原生支持其mxFP4量化权重。
“国芯+国模”的协同研发正在从单点突破走向规模化推进。 这意味着国内开源模型更新不只是软件层面的迭代,而是在构建一套从训练到推理的完整国产技术栈。
七、企业选型:国内开源模型更新后的实用决策框架
面对如此密集的更新,选型的关键在于场景匹配。
如果你要处理长文档和复杂推理,Kimi K3的2.8万亿参数和百万上下文是最直接的选择,在金融、法律等长篇专业文档场景中表现突出。如果你聚焦编程和软件开发,GLM-5.3在Terminal-Bench 3.0和DeepSWE上的提升幅度最大,ZCode工具链也已同步上线。如果你的应用涉及视频生成,MiniMax H3是目前唯一同时支持2K分辨率和原生立体声的开源选择。
如果成本是首要约束,Qwen3.8-Flash-Next的6B激活参数和每百万Token输入1元、输出3元的定价,加上训练成本仅为前代九分之一的效率优势,值得优先考虑。如果需要在终端设备上部署,星火X2.5-4B和MiniCPM5-2B是当前智能密度最高的端侧方案。
一个值得关注的新变量是:大多数场景下,6B激活参数的Qwen3.8-Flash-Next在编码和办公任务上的表现已经接近甚至超过一些激活参数更大的模型。 这意味着企业在做技术选型时,不能只看总参数,激活参数和实际任务表现才是更可靠的参考。
八、这轮国内开源模型更新意味着什么
第一,开源已经从“策略选项”变成“基础设施”。 当旗舰基座可以被自由下载、私有化部署和二次微调时,厂商之间的竞争焦点从模型本身转移到“模型+工具+生态”的体系化能力。智谱同步上线ZCode,腾讯将Hy4接入CodeBuddy和元宝,阿里以“云+模型+工具链”构筑闭环。
第二,迭代节奏的加速正在改变行业的时间感知。 过去模型更新以半年为单位,现在压缩到一两个月。后训练Scaling的成熟意味着厂商可以在不更换基座的情况下持续提升模型能力,这对开发者的技术选型策略有直接影响——你不需要每次基座更新都重新适配。
第三,端云分层的格局基本确立。 万亿级MoE负责云端复杂任务,10B级以下模型负责终端和边缘场景,中间由蒸馏和量化技术连接。科大讯飞9月7日还将发布星火X2.5-293B通用大模型,进一步升级代码和智能体能力。
对于开发者和企业技术决策者来说,最务实的做法不是追着最新版本跑,而是先明确自己的任务类型和部署环境,然后选择在这个交叉点上最成熟的模型。 国内开源模型更新的节奏还会继续加快,但底层逻辑已经清晰:效率、生态和场景落地,才是这场竞赛真正的分水岭。
常见问题
Q1:国内开源模型更新这么频繁,应该跟哪一个?
不要盲目追最新版本。先明确你的核心场景:编程选GLM-5.3,长文档选Kimi K3,视频生成选MiniMax H3,成本敏感选Qwen3.8-Flash-Next,端侧部署选星火X2.5-4B。大多数场景下,等一个版本稳定运行2-3周后再迁移,比第一时间跟进更稳妥。
Q2:Kimi K3的2.8万亿参数,普通开发者能跑得起来吗?
全量权重部署需要大量显存,普通单卡环境很难承载。实际使用中,建议通过API调用或使用量化版本。如果必须本地部署,可以考虑蒸馏后的小模型,它们在特定任务上的表现往往能达到大模型七八成的水平。
Q3:开源模型的“开放权重”和“完全开源”有什么区别?
开放权重意味着你可以下载模型参数文件,进行推理、微调和二次开发。但不等于训练代码和原始训练数据也公开。这轮国内开源模型更新中,大多数厂商采用的都是开放权重模式,配套差异化的商业许可协议。
Q4:这些开源模型能直接商用吗?
取决于具体协议。智谱GLM-5.2和DeepSeek V4系列采用MIT协议,商用限制最少。腾讯混元Hy3走Apache 2.0,同样允许商用。Kimi K3采用Modified MIT,商用需关注附加条款。选型前务必确认协议细节。
Q5:国产算力平台对这些开源模型的支持程度如何?
2026年的适配速度已经非常快,Kimi K3、Qwen3.8-2.4T、GLM-5.2等主要模型在发布当天或数日内即完成华为昇腾、摩尔线程、沐曦等国产平台的适配。如果你使用国产算力,建议优先选择已经完成Day 0适配的模型。
Q6:端侧模型和云端模型,企业应该怎么分工?
一个实用的原则:对延迟敏感、数据不宜出本地的任务交给端侧模型(如设备控制、本地文档处理);需要复杂推理、多模态理解或超长上下文的任务交给云端模型(如合同审查、视频生成)。两者不是替代关系,而是协同关系。

