DeepSeek披露10万亿参数模型部署方案

DeepSeek近日通过华为CANN社区技术文档,首次披露了其10万亿参数MoE模型的部署方案。该方案基于昇腾950超节点,结合DeepSeek-V4-Flash的训练验证数据,系统分析了从550B到1.6T再到10T规模的参数切分策略与外推部署权衡。DeepSeek披露10万亿参数模型部署方案,标志着国产大模型在参数规模与算力自主化两个维度上同时跨入新阶段。

一、一次“非典型”的技术披露
2026年10月5日前后,华为CANN社区公开了一份题为《基于昇腾950超节点的万亿MoE模型预训练系统参考实践》的技术文档。文档在介绍DeepSeek预训练支持时明确指出:“基于PyTorch原生训练框架和昇腾950超节点,结合DeepSeek-V4-Flash训练验证,分析550B、1.6T模型的切分策略,以及向10T规模外推时的部署权衡。”
这是DeepSeek首次在公开技术材料中触及10万亿参数量级的部署讨论。更关键的是,文档并非纯学术推演,而是以已训练的550B和1.6T模型为实测锚点,向10T规模进行系统性外推。
理解这次披露的分量,需要先看一组参照数据。DeepSeek-R1的参数量为6710亿,10万亿是其约十五倍。当前国产已发布模型的最大参数规模,是月之暗面Kimi K3的2.8万亿。DeepSeek现役旗舰V4-Pro的总参数为1.6万亿。阿里最新的Qwen 3.8-Max约2.4万亿。
10万亿参数,是目前国产已发布模型最大规模的四倍以上。这个数字背后,是一套完整的工程化部署方案,而非单纯的参数指标。
二、MoE架构:理解10万亿参数的前提
要读懂这份部署方案,必须先理解一个基础架构概念:MoE(混合专家模型,Mixture of Experts)。
传统的稠密模型像一个全能选手,无论面对什么问题,都需要调动全部参数。MoE模型则像一个专业团队,内部包含大量各自擅长不同领域的“专家”子网络。当用户输入一个问题时,路由机制只激活最相关的少数专家,其余专家保持静默。
这种设计带来的直接好处是:总参数可以非常大,但每次推理实际激活的参数远小于总参数。
以DeepSeek-V4系列为例。V4-Pro的总参数为1.6万亿,但激活参数仅490亿,激活比例约3%。V4-Flash总参数2840亿,激活参数130亿,激活比例更低。
DeepSeek-V4的Mega MoE架构从256个专家中,每个Token只激活8个。这意味着模型的知识容量可以持续扩大,但推理成本的增长远低于参数增长。
理解了这一点,就能明白10万亿参数MoE模型的真正意义:它的能力上限大幅提升,但推理时的算力消耗并不会等比例飙升。这正是DeepSeek选择MoE路线冲刺10万亿参数规模的核心逻辑。
2.1 MoE路由效率的工程挑战
MoE架构的吸引力在于“大而省”,但工程实现上有显著的复杂性。不同请求激活的专家组合不同,会导致显存分配不均匀。某些专家被高频调用,显存占用持续偏高;另一些专家长期闲置,资源利用率低下。
DeepSeek在V4系列中通过动态冗余策略缓解了这一问题。核心思路是对高负载专家进行副本复制,将请求分散到多个副本上,同时通过全局负载均衡机制动态调整路由概率。
向10万亿规模外推时,专家的绝对数量将大幅增加——如果保持V4的激活比例,专家总数可能从数百扩展到数千级别。这意味着路由算法的复杂度和通信开销将呈非线性增长。华为CANN方案中的EP(专家并行)策略正是针对这一瓶颈设计的。
三、部署方案拆解:从550B到10T的工程路径
华为CANN方案的核心价值,在于它没有停留在理论层面,而是给出了从已验证规模向10T外推的完整工程路径。
3.1 三层并行策略:FSDP + EP + CP
方案设计了FSDP(全分片数据并行)、EP(专家并行)、CP(上下文并行)三层并行策略。
用通俗的方式理解这三层策略的分工:
FSDP负责将模型的参数、梯度和优化器状态切分到不同芯片上,解决“单个芯片装不下完整模型”的问题。EP负责将不同的专家分配到不同芯片上,解决“专家数量太多、路由通信复杂”的问题。CP负责将长序列切分处理,解决“超长上下文场景下的显存压力”问题。
三层策略的协同设计是方案的关键难点。模型从550B扩展到10T,每一层的切分粒度和通信模式都需要重新调优。CANN方案给出了从550B和1.6T模型的实测数据向10T外推的量化分析框架,这正是“部署权衡”四个字的实质含义。
3.2 FlexMuon分布式优化器
方案中引入的FlexMuon分布式优化器值得单独讨论。传统优化器在超大规模模型训练中面临参数布局重组频繁、层级间流水线效率下降等问题。FlexMuon针对这两点做了专门优化,减少了优化器状态更新过程中的通信开销。
配套的GraphTrainer方案则通过图映射来编排通信和计算任务的执行顺序,减少串行等待时间。在8192张NPU卡同时运行的场景下,通信延迟的控制直接决定了训练效率的上限。
3.3 实测数据锚点
方案的工程可信度,来自已完成的V4-Flash训练验证。在昇腾950超节点上,V4-Flash训练中未掩盖通信时间占比低于5%,整网MFU(模型浮点利用率)突破35%。轻量化部署方面,仅需64P算力即可跑通550B全参CPT/SFT训练。
V4-Pro在8K输入场景下,单卡Decode吞吐4700TPS,TPOT约20毫秒。V4-Flash单卡吞吐1600TPS,TPOT约10毫秒。这些数据虽非顶尖水平,但已经能够支撑大规模推理服务的运行。
| 对比维度 | DeepSeek V4-Flash | DeepSeek V4-Pro | 10T目标模型(外推) |
|---|---|---|---|
| 总参数量 | 284B | 1.6T | 10T |
| 激活参数量 | 13B | 49B | 待披露 |
| 激活比例 | 约4.6% | 约3.1% | 预计3%-5% |
| 专家总数 | 256 | 256 | 预计大幅扩展 |
| 单Token激活专家数 | 8 | 8 | 待披露 |
| 上下文支持 | 100万token | 100万token | 预计100万token+ |
| 训练验证状态 | 已完成 | 已完成 | 外推分析中 |
| 推理芯片 | 昇腾950PR | 昇腾950PR | 昇腾950DT |
四、昇腾950超节点:承载10T模型的硬件底座
10万亿参数模型的部署方案,离不开底层硬件的支撑。华为昇腾950超节点(Atlas 950 SuperPoD)是实现这一方案的物理基础设施。
4.1 核心规格
昇腾950超节点基于灵衢互联协议和超节点架构,实现了业界最大的1024卡规模,提供1 EFLOPS FP8和2 EFLOPS FP4算力,拥有256TB全局统一内存编址空间。NPU互联带宽达到TB级别,RTT时延低至3微秒。
在芯片层面,昇腾950分为两个版本。950PR面向推理场景,配备128GB内存、1.6TB/s带宽。950DT专为高强度训练任务设计,内存容量提升至144GB,带宽突破4TB/s。
单机柜以64张NPU卡为基本单元,最大支持8192张NPU卡高速互联。这个规模意味着,一个超节点集群的计算能力已经可以支撑起十万亿参数级别的训练任务。
4.2 乌兰察布数据中心:算力落地的关键一步
硬件规格之外,实际部署的规模更能说明问题。据多家媒体报道,DeepSeek计划在内蒙古乌兰察布建设一座吉瓦级数据中心,规划部署至少16万颗华为昇腾950DT芯片,订单总额预估约25.6亿美元。
乌兰察布地处“东数西算”国家算力枢纽节点,气候寒冷、电力资源充裕,是大规模数据中心的理想选址。吉瓦级的功率规划意味着,仅这一个数据中心的用电量就相当于一座核电机组的输出功率。
16万颗芯片的部署规模,如果按每64张卡组成一个超节点单元计算,对应约2500个超节点机柜。这个体量的国产AI推理算力集群,在规模上已进入全球前列。
五、横向对比:国产大模型的参数竞赛格局
DeepSeek的10万亿参数部署方案,需要放在更广阔的行业竞争格局中理解。2026年下半年,国产大模型公司集体重拾参数规模竞赛。
5.1 主要玩家对比
| 对比维度 | DeepSeek | 阿里(Qwen) | 字节跳动 | 月之暗面(Kimi) |
|---|---|---|---|---|
| 现役旗舰参数 | 1.6T(V4-Pro) | 2.4T(Qwen 3.8-Max) | 未公开 | 2.8T(K3) |
| 目标参数规模 | 10T(外推分析) | 5T-10T | 最高10T | 未公开 |
| 训练芯片路线 | 华为昇腾 | 多元(含国产) | 多元 | 多元 |
| 激活参数比例 | 约3% | 约5% | 待披露 | 约3.7% |
| 开源策略 | 开源 | 部分开源 | 部分开源 | 开源 |
| 披露状态 | 技术文档公开 | 公开宣布 | 媒体报道 | 已发布 |
阿里在2026年9月云栖大会上宣布,下一代Qwen模型计划扩展到5万亿到10万亿参数。字节跳动被《金融时报》报道正在训练最高10万亿参数的模型。
如果字节的10万亿模型落地,其规模将达到Kimi K3的三倍以上,接近或超越Anthropic旗舰模型Mythos 5的业内估计水平。
5.2 路线分歧:参数规模 vs 激活效率
值得关注的是,DeepSeek创始人梁文锋在此前一场投资者会议上表达过一个耐人寻味的观点:算力资源撑不住10万亿的训练,即使训出来了,研究所需的算力也远远不够,不如优先做好几千万激活的模型。
但DeepSeek当前的动作已经表明,公司策略正在调整。2026年6月完成首轮外部融资约74亿美元,第二轮约500亿元人民币的融资已进入最后敲定阶段。手中有粮之后,参数规模的推进有了更坚实的资源基础。
阿里与DeepSeek的路线差异值得深入分析。阿里推“递归式自我改进”,强调Scaling Law是通向超级人工智能的关键路径。DeepSeek则更侧重通过MoE架构优化激活效率,在算力约束下寻求参数规模与推理成本的平衡。
这两种路径并非对立,更像是同一目标下的不同策略选择。参数规模决定模型的能力上限,而激活效率决定模型的部署经济性。
六、10万亿参数模型意味着什么:能力跃迁与应用前景
10万亿参数模型最值得关注的,是可能出现的新能力维度。
当参数规模从万亿级跨入十万亿级,模型的推理能力、长任务链规划能力和多步骤复杂问题处理能力预计将出现显著提升。这些“涌现能力”在较小的模型上往往无法观测到,往往先出现在最大的模型上,再逐步下放到更小、更经济的模型版本中。
具体而言,几个方向值得关注:
复杂推理与规划。10T级模型理论上能够处理更长的推理链,在数学证明、代码生成、科学研究等需要多步骤逻辑推理的任务中表现更为突出。
超长上下文理解。DeepSeek V4系列已原生支持100万token上下文。10T模型在保持这一能力的同时,对长文档的理解深度和跨文档推理能力预计将大幅提升。
多模态融合。CANN方案还覆盖了多模态场景的训练支持,包括V4.1图文多模态训练实践。10T级模型在多模态理解上的表现空间更大。
但10T模型的部署也面临现实约束。模型越大,训练所需的高质量数据量越大,而且不只是数量,质量要求也更高。到了十万亿参数级别,单纯堆参数的边际回报递减问题将更加明显。真正的分水岭是单位算力能换回多少智能。
七、国产算力生态的成熟度验证
这份部署方案的另一层意义,在于它验证了国产算力生态支撑前沿大模型训练的可行性。
7.1 从CUDA到CANN的迁移
2026年4月,DeepSeek确认V4将100%运行在华为昇腾950PR推理芯片上,底层代码从CUDA全面转向华为CANN Next框架。这是全球首个脱离英伟达CUDA生态的顶级AI大模型。有媒体将其比喻为“在一架飞行中的飞机上更换引擎”。
CUDA生态积累了近20年,PyTorch、cuDNN、cuBLAS、NCCL等几乎所有AI基础设施都围绕CUDA构建。CANN从2021年推出到2025年全面开源,与CUDA的积累差距是客观存在的。
但DeepSeek V4的数据表明,这个差距正在缩小。V4在昇腾950PR上的推理速度相比前代提升35倍,单卡性能达到英伟达H20的2.87倍。API调用成本比GPT-5.4和Claude Opus 4.6低约50倍。
7.2 开源组件的战略意义
与部署方案同步,DeepSeek还开源了一批昇腾基础组件,包括TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA和DeepSelect。其中TileLang已用于V4系列模型训练中的大部分算子。
这些组件的开源,降低了其他团队在国产算力平台上进行大模型训练的技术门槛。从中金公司的分析来看,以V4.1 Flash的优化逻辑推演,原本需在NVIDIA Blackwell系列64卡系统承载的10T模型,有望在64卡Hopper系列系统完成部署。2026年至2027年主流性能的国产算力芯片,有望支持国产模型向10T-20T参数量平台持续扩张。
八、行业影响与深层思考
8.1 参数竞赛重启的外部推力
这一轮参数规模竞赛的重启,有来自外部的推动力。2026年6月下旬起,以Claude为代表的海外头部模型开始限制国内模型对其API的访问。这意味着“蒸馏”作为过去两年国内模型缩短差距的重要路径,正在变得越来越窄。
当蒸馏通道收窄,自研大规模模型的必要性就进一步上升。从阿里到DeepSeek再到字节,集体重拾参数规模竞赛,背后有技术路径选择的现实考量。
8.2 效率与规模的辩证关系
智谱创始人唐杰曾提出一个判断:大模型只看参数的时代已经结束。在他看来,早期Scaling Law中的拟合误差会随着计算规模不断累积。
这个观点与DeepSeek的实践形成了有趣的张力。DeepSeek恰恰是在证明参数规模仍然重要——但前提是架构效率要跟上。MoE架构让参数规模的增长与推理成本的增长脱钩,这是这一轮参数竞赛与上一轮的本质区别。
一个值得深入思考的问题是:如果10T模型每次推理只激活3%-5%的参数,那么“10万亿参数”这个数字本身的意义,是否更多在于训练阶段的知识压缩能力,而非推理阶段的直接表现?换句话说,参数规模的价值可能不在于让模型“更聪明”,而在于让模型在训练中“见过更多”。这是一个需要更多实证数据来回答的问题。
8.3 国产算力的闭环正在形成
从更宏观的视角看,DeepSeek披露10万亿参数模型部署方案的意义,超出了单一技术事件的范畴。它验证了一条完整的国产化路径:国产模型 + 国产芯片 + 国产训练框架 + 国产数据中心。
多家业内人士在接受采访时表示,DeepSeek V4基于华为昇腾实现全栈适配,标志着国产大模型和国产算力芯片已经打通了从训练到部署的全流程,验证了万亿参数模型在国产算力架构下落地的可行性,打破了此前行业对于“高端AI训练只能依赖英伟达”的固有认知。
这条路径的打通,不意味着国产算力已经全面追平,但它证明了一件事:在推理场景下,国产芯片已经开始具备竞争力。而当国产芯片的竞争力从推理扩展到训练,整个AI基础设施的格局将发生根本性的变化。
FAQ
Q1:DeepSeek的10万亿参数模型已经训练完成了吗?
目前尚未完成训练。华为CANN社区公开的技术文档显示,DeepSeek基于V4-Flash的训练验证数据,分析了550B和1.6T模型的切分策略,并在此基础上向10T规模进行外推分析。这是部署方案的论证阶段,而非最终模型的发布。
Q2:10万亿参数和10万亿激活参数是一回事吗?
不是。10万亿指的是总参数量,即模型包含的全部权重总量。由于DeepSeek采用MoE架构,每次推理只激活总参数中的一小部分。以V4-Pro为参照,总参数1.6万亿,激活参数仅490亿,激活比例约3%。10万亿参数模型的激活参数预计也在这个比例范围内。
Q3:为什么DeepSeek要选择MoE架构而不是稠密模型?
MoE架构的核心优势在于将参数规模与计算成本解耦。稠密模型的推理成本与参数规模成正比,而MoE模型每次只激活部分专家,总参数可以很大但推理成本控制得相对较低。对于DeepSeek这样需要在有限算力资源下追求最大模型能力的团队来说,MoE是更务实的选择。
Q4:昇腾950超节点能支撑10万亿参数模型的训练吗?
从硬件规格看,昇腾950超节点最大支持8192张NPU卡高速互联,提供1 EFLOPS FP8算力,256TB全局统一内存编址空间。CANN方案给出的训练数据显示,V4-Flash训练中通信时间占比低于5%,MFU突破35%。但10T规模的训练需求远超V4-Flash,方案本身的定位是“外推分析”而非“已验证方案”。
Q5:乌兰察布数据中心的16万颗芯片是用来训练还是推理?
据彭博社等媒体报道,DeepSeek计划在乌兰察布部署的16万颗昇腾950DT芯片主要用于模型推理。这与10万亿参数模型的训练部署是两件事。训练集群的规模需求通常更大,乌兰察布数据中心的吉瓦级功率规划,可能同时覆盖训练和推理两种负载。
Q6:10万亿参数模型对普通用户有什么实际影响?
最直接的影响是AI助手的推理能力上限提升。10T级模型在复杂推理、长文档理解、多步骤任务规划等方面的能力,将逐步下放到更小、更经济的模型版本中,最终体现在日常使用的AI产品中。但这个过程不会一蹴而就,从大模型到小模型的“能力蒸馏”需要时间。
Q7:国产芯片替代英伟达的进展如何?
在推理场景下,国产芯片已具备一定竞争力。DeepSeek V4在昇腾950PR上的单卡性能达到英伟达H20的2.87倍。中金公司的分析指出,2026至2027年主流国产算力芯片有望支持模型向10T-20T参数量平台扩张。但在训练场景下,国产芯片与英伟达最新产品的差距仍然存在,追赶需要时间。

