文章摘要
9月30日,DeepSeek正式面向华为昇腾算力平台开源AI加速基础设施套件,涵盖高级编译工具、高性能算子库、分布式通信库等组件;DeepSeek与华为联合定义的超节点组网方案可满足大模型训练与超低时延推理需求,实测性能接近硬件上限,相关成果已在CANN社区开源,该事件对国内AI软件生态具有里程碑意义,为算力平台选型提供了新方向。

9月30日,DeepSeek正式面向昇腾算力平台推出开源基础设施套件,包含TileLang高级语言编译工具、高性能计算库与分布式通信库,与此前面向GPU平台发布的开源组件形成完整对应体系。此次面向昇腾平台的基础设施加速库开源,对国内AI软件生态具备里程碑式意义,为算力平台选型提供了全新的差异化方向。

本次开源的核心组件涵盖DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库,以及DeepEP分布式通信库。昇腾平台提供了稳定开放的Ascend C API接口,允许开发者对访存路径与计算流水线进行精细化调优,从而打造高性能算子;同时依托开放的Ascend C编程接口与PTO ISA底层指令体系,DeepSeek得以完成TileLang编程工具的开源工作。昇腾生态兼顾多元开发范式,既支持资深开发者开展手工精细调优,也支持TileLang这类高级语言的编译对接,适配不同技术背景的开发者需求。

华为与DeepSeek团队联合定义了昇腾超节点SuperPoD Flex与UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,能够满足超低时延推理与前沿基座模型大规模训练的双重需求。基于全互联的UBL128超节点,昇腾推出了ASC-COMM高性能自定义通信编程库,为用户开发通信算子与通算融合算子提供高性能编程支持。DeepSeek团队开发的DeepEP高性能通信库,覆盖EP/CP/PP/FSDP等多种模式下的通信算子,为大模型向更大集群规模扩展提供可靠支撑。经实测,该通信库的互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,接近硬件性能上限。

为帮助更多开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将本次联合创新成果在CANN社区开源,内容涵盖大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KV cache池化与Agentic RL等多个方向。针对大规模推理场景,采用EP32部署策略时,在Offline推理模式下,DeepSeek-V4.1-Flash去掉框架的纯模型性能表现亮眼:TPOT=5ms,每卡输出吞吐2469 tokens/s;TPOT=10ms,每卡输出吞吐5102 tokens/s。需要说明的是,本次Benchmark数据均基于Offline推理模式采集,未包含Serving调度与框架负载均衡的影响,测试上下文长度为128K,Dspark投机接受率为0.85,详细性能分析可参考附录中的相关技术报告。

芯模协同,共生共荣。华为昇腾平台将与DeepSeek等前沿模型团队持续深耕联合创新,以AI算力底座承载大模型能力,实现深度适配与双向赋能,打通从推理到训练的全链路,携手打造开放、高效、易用的AI软件生态体系。

附开源参考实践和技术报告链接:

  • 通信编程体系:基于UB memory和URMA通信编程接口的通算并行算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/tree/master/docs/models/deepseek_v4_1/deepseek_v4.1_asc_comm_tech_report.md

  • 基于Agent-Friendly算子编程范式CANNBot-DSL的高性能融合算子开发实践:

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek_v4_1/deepseek_v4.1_cannbotdsl_operator_guide.md

  • DeepSeek-V4.1-Flash超节点部署推理优化实践:

https://gitcode.com/cann/cann-recipes-infer/tree/master/docs/models/deepseek_v4_1/deepseek_v4.1_flash_cann_tech_report.md

  • DeepSeek-V4.1-Flash单机部署低时延推理优化实践:

https://gitcode.com/cann/cann-recipes-infer/tree/master/docs/models/deepseek_v4_1/deepseek_v4.1_low_latency_tp_guide.md

  • DeepSeek-V4.1-Flash 单卡部署推理优化实践:https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/models/deepseek_v4_1/dsv41-flash-950-single-card.md
  • 基于PyTorch原生框架的DeepSeek-V4.1-Flash模型预训练实践:

https://gitcode.com/cann/cann-recipes-train/blob/master/docs/llm_pretrain/ascend950_superpod_moe_pretrain_system_reference.md

  • DeepSeek-V4.1-Flash模型低精度量化训练实践:https://gitcode.com/cann/cann-recipes-train/tree/master/docs/llm_pretrain/ascend950/low_precision_training.md
  • DeepSeek-V4 DSpark草稿模型昇腾训练实践:https://gitcode.com/cann/cann-recipes-train/tree/master/llm_sft/DeepSpec
  • DeepSeek-V4 单机LoRA 微调实践:https://gitcode.com/cann/torchtitan-npu/blob/master/docs/feature_guides/deepseek_v4_lora.md
  • 基于鲲鹏CPU、昇腾950、灵衢协同的Agentic RL训练实践:https://gitcode.com/cann/cann-recipes-train/tree/master/docs/llm_rl/kunpeng_ascend_agentic_rl_infrastructure.md
  • 鲲鹏CPU对AgentENV的适配与优化实践:

https://gitcode.com/KunpengSDK/agentENV/blob/main/agentenv-kunpeng-optimization-practice.md

  • 推理模型优化Agent 部署调优实践

https://gitcode.com/cann/cann-recipes-infer/blob/master/docs/agent/DeepSeekV4.1-Flash-Model-Agent.md

  • AMCT 低精度量化Agent量化实践:

https://gitcode.com/cann/amct/tree/master/examples/models/deepseekv4.1/DeepSeekV4.1-Flash-Quantization-Agent.md

  • TileLang 算子Agent开发和优化实践:

https://gitcode.com/cann/cannbot-skills/tree/master/plugins-official/tilelang-op-orchestrator

以上内容不代表本平台立场,仅供读者参考