文章摘要
2026世界人工智能大会现场,阿里平头哥开源自研AI软件栈T - Head SAIL。此前该软件栈已获市场验证。开源后开发者可接触底层技术,开发效率和自主性提升。平头哥承诺降低迁移成本,其芯片版图完整,开源是为建立芯片生态,推动国内AI生态发展。

如果将AI芯片比作汽车的动力发动机,那么AI软件栈就承担了变速箱、传动系统与驾驶控制系统的全部角色。哪怕发动机性能再强劲,若是传动系统掉链子,动力无法传递到车轮,车辆依旧无法正常行驶。深耕芯片赛道八年的平头哥,对这个算力生态的底层逻辑有着格外深刻的理解。

在2026世界人工智能大会现场,阿里平头哥正式宣布开源其自研的AI软件栈T-Head SAIL。这套软件栈是平头哥真武系列AI芯片的底层支撑,拥有完全自主的知识产权,不仅全面适配主流AI生态体系,更覆盖了从操作系统层、软件开发工具包到接口层的完整技术链路。全球开发者均可在平头哥开发者社区下载完整的源码、驱动、工具链与配套文档。

在正式开源之前,这套软件栈已经经过了严苛的市场验证:截至今年4月,真武系列AI芯片累计出货量已达56万片,服务覆盖20余个行业400余家客户。不仅在阿里云内部的生产环境稳定运行,更经受住了双11级别的大规模流量洪峰考验,以及各类复杂业务场景下的高等级服务协议要求。可以说,平头哥这次拿出的是自家业务的核心技术底盘。

那么,一家专注芯片研发的企业,为什么要主动拆掉技术围墙,将核心软件栈公开?要理解这个动作的分量,首先得搞清楚AI软件栈在整个算力链条中的关键地位。

一颗全新出厂的AI芯片,对普通开发者而言其实是无法直接使用的。开发者日常依托PyTorch、TensorFlow等上层框架编写代码,既不需要也不应该直接与芯片底层的电路和指令集打交道。这中间必须有一整套完整的基础设施作为桥梁,将开发者用Python编写的高层代码,拆解成成千上万条芯片能够高效执行的底层指令,而这个桥梁就是AI软件栈。

用户能直接接触到的往往只是水面之上的API接口,水面之下则是厚厚的算子库、编译器、运行时、驱动层,以及围绕这些核心组件的调试工具和性能分析套件。只有配合足够强大的软件栈,才能充分发挥出芯片的全部算力性能。

然而现实中的技术门槛远比想象中更高。在很长一段时间里,AI软件栈对大多数开发者来说都是一个典型的黑盒。芯片厂商交付的往往是一套编译好的二进制工具链,开发者只能按照文档给定的方式调用,既无法看到内部实现逻辑,也不清楚芯片在底层如何运行自己的模型。一旦遇到性能瓶颈或者兼容性问题,开发者只能提交工单等待厂商响应,一个模型迁移项目动辄需要数周甚至一两个月的调试时间,而在这个周期内,模型版本可能已经迭代了两三轮。除了时间成本,高额的适配开销也足以让不少开发者望而却步。

这也解释了为什么NVIDIA能在AI算力市场占据近十年的主导地位——支撑其生态的核心不是某一代GPU的纸面参数,而是护城河级别的CUDA工具链。开发者十几年积累下来的开发习惯、代码资产、社区经验和工具生态,构成了一道比芯片制程更难跨越的技术壁垒。而CUDA之于NVIDIA,就相当于SAIL之于平头哥

如今,平头哥决定彻底翻转这个局面。SAIL开源相当于主动替开发者拆掉了那道技术围墙,将原本封闭的黑盒底层能力,转变为透明可控的白盒。软件栈开源后,过去只有头部云客户才能接触到的底层技术能力,现在对任何研究团队、任何开发者都完全敞开。开发者可以通过阅读源码真正搞清楚芯片的运行逻辑,遇到bug时能够自行定位甚至直接修复;更进一步,还可以针对自身业务场景做深度定制优化——毕竟没有人比开发者自己更了解自身的业务负载特性。平头哥SAIL的开源,让开发者的开发效率和技术自主性都迈上了全新台阶。

具体来看,平头哥这次对外开放的是一套经过生产环境验证的五层完整技术栈,从最底层的驱动一直延伸到最顶层的运维工具。

最底层是驱动和运行时,这层决定了操作系统能否识别真武芯片、能否正确调度计算任务。其中PPU Runtime负责管理设备内存、命令队列和计算上下文,PPU Driver则分为用户态驱动和内核态驱动,二者配合对外提供统一的设备管理和内存管理接口。这一层是芯片与操作系统握手的关键,也是过去最不透明、开发者最难摸清的部分,而这套驱动和运行时的设计,正是真武芯片能够在大规模集群中稳定运行的基础。

往上一层是编程语言层,平头哥开放了C/C++和Python接口。这看似简单的设计选择,背后隐含着关键判断:不让开发者为适配一款芯片去学习新语言、更换编程范式,而是与主流生态对齐,让开发者现有的代码资产能够平滑迁移。

再往上是编译器层,包含Compiler与Debugger两大组件,支持从模型图到可执行代码的端到端编译优化。对开发者来说,这意味着可以看到编译过程中每一步的中间表示,清晰理解模型在具体场景中的优化逻辑。

第四层是高性能库,也是SAIL技术栈中最厚重的组成部分。其中计算库涵盖线性代数加速库acBLAS、快速傅立叶变换库acFFT、随机数生成库acRAND、稀疏矩阵加速库acSPARSE、深度神经网络加速库acDNN、求解器acSOLVER等全套数学和AI基础库,每一行代码都针对真武芯片的底层架构做了精细优化,确保常用的AI计算操作能够以最高效率执行。编解码库则包含编码HGENC、解码HGDEC、JPEG编解码HGJPEG与预处理HGPP等,能够满足多模态数据处理的高吞吐需求;集合通信库PCCL与sailSHMEM则专为多卡、多机分布式训练设计,直击大规模训练中的通信瓶颈。此外还配备了acext扩展库与HGML机器学习库,进一步拓宽了功能边界。

最顶层是开发工具层:Asight Compute用于算子级的精细性能分析,帮助定位微观瓶颈;Asight Systems提供系统级全栈Profiling,给出宏观运行视角;PPU-SMI负责设备的实时监控与管理;PPU-DCGM则支撑集群级别的资源智能调度。从单卡的算子性能优化,到千卡级集群的资源调度,平头哥都提供了称手的配套工具。

对绝大多数开发者来说,比起技术栈的“全”,更关键的是迁移成本。平头哥为此给出了三个无需妥协的承诺。

首先是无需重写代码。SAIL全面兼容主流AI生态,主流模型可以即开即用,算子库完整对标主流标准,主流编程模型也实现了高度兼容。开发者过去积累的开发经验、编写的代码、调试技巧都可以在SAIL上直接复用。

其次是无需等待适配。AI技术的迭代速度极快,一款新模型推出后,社区的适配往往以天为单位计算。SAIL自研的推理引擎提供开箱即用的生产级性能,同时已经建立起与主流社区同频的响应机制,目前对主流AI推理框架的平均适配时间小于7天。这个速度意味着,社区的热度还未褪去,开发者就能在真武芯片上跑通最新模型,无需额外做适配和调优就能用上最新的算子、特性与优化手段。

最后是无需绑定框架平台。SAIL已经全面适配PyTorch、TensorFlow、vLLM、SGLang等260余个主流训练与推理框架,工具链也支持按需灵活选用,不绑定任何特定技术路线。这一点最能体现开放格局,SAIL将技术选型的自主权完全留给开发者,让开发者不必担心被锁死在某个封闭生态中。

不重写、不等待、不绑定,平头哥用开放换取信任,用兼容降低门槛,让T-Head SAIL将模型迁移的摩擦力降到了近乎为零。

其实从更深的层面来看,SAIL开源是平头哥八年技术布局走到今天的必然节点。2018年平头哥成立时,AI芯片赛道已经挤满了玩家,外界对它的初始印象大多是“阿里内部的一个芯片孵化项目”。但平头哥在阿里内部从未被当作普通项目,芯片这块最难啃的骨头一直享受着饱和式投入的待遇。高强度的研发投入,加上与阿里云、大模型等核心部门的紧密协同,让平头哥以闷声干大事的节奏,成长为国内芯片产业链中的黑马。

2019年,成立仅一年的平头哥推出第一颗芯片含光800。这是一款针对AI推理场景深度定制的芯片,采用自研架构,推理性能达到78563 IPS,也就是每秒可处理7万8千张图片,一举拿下当时同类芯片性能与能效比的两项第一。随后含光800逐步应用于双11淘宝主搜场景,在真实流量中完成了严苛检验。

紧接着,平头哥将目标投向了难度更高、通用性更强的CPU赛道。2021年云栖大会上,倚天710正式亮相,这是阿里体系内第一颗通用服务器CPU,让阿里成为首家具备CPU研发设计能力的中国互联网公司。这颗芯片性能超过同期业界标杆20%,能效比提升超过50%,如今已通过阿里云大规模应用于视频编解码、高性能计算、游戏等多个领域。

而在通用AI芯片这条最考验综合能力的主跑道上,平头哥的步伐同样扎实。真武810早在2022年底、2023年初就完成了研发和场景验证,它采用并行计算架构和片间互联技术,配备96GB HBM2e内存和700GB/s片间互联带宽,支持PCIe 5.0×16接口,功耗控制在400W,配合全栈自研软件栈实现了从硬件到软件的完整自主可控。阿里已将其大规模用于千问大模型的训练和推理,外部客户也将其部署在各类AI推理和训练产线上。

到了2026阿里云峰会,平头哥亮出了新一代训推一体AI芯片真武M890。这颗芯片内置144GB显存,片间互联带宽提升到800GB/s,整体性能是真武810E的3倍。更重要的是,M890原生支持从FP32高精度训练到FP4低精度推理的全场景覆盖,再加上自研的ICN Switch 1.0芯片,可实现64卡全带宽互联,显著提升大规模智算集群的计算效率与稳定性。

到这里,平头哥的芯片版图已经非常清晰:在算力维度,有真武系列AI芯片和倚天系列Arm服务器CPU,分别覆盖AI算力和通用计算场景;在网力维度,有ICN Switch互联芯片和磐脉系列智能网卡,负责大规模集群内部的高速数据交换;在存力维度,有镇岳系列存储主控芯片,例如对标业界标杆三星旗舰的SSD主控芯片镇岳510,满足AI训练推理对低延时、高带宽存储的需求。算力、网力、存力,数据中心的三件套平头哥全部实现了自研,放眼整个中国芯片行业,能做到这一点的企业屈指可数。

恰恰是在硬件布局已经相当完整、产品力已经充分验证的这个节点,平头哥走出了关键破局的一步棋——开源AI软件栈。56万片出货、400多家客户的成绩单已经足够证明产品力,但如果止步于此,平头哥终究只是一家芯片供应商。要建立真正的芯片生态,需要让开发者可以基于平台做创新、研究机构能用工具链产出成果、产业伙伴围绕技术栈开发解决方案。

开源软件栈的本质,就是先降低开发者的使用门槛,再将生态建设的权利一并交出去。平头哥在这次开源中提出,将与全球开发者、科研机构及产业伙伴一起,共同打磨工具链、丰富算子生态、优化性能体验。落点在“共同”二字上,依托经过真实业务验证的成熟算力底座,生态的后续拓展将交由全行业协同完成。

某种意义上,这也是国内AI算力生态最缺少的一环:国内硬件追赶的力度充足,但软件生态的积淀相对不足。生态的厚度需要时间积累,更需要先有人敞开技术大门,吸纳全行业的力量共同建设。

最后回到名字本身,T-Head SAIL中的SAIL,全称是Seed of AI Library。用平头哥自己的话说,他们把每一行开源代码都视作一颗蕴含无限可能的种子,期待未来国内AI生态能在共建中蔚然成林。

以上内容不代表本平台立场,仅供读者参考