沐曦开源生态:AI时代的Android算力底座

每年WAIC开展首日,逛展的从业者往往会经历一场紧凑的“算力关键词扫盲”,今年最亮眼的几个方向早已清晰:超节点、大模型、智能体、科学智能AI4S。
沐曦今年几乎把全系列新品搬到了现场:首次亮相的曦景S600超节点,单机柜可搭载64张GPU,支持扩展至万卡集群;面向AI4S领域的曦索X300系列科学智能GPU正式发布;Agent体验区更是排起长队,数字员工、AI文创工作站的演示几乎全程不间断。
按理说这些产品已经足以撑起一个GPU展台的核心看点,但真正让我们驻足的,却是展台中央的另一处布置:整整十个开源社区的logo依次排开,包括龙蜥、vLLM、PyTorch基金会、SGLang等,沐曦还专门设计了一条开源社区打卡路线。一家GPU厂商为何将最显眼的展位之一留给开源?要解答这个问题,还要从他们自研的全栈计算软件MXMACA说起。
算力赛道的从业者都清楚,头部厂商长期占据市场绝非仅靠芯片硬件参数。制程、架构、显存这些指标可以通过持续研发追赶,但真正难以逾越的,是隐藏在硬件之下的软件生态护城河。以头部厂商为例,数百万开发者的项目代码、积累的经验、自研模块都深度沉淀在主流生态中,一旦更换算力平台,意味着要推倒多年的技术积累,高昂的迁移成本足以拦住绝大多数团队。国产GPU要实现突围,必须打造一套能让开发者低成本迁移的开发环境,而沐曦自研的MXMACA全栈软件,正是针对这一痛点的核心解决方案。
这套软件覆盖了从编译器、底层算子函数库,到主流AI训练推理框架的完整链路,唯一的目标就是将开发者的迁移成本压到最低,让原有代码无需修改就能直接在沐曦GPU上运行。这套“近零迁移”的能力已经经过了严格验证:团队搭建了自动化测试体系,纳入了GitHub上近5000个热门开源项目,每一次MXMACA版本更新都会执行全量测试,最终92%的项目可以直接运行,无需改动一行代码。
在框架适配层面,MXMACA同样表现亮眼:针对PyTorch 2.8版本,软件实现了全部2410个GPU算子的完整兼容;更关键的是适配速度,行业同类方案通常需要数月才能适配新版PyTorch,沐曦仅需一周就能完成全部适配。vLLM生态的测试更能体现兼容性优势:生态内两百多款大模型,沐曦仅深度调试了五六十款主流型号,剩余的交由普通本科生用沐曦显卡逐一测试,最终仅十余款出现适配问题,绝大多数都能开箱即用。
不过在沐曦的整体布局中,让代码顺利运行只是第一步。AI爆发式增长后,行业面临的新挑战逐渐显现:大模型从训练到上线的周期被大幅压缩,厂商都希望模型升级后能快速落地变现,但技术迭代几乎没有间歇,今天一款创新技术发布,隔天就会出现迭代方案。如果仅依靠封闭自研的软件栈,根本无法跟上行业节奏,也无法快速响应客户需求。
“对于我们这样一个追赶者来讲,需要以开源的方式,来打破领先者闭源的垄断。”
谈及选择开源的初衷,沐曦团队的这番话道出了核心逻辑,但实际上拥抱开源并非行业倒逼的临时策略。早在GPU产品量产前,沐曦就已经完成了1752款开源软件的适配,从那时起,开源共建就被纳入了公司长期战略。
沐曦的开源策略可以用“upstream first”来概括,和传统的“社区发版→厂商适配”模式不同,这种方式是将代码直接贡献回上游社区,和社区共同迭代。最终开发者只需要从vLLM社区拉取代码,通过pip安装就能直接运行,因为沐曦的适配代码本身就合入了社区主干,新模型发布时往往默认就支持沐曦硬件。截至目前,沐曦已经开源了53个软件仓库,占整个软件栈的15%到20%,且开源规模还在持续扩大。
其中标志性的事件是,沐曦成为国内首家与vLLM官方签署合作协议的芯片企业,在全球范围内也是除美国芯片厂商外的第一家。双方合作覆盖软件适配、开源活动、商业协同三个维度,沐曦的硬件也进入了Red Hat+vLLM的官方硬件货架,这早已不是单向适配,而是真正的生态共建。
回到展台上的十个开源社区,其实这是沐曦开源协作的完整地图,对应了一个Token从生成到落地的全生命周期。最底层是操作系统与资源调度层,龙蜥、Red Hat、CNCF、蜜瓜智能都在这个层级,保障Token能够稳定运行。沐曦和龙蜥社区曾共同解决了行业共性难题:操作系统内核小版本频繁升级时,GPU驱动需要重新打包,给终端用户带来额外负担。双方通过技术机制让驱动可以直接忽略内核小版本变化,开源版本编译后即可直接使用,这类工作只有深度扎根社区共建才能完成。
往上一层是训练与推理框架层,vLLM、SGLang、PyTorch基金会、九源联合体都在这里,支撑Token的高效生成。沐曦透露,过去两年这个层级的性能提升每年都超过100%。再往上的顶层则是开源生态运营与合规治理层,模力方舟负责降低模型分发门槛,方便开发者获取各类模型;木兰开源社区则专注开源项目孵化和行业规范搭建。沐曦曾联合木兰开源社区制定开源规范和大模型分级标准,因为开源不等于无规则开放,Token的安全合规输出离不开完善的社区运营和治理体系。从芯片到操作系统,从推理引擎到治理规则,走完这条打卡路线,也就走完了一个Token的完整生命周期。
沐曦的共建并没有止步于框架层。对标OpenAI Triton的TileLang编译器由北大团队研发,沐曦从2024年下半年就投入共建,今年多款主流大模型上线时,不少核心算子都是通过这套编译器开发的。这意味着国内首次拥有了从并行编译到算子优化的端到端自主可控技术路线,不必再担心自研适配代码无法合入上游社区主干。
除了技术共建,沐曦也非常重视人才培养:围绕TileLang开设的多期实战训练营累计吸引了500多名开发者参与,今年还将启动“揭榜挂帅”项目,吸引更多算子优化技术人才加入。目前规划编写的6本配套教材已经出版了4本,8门基础课程进入了上海交大、浙大等20多所高校;企业还联合上海AI实验室的书生工具链开办了三期实战营,让学生从数据收集、模型训练到评测应用全流程参与,相关课程和全部工程代码都对外开源。在挑战杯、CCF大赛、国家实验室技术竞赛中,也经常能看到沐曦的身影。为了发掘优质新生技术力量,沐曦还设置了激励机制,在社区实操中表现突出的在校学生可以获得免试入职实习的机会。
生态从来不是单方面“搭建”出来的,而是通过持续开放底座,由各方共同生长而来。那么沐曦希望MXMACA最终成为什么?沐曦CTO杨建博士给出了明确的定位:AI时代的Android。
具体来说,就是持续开放核心全栈软件,打通从操作系统、大数据处理,到大模型训练推理、私有化部署的全链条,让客户乃至其他芯片厂商都能基于这套软件栈,搭建出通用、好用、易用的底层算力生态。所谓通用,就是让市面上绝大多数模型和应用都能顺畅适配;而好用易用的标准则非常接地气:“一个小白用户,一个下午就能完成一个新应用的全部适配。”这并非空谈,早在2023年,沐曦就已经实现了让一名大二学生在一天内完成一款开源软件的适配、验证和部署。
杨建博士判断,未来全球700万GPU和AI开发从业者中,至少650万人在接触沐曦工具链后,可以在一天内快速上手。Android当年依靠激活设备数和开发者数量撑起了整个生态,AI时代的算力生态也是同样的逻辑,目前沐曦生态已有50万开发者,团队的长期目标是到2029、2030年,将专属开发者数量扩大到500万。
Agent浪潮的爆发,也给这套生态体系带来了新的命题。沐曦团队认为,当前的Agent正处于类寒武纪时代:各类智能体方案集中涌现,GitHub上AI相关项目数量每年翻番,所有人都在探索Agent的落地场景。但这种爆发式增长也带着盲目性:大量Agent程序缺少底层性能优化,大量Token被消耗在无效调用上,Token消耗的增速已经远超底层基础设施的扩容速度。
好在行业两端都在加速优化,而且是以“透明内卷”的方式进行:今天业内开源一项降低单Token算力消耗的新技术,明天就可能有高校团队放出优化版本,所有优化都在开源世界中公开透明,你追我赶。推理侧的效果显著:同一张GPU原来每秒可生成100个Token,现在可以达到200、300个;Agent侧也通过Skill等方式压缩开销,原本需要1000个Token预算才能完成的任务,优化后仅需100个就能搞定。
沐曦还分享过一个真实的小故事:一家互联网公司的产品经理前来对接模型适配,中途外出用餐的功夫回来就告诉团队,适配已经完成。他借助AI编程工具、自家模型权重和沐曦的公开文档,在一顿饭的时间里就跑通了适配脚本。这件事让沐曦团队颇感意外,但转念一想,这恰恰说明生态已经进入了新阶段:文档足够开放、软件栈足够兼容,甚至不擅长写代码的人都能借助AI参与共建。展区里的标语「每个Token背后,都是一次开源协作」也有了全新的注解:现在就连AI自己生成的Token,也在参与这场开源协作。
从长远布局来看,沐曦想要扮演的角色始终没有改变:做中国开源算力生态的领军者,依靠开源底座串联产学研用,让操作系统、框架、模型、应用的每一个环节都建立在开源共享的基础上。毕竟,Token不会说谎,每一个流畅生成的Token,都是对背后整套开源协作链路的验证。而沐曦想要做的,就是让每一个Token的价值都得到真正的实现。

