异构组合破局国产算力!商汤大装置毛利率转正,Token量25倍增长

在近期举办的AI基础设施论坛上,商汤大装置公布的国产算力业务数据,彻底刷新了行业对国产芯片算力的认知。其国产芯片相关业务毛利率首次实现转正,日均Token处理量将从年初的4000亿增长至7月末的2.42万亿,年底更是直指10万亿目标,整体规模是年初的25倍,国内头部模型厂商均已成为其核心客户。商汤将今年称为国产AI基础设施规模化商用的元年。
商汤大装置负责人介绍,过去多年算力圈一直流传“谁买国产芯片谁认亏”的说法,这源于国产芯片与国际高端芯片存在至少一代的性能差距——尽管当前国产模型已经追平国际主流水平,但硬件层面的代际差依然是行业痛点,这一固有认知也随着商汤的最新数据被彻底打破。商汤没有等待芯片厂商自行缩小差距,而是提前跑出了一套系统级的组合解决方案。
这套方案的核心是异构混合推理,具体将大模型推理的Prefill和Decode两个阶段进行分离:Decode环节需要逐字生成内容,反复调取显存中的历史数据,对带宽和显存要求极高,交由性能更强的高端算力资源承接;而Prefill阶段一次性处理全量输入内容,更看重算力堆叠的吞吐量,因此由数量更多的国产芯片完成任务。这种分工让一块高端芯片可以带动约30块国产芯片协同工作,最终达到接近纯高端资源的推理效果。
这套组合方案并非针对单一芯片定制,商汤大装置已经适配了20多款不同厂商的国产芯片,其中六七款已经实现稳定的商业化盈利。
硬件拼接只是第一步,系统层面还有大量繁琐的适配工作需要推进:从底层编译器适配、算子重写到上层框架对接,再到最终的调度策略调整,每一个环节都需要针对性打磨。商汤通过算子层面的重写调优和系统级的资源分配优化,将国产芯片的MFU(Model FLOPs Utilization)提升了85%-152%,换算为商业指标,单位成本的Token产出提升了2.5倍。
具体到业务场景中,这套优化方案效果显著:在AI4S长序列蛋白质预测场景下,通过融合算子优化,整体预测耗时减少75%;在AIGC视频生成场景中,国产芯片运行DiT模型时,多卡并行视频生成加速比达到了93%。商汤将这套能力打包为“Token工厂”,为客户提供批量Token处理服务,这也是25倍增长曲线背后的核心支撑。
这套用高端资源承接瓶颈、通用国产芯片冲量的混合推理方案能跑通,不止依赖技术优化。不少同行都曾想到过类似的分工思路,但商汤的杀手锏在于掌控了全业务链条,能够实现端到端的联合优化。
行业常规模式是将机房、硬件、批发分销、零售等环节拆分给不同企业,虽然各环节可以做到专业化,但层与层之间的损耗和摩擦也随之增加,跨主体的资源浪费很难协调解决。而商汤大装置选择全链条自主掌控:自建机房、自主采购运营硬件、自研调度系统,最终直接对接客户提供服务。这套模式从2018年就开始打磨,联合自研团队、芯片原厂和高校科研机构,形成了松耦合与紧耦合并存的协作体系——平时各环节独立推进,遇到技术难题则集中攻坚。
今年这套体系又新增了一项关键能力:用AI自动生成算子适配代码,将原本需要工程师手工完成的适配工作交由AI承接,大幅压缩了跟上模型迭代速度所需的人力和时间成本,目前该方案已经在商汤的生产环境中稳定运行了较长时间。
除了算力资源,商汤还将电力纳入统一调度体系,在本次论坛上正式发布了“算电协同Agent”。该系统通过模型预测算力任务的耗电特征,打通电力调度系统,结合峰谷电价和自有储能设施调节整体用电节奏,由此衍生出TPW(Tokens per Watt)指标——即单位电量产出的Token数量,使用该方案后,单位电力成本的Token产出提升了约80%。
这套全链条自主掌控的模式也延伸到了生态合作领域。商汤大装置联合了近20家生态伙伴,包括寒武纪、沐曦股份、中科海光、华为昇腾、摩尔线程、曦望Sunrise、壁仞科技等头部国产芯片厂商,曦智科技等核心零部件供应商,以及硅基流动、趋境科技等基础设施服务商,共同发起国产AI基础设施生态共建计划,目标打造开放共享、联合创新的产业生态。
依托“银河计划”,商汤计划与生态伙伴共同建设1个Token运营中心、5个万卡级国产智算集群,围绕10个核心技术方向开展联合创新,同时赋能200家AI初创组织。
除产业伙伴外,商汤还将顶尖科研机构纳入体系。在本次论坛期间,商汤大装置联合上海人工智能实验室、北京中关村学院、深圳河套学院、上海算法创新研究院、上海交通大学人工智能学院五家国内顶尖科研机构,启动了科学发现平台战略合作。
此次合作涵盖联合实验室建设、重大科研项目协同攻关、科研算力底座搭建、科学智能平台研发、复合型人才培养、科研成果转化等多个方向,将构建覆盖算力基础、平台工具、模型能力、科研创新的一体化科研服务体系,为生命科学、新材料、智能制造等重点领域提供AI层面的科研支撑。
这套资源整合的方法论还延伸到了太空领域。商汤大装置与国星宇航签约,共同探索从地面万卡集群到在轨多星协同的太空算力合作。根据规划,2026年“商汤号”系列算力卫星将完成首发并组网,验证星地协同计算能力;到2030年,将建成天地一体化AI算力星座,形成覆盖全球的空间智能计算网络,填补地面集群无法覆盖的弱网络场景需求,比如应急救灾、远洋船舶、野外机器人等实时AI推理场景。
此外,光计算和量子计算也是商汤正在同步探索的前沿方向,目前仍处于早期探索阶段。所有这些跨领域的布局,本质上都是同一套方法论的延伸:将资源收拢整合,再根据不同场景灵活组合调度。
需要注意的是,当前这份高毛利、高增长的成绩,恰逢特殊的市场节点。今年Agent类应用爆发,彻底改变了算力需求结构:单次任务处理的上下文长度大幅拉长,市场整体算力需求同比增长5到10倍,但主流算力供给几乎没有同步提升。大厂优先保障内部核心业务,导致第三方客户的溢出需求无人承接,商汤正是抓住了这个窗口期,拿下了大厂和头部芯片厂商无暇顾及的市场。
不过随着供给端逐步追平需求,这轮短期红利大概率会收窄,但商汤大装置沉淀下来的端到端整合方法论会长期留存。商汤在AI基础设施领域已经深耕九年,是布局最早、最懂大模型的服务商之一,这套可以跨场景复用的操作逻辑,从推理调度延伸到电力协同、区域布局再到太空算力,背后都是统一的资源整合思路。
随着模型应用场景不断拓展,具身智能、世界模型、科学计算等新方向对算力的需求各有不同,单一芯片无法满足所有场景,这给擅长资源组合调度的玩家留下了长期发展空间。AI基础设施竞赛的最终决胜点,不再是单一芯片的先进性,而是资源整合和灵活调度的能力,商汤大装置正是押注了这一赛道。


