文章摘要
AI行业算力需求暴涨,供给停滞,陷入困境。商汤提出异构混合推理方案,经技术攻坚实现99.9%的长时间运行可靠性。其国产混推集群已盈利,还实现端到端控制。此外,发布“银河计划”,布局前沿技术,探索下一代AI算力工厂模式。

今年WAIC开幕当天,上海世博展区挤满了各种机器人、大模型和智能体。但如果你问一圈做AI的人,2026年最让他们睡不着觉的事情是什么,答案出奇一致——不是模型不够强,是算力不够用了。

过去一年,AI行业发生了根本性的切换:大模型从「陪聊」变成了「干活」。这带来一个最直观的变化:Agent的算力消耗远超想象。

这不是夸张。今年,密歇根大学、斯坦福等机构测算发现,在一组真实软件工程任务中,编码Agent每生成1个输出Token,背后平均要累计处理约154个输入Token。更要命的是,这些Agent不是偶尔运行,而是7×24小时不间断工作。行业共识显示,今年AI推理的算力需求是去年的5倍到10倍。

与此同时,英伟达最新的高端卡今年很难大批进入国内,存量供给几乎没有明显增长。需求暴涨,供给却停滞,行业陷入了两难的困境。

就在WAIC期间,商汤在总部举办以「算创·无限」为主题的Agentic时代AI基础设施创新发展论坛,给出了一个反常识的答案:不造更强的卡,而是把任务拆开,让不同的卡接力完成工作。

异构混合推理的核心逻辑

要理解商汤的方案,首先要理清大模型推理的两道核心工序:第一道叫做Prefill,也就是「读题」——把用户提交的资料、文档、聊天记录、上下文全部读取并理解清楚;第二道叫做Decode,也就是「答题」——在理解的基础上,逐字生成最终的输出内容。

这两道工序对硬件的要求完全不同:Prefill比拼的是计算吞吐量,需要一口气吞下海量信息,越快越好;而Decode比拼的是显存带宽,需要稳定持续地输出内容,不能出现卡顿。

过去行业的常规做法是用单张显卡从头做到尾,既负责读题又负责答题,这就好比让一个人独自完成铁人三项——游泳、骑车、长跑全包了。虽然能完成,但绝对不是最优解。

商汤的思路则是把铁人三项拆开,让三个运动员各跑自己最擅长的那段:让通用国产卡去承担Prefill工作——这类芯片的计算吞吐量表现出色,处理读题任务效率很高;而将高端显卡集中起来负责Decode——这是高端芯片的绝对强项。

从理论到落地的复杂挑战

这套方案听起来很美好,但真正落地远比「把卡插上去就能跑」要复杂得多。一个Decode节点需要同时协调数十个Prefill节点,而且这些芯片可能来自不同厂家、不同代际,如何保证网络不拥堵、请求合理分配、长文档和短对话区别对待、节点掉线时自动容错、缓存命中率保持稳定,都是需要解决的难题。

商汤首席科学家张行程曾直白地指出:纯英伟达方案只需要4个Prefill节点对应1个Decode节点,但换成国产方案则需要30个Prefill节点对应1个Decode节点,网络复杂度、调度复杂度、容错复杂度都直线上升。

为此商汤在底层做了海量的技术攻坚:从编译器、算子优化、网络架构、缓存策略到调度系统、容错机制,一层一层打通了整个链路。经过系统级的全面调优,这套复杂程度远超英伟达方案的异构系统,实现了99.9%的长时间运行可靠性,真正具备了大规模商用的条件。

从2018年开始,商汤就一直在做多芯片适配,到今天已经形成了一整套完整的方法论。正如张行程所说,这不仅是技术层面的方法论,更是组织层面的协同——商汤自身的研发团队、芯片原厂、高校和科研机构深度绑定、灵活协作,才啃下了这块硬骨头。

目前,这套方案已经在真实客户场景中完成了落地验证,适配的模型包括GLM 5.2、DeepSeek V4、Kimi K2.7、MiniMax M3、SenseNova V6.7等多款主流大模型。

国产算力终于实现商业盈利

但光是「能跑」还不够,技术再先进,如果不能实现盈利也只是空中楼阁。商汤这次最让人意外的突破,就是国产芯片参与的混推集群,已经实现了真正的可盈利。

商汤科技联合创始人、大装置事业群总裁杨帆给出了明确的盈利定义:收入覆盖折旧、摊销、机柜租赁、电费和人员服务费之后,利润率为正,也就是真金白银地实现了盈利。

这一成果主要通过三个关键步骤实现:

首先是充分压榨国产卡的实际性能。商汤在三个不同厂牌的国产芯片上做了定向优化,单卡MFU(也就是有效利用率)相比原厂出厂表现平均提升约一倍,最高的一款甚至提升了152%。

其次是通过异构混推提升单位成本的Token产出。相比国产同构推理方案,异构混推的同成本Token产出规模扩大了2.5倍,简单来说就是同样的硬件和机房投入,能够多产出一倍多的Token。

最后是实现规模化的Token产出。年初的时候日均Token产出为4000亿,到7月底预计将达到日均2.42万亿,年底的目标是日均10万亿,全年预期增长25倍。只有规模跑起来,才能证明这套模式不是小打小闹的试验。

这意味着,国产算力第一次不必等到单卡全面追平英伟达,就通过系统级的分工优化,提前进入了真实的商业市场。不是等着技术领先了再上桌,而是找准了自己的位置先参与进来,并且真正赚到了钱。

端到端控制的核心价值

为什么同样采购国产卡,有些智算中心依然处于亏损状态,而商汤能够实现盈利?答案不在于某一张单独的显卡,而在于整座算力工厂的控制权。

杨帆曾犀利地指出:很多自称算力服务商的公司,实际上是帮大厂代持机器、签订长租约,本质上提供的只是金融服务。如果一座工厂的厂房、机器、流水线、仓库和销售分别由五家不同的公司管理,别说极致优化,光是协调开会就可能把利润消耗殆尽。

商汤的做法是实现端到端的全链路控制:从机房物理层、服务器、网络架构、编译器、算子优化、框架、推理引擎、调度系统,再到最终客户的Token流量,整条链路尽可能由一个主体贯穿。

虽然每个环节单拎出来可能都不是行业最强,但拼在一起就形成了平台级的整体优势——优化空间来自于系统级的联合调优,这是分层割裂的商业模式永远无法实现的。

这里还有一个有趣的闭环:Agent正在反过来帮助提升算力生产效率。过去国产芯片的适配是公认的苦活,每更换一款芯片都要重新踩坑,但今年商汤已经开始用Agent来辅助完成算子迁移、适配和优化,杨帆表示现在行业内已经普遍在用Agent来编写算子适配代码。

当芯片、网络和业务流量实现端到端打通之后,优化的触角自然延伸到了过去容易被忽视的电力成本上。在临港数据中心,商汤和宁德时代合作搭建了储能系统,配合峰谷电价和算力预测实现弹性调度。最终实现了单位电力成本的Token产出提升约80%,电费比同地区的普通IDC低约10%。

今年7月10日上海用电紧张期间,国网发出需求响应,商汤临港数据中心在两小时内释放了75%的算力容量,减少用电4.6万度。这件事的意义不仅在于省电,更说明大型智算中心可以成为电网中的「虚拟电池」:高峰期主动降低负荷为市政电网让路,低谷期则开足马力运行推理任务。

到这里,整个「Token工厂」的画面已经完整:芯片是生产机器,网络是流水线,KV Cache是仓库,调度系统是厂长,电力是生产原料,Token就是最终的产品。

从单座工厂到全国算力网络

单靠一家公司的端到端能力,无法撑起整个国产AI基础设施的生态。因此在本次WAIC上,商汤同步发布了「银河计划」:联合近20家生态伙伴,从寒武纪、沐曦、华为昇腾、摩尔线程等国产芯片厂商,到硅基流动、基流科技、中科加禾等基础设施服务商,将上下游产业链整合起来共同建设。

该计划的核心目标可以用四个数字概括:1个Token工厂、5个万卡国产集群、10个共创技术方向、200+家AI初创组织。

为什么规划5个万卡集群而不是一个10万卡的超大集群?因为商汤面向的是第三方市场,不同的业务场景需求差异巨大:大语言模型、视频生成、具身智能、世界模型、AI for Science,这些任务对硬件的要求完全不同。在模型和芯片都处于高速演化的阶段,灵活的组合调度比单一模型的优化更有价值。

科研端的合作也在本次WAIC上集中落地:商汤联合上海人工智能实验室、北京中关村学院、深圳河套学院、上海算法创新研究院、上海交通大学人工智能学院等五家科研机构,启动了科学发现平台战略合作,共同构建覆盖「算力基础—平台工具—模型能力—科研创新」的一体化科研服务体系,为生命科学、新材料、智能制造等重点领域提供高效、开放的AI科研支撑。

在区域布局上,上海临港是核心枢纽,盐城作为算电协同的区域试点,北京、天津、深圳、福州等节点正在逐步连成一张全国性的算力网络,接入国家一体化算力网。

出海方面有两个典型模式:香港作为出海跳板,杨帆明确表示「香港是中国未来Token出海的行业实验场」,计划到2030年前形成40000P+的算力规模,打造全港最大的国产智算中心;沙特则代表了另一种输出模式:帮助当地建设智算中心、训练主权模型、培养本土人才,输出的不是单一的硬件产品,而是一整套完整的「中国AI方案」。

国产化进程也在加速推进,临港AIDC的国产卡占比正在不断提升,按照当前的进展,明年有望超过50%。

前沿技术的长期布局

除了当前的落地业务,商汤还在同时布局三条前沿技术路线:光计算用于降低数据搬运的能耗,量子计算用于解决传统方法难以处理的高维优化问题,太空算力则用于将AI服务覆盖到地面网络无法触及的地区。

太空算力这条路线值得重点关注:商汤已经和国星宇航签约,计划在今年四季度发射4颗「商汤号」系列算力卫星,完成首发组网;2028年的目标是建成星地混合云商用骨干网;到2030年,计划建成千颗级的天地一体化AI算力星座。

杨帆对此的判断是,中国发展太空算力的核心逻辑不是地面电力成本过高,而是全球还有大量地区没有3G、4G网络覆盖,要将AI服务渗透到这些区域,星上算力是最有效的路径。

地面的Token工厂解决的是「如何更便宜地生产Token」,而未来的星地一体算力网则解决「如何将Token送到更远的地方」。

下一代AI算力工厂的模样

过去几年,AI基础设施的竞争更像是一场军备竞赛:谁拥有的GPU数量最多,谁的峰值算力最大,谁的机房最壮观。但到了Agent时代,这套玩法正在逐渐失效。

模型开发者不会关心你用了哪一款显卡,终端用户也不会在意你机房里有多少P的算力。他们真正关心的只有三件事:Token生成速度够不够快、成本够不够低、服务够不够稳定。

因此,未来的AI算力赢家,未必是拥有最多GPU的公司,而更可能是最懂得如何将不同芯片、不同电价、不同模型和不同任务,高效组织成一条完整生产线的公司。

商汤在本次WAIC展示的,不仅仅是一套国产异构混推方案,更是在提前回答一个更宏大的问题:当AI真正进入大规模生产时代,下一代的「Token工厂」究竟应该长成什么样子?

以上内容不代表本平台立场,仅供读者参考