文章摘要
近期,资深AI行业分析师在访谈中指出,当前AI行业竞赛已升级为综合竞争。跨层协同可大幅提升性能,token成本下降推高算力需求。AI供应链受内存、CPU、光互连等约束,电力供应也是关键。英伟达需多极市场,而追赶前沿需数据、人才与算力协同。目前可变现需求增长远超算力供给,竞争核心已超出模型本身。

近期,一位资深AI行业分析师做客多家行业机构的访谈节目,对话覆盖了AI模型、芯片、内存、能源、数据中心建设以及AI商业变现等多个维度,最终指向一个核心趋势:当前的AI行业竞赛,已经不再仅仅比拼模型的纸面能力,而是升级为谁能以更低成本、更大规模稳定交付模型能力的综合竞争。

基于这些访谈内容,行业观察团队将分析师的核心观点整理为七个关键判断,形成了一套覆盖效率提升、需求变化、物理约束、竞争格局、组织能力和商业闭环的完整分析框架。这套框架的核心逻辑链条可以概括为:

跨层协同压低单位token成本 → 成本下降放大总需求 → 需求撞上内存、网络、电力等物理约束 → 供给格局重新划定 → 高毛利模型公司获得更强的算力竞价权

100倍性能提升:单点突破不如跨层协同

行业通常将AI效率优化拆解为三个层级:专用芯片硬件、底层系统软件以及模型算法本身。分析师指出,如果只关注单一维度的性能提升,很容易忽略真正的行业变革。比如单颗芯片性能提升2倍、底层内核优化2倍、模型架构效率提升2倍,三者简单相乘仅能带来8倍的整体性能提升;但如果同时对模型结构、通信方式、内存层级和芯片计算单元进行系统性重新设计,最终的性能提升可以达到100倍。

DeepSeek的产品迭代就是一个直观案例:其V3版本的专家结构主要针对英伟达Hopper架构优化,而随后发布的1.6万亿参数V4模型,则进一步适配了Blackwell和华为昇腾等不同硬件架构。不过硬件适配并不等于性能从发布第一天起就固定不变。

第三方测试机构对DeepSeek V4的持续测试显示,模型发布初期,GB300 NVL72在部分测试配置下表现领先,AMD MI355X的早期性能则相对落后。但在随后六周的测试中,AMD团队通过精度切换、kernel补齐、调度器优化和推理框架改进,将MI355X的吞吐量提升了超过100倍,部分区间甚至超过了H200。需要说明的是,这里的百倍提升来自软件栈从早期低基线逐步走向成熟的过程,并不代表MI355X的通用硬件性能提升了100倍。

这段追赶过程恰恰印证了分析师的观点:最终性能并非由硅片规格单独决定,而是模型、芯片、内存、网络和软件成熟度共同作用的结果。这种跨层协同的优化逻辑,也在重新定义英伟达的市场护城河。

DeepSeek、Kimi、GLM、Qwen等开源模型,大量围绕GPU的内存结构、通信方式和计算单元进行优化。即便谷歌TPU在特定工作负载中拥有更高能效,这些模型迁移到TPU平台后,也未必能获得同等的表现。因此,英伟达的壁垒不仅在于CUDA开发生态,更在于大量下游模型、推理框架和开源工具,已经围绕GPU的系统特征形成了深度适配的生态。

Token成本持续下降,反而推高总算力需求

分析师对token市场有一个非常激进的判断:未来,模型推理可能成为比石油更大的市场,占据全球GDP的若干个百分点。这一预测是否会兑现尚无定论,但其背后的成本下降曲线已经相当陡峭。

据分析师估算,在相近能力水平下,模型使用成本过去一度以每年约60倍的速度下降。DeepSeek V3相较两年前的GPT-4,在部分可比任务上的价格差距达到约600倍。

按照通常的经济逻辑,产品价格大幅下降应当意味着总支出减少,但AI行业正在呈现相反的结果。模型越便宜、能力越强,就有越多原本不值得自动化的任务开始变得可行;当模型能够处理更长、更复杂的任务,用户又会进一步增加调用次数。这就是AI时代的「杰文斯悖论」:单位成本下降,并没有减少总消耗,反而扩大了整体需求。

分析师所在的机构自身就是一个极端样本:2025年11月,该机构的年化AI支出还不到10万美元。随着Claude Code在内部普及,到2026年1月底,这一数字升至约400万美元,目前已达到约1100万美元,峰值周度支出折算后曾接近1400万美元。

不过需要区分两类不同的工作负载:第一类是固定工作流,例如企业需要检查一份文件是否满足特定规则,只要模型达到质量门槛,企业就可以等待更便宜的小模型,用成本下降来提高毛利;第二类是AI助手场景,员工每天让模型研究、编程、分析或生成内容,在这种场景里,最便宜的模型未必拥有最低的总成本。

一个更强的新模型,可能只用1/4的token、一次交互便完成旧模型需要多轮才能完成的任务。虽然单个token更贵,但总token数更少,占用员工的时间也更短。因此,分析师提出的成本优化方法并不是永远换用更便宜的模型,而是固定工作流追求单位成本,知识工作追求完成任务的总成本。

而当新模型提高了生产效率,人们通常不会停下来节省预算,而是会立刻把节省下来的时间和token投入更多任务。于是总支出在短暂下降后,又会迅速回升。

AI供应链的三重约束:内存、CPU与光互连

内存:从库存周期走向结构性短缺

传统内存行业通常以18至24个月为一个周期:价格上涨刺激扩产,新增产能又带来库存积累和价格回落。分析师认为,这一轮周期可能持续得更久,因为AI正在同时改变内存的需求规模和产品结构。

一方面,模型参数、推理流量和上下文长度仍在增长。对话式问答正向复杂推理和Agent任务演化,模型需要保存并反复读取更多中间状态,这推高了对HBM、服务器内存容量和带宽的要求。另一方面,供给扩张没有同等迅速。

全球前沿DRAM产能仍主要掌握在三星、SK海力士和美光手中,面对利润率更高的HBM3E、HBM4,厂商会优先将先进产能分配给HBM。但HBM不仅制造和封装更复杂,占用的晶圆面积也更大。当更多产能流向HBM,传统服务器DRAM、PC内存和移动内存能够获得的资源便会受到挤压。

这种资源竞争已经向消费电子传导。据第三方市场研究机构预测,受内存危机与地缘政治冲击叠加影响,2026年全球智能手机出货量将同比下降13.9%至10.8亿部,创2013年以来最低水平。存储成本的快速上升,正在迫使手机厂商重新调整产品组合、定价与出货计划。

分析师在访谈中给出的粗略判断是,未来数年,内存产能可能每年增长约20%至30%,而相关需求仍有可能维持接近翻倍的增速。如果这一增速差持续存在,本轮行情就不只是一次库存补充,而是AI需求与有限产能之间的结构性再分配。当然,“结构性短缺”不等于价格永远上涨,内存依然具有大宗商品属性。当新增产能上线,或者手机、PC等价格敏感型需求被高成本挤出,市场仍会重新寻找平衡。

CPU:真实需求回升,也包含补齐历史欠账

强化学习和Agent正在增加CPU的使用量。在预训练阶段,大量计算集中在GPU或其他AI加速器上;进入强化学习后,系统还需要运行代码测试、沙盒环境、任务验证器和模拟程序。Agent则需要频繁调用数据库、搜索引擎、代码解释器和外部工具,这些工作往往由CPU承担。

据行业研究机构判断,随着Agentic AI普及,数据中心内部CPU与GPU的工作负载配比,可能从传统AI服务器的约1:4或1:8,逐步向1:1演化。这里所说的是工作负载和系统需求结构的变化,并不意味着CPU与GPU的物理芯片数量或市场价值会机械地变成1:1。它反映的是,当AI从单次模型调用转向执行完整任务,越来越多的计算将发生在模型之外。

不过,分析师提醒,当前CPU市场的高增速中,还有一部分来自历史欠账。过去数年,AI加速器出货量快速增长,配套CPU的部署却相对滞后。随着强化学习和Agent工作负载增加,云厂商和实验室正在集中补齐这一缺口。新增需求与补库存同时发生,因此放大了当前的增长幅度。

但问题在于,补库存不会永久持续。按照分析师在播客中的示例,如果一颗CPU对应两颗GPU,每颗GPU约5万美元、CPU约5000美元,那么每10万美元GPU支出只对应约5000美元CPU支出。CPU的需求弹性可以很高,但其绝对价值量仍难以与AI加速器相比。因此,更准确的判断是,CPU正处于一轮由「新增需求」和「历史欠账」共同推动的阶段性修复,而不是另一个与GPU等量齐观的超级周期。

光互连:CPO的兑现时间仍可能晚于市场预期

随着AI集群规模扩大,网络设备在整套系统中的重要性和价值占比仍会继续上升。但网络需求增长,并不意味着所有光互连技术都会立即进入大规模部署。分析师对共封装光学(CPO)的短期落地持谨慎态度。

CPO将光学器件与交换芯片或计算芯片进行更深度的集成,理论上能够降低功耗、缩短信号传输距离,并提高带宽密度。但这种集成也会带来新的工程问题,包括制造良率、散热、维修难度以及光学与半导体供应链之间的协同。

分析师的判断是,CPO很难在2027年形成大规模部署,真正的规模化爬坡可能要到2028年底,甚至2029年。在此之前,铜缆、背板连接器和传统可插拔光模块仍可能拥有比市场预期更长的商业窗口。

这也说明,AI需求增长并不会平均地转化为每个供应链环节的利润。短缺本身不会自动创造回报,只有同时具备技术门槛、稳定交付能力和定价权的厂商,才能将供需紧张转化为持续收益。

电力约束:不是缺电,而是缺按时可用的电力

数据中心的核心约束是电力供应。据分析师所在机构估算,2026年全球可能新增约20GW的数据中心容量,2027年超过30GW,2028年可能进一步接近50GW。如此大规模的负荷增长,让能源成为AI基础设施最受关注的约束之一。

分析师将能源问题拆分为三个环节:发电:电从哪里来;输电:如何把电送到数据中心;转换:如何把高压交流电转换成芯片能够使用的稳定电力。其中,最难解决的是输电环节。

输电线路和变电设施建设周期长,涉及监管审批、成本分摊、地方电力公司和社区阻力。即使一座电厂能够建成,电也未必能按时送到数据中心。发电端则拥有更多绕行方案。

据分析师所在机构预计,未来几年新增数据中心负荷中,可能有接近一半来自企业建设的表后发电。企业不再等待公共电网扩容,而是在数据中心附近直接部署燃气轮机、燃气发电机或其他现场电源。一些运营商甚至在尝试,将能够大规模量产的卡车、船舶或列车发动机,改造成现场发电机组,由发动机带动发电机发电。数百台设备部署在数据中心周围,由机械维修团队轮班维护。这种方案并不优雅,效率和可靠性也未必最优,但它能够更快上线。

太阳能加储能则代表另一条路径。分析师判断,在部分可靠性要求下,太阳能加电池的综合成本可能在未来两年低于燃气。但如果要应对连续阴雨和更高等级的供电可靠性,所需储能容量和成本也会明显上升。

最激进的方案,是把计算设备送入太空,直接使用太阳能。分析师对此给出的判断具有很强的推演性质:到2030年,太空算力占比可能仍不足1%。只有当地面电网、表后发电和工业供应链都接近极限时,太空数据中心才具备足够的经济性。

因此,能源不是一道完全无法突破的物理上限,但每一种绕行方案都意味着更高的资本投入、建设难度、环境成本与监管争议。

英伟达的战略:需要一个多极的AI市场

分析师在红杉资本的访谈中提出了一个很有意思的判断:英伟达的创始人并不希望AI世界最终只剩下两三家封闭实验室,以及少数几家超大云厂商。

如果模型需求越来越集中在OpenAI、Anthropic、谷歌等头部实验室手中,而谷歌、亚马逊和微软又持续提高自研芯片的比例,英伟达面对的客户将越来越少,少数大客户的议价权则会越来越强。因此,对英伟达而言,更理想的客户结构是存在足够多彼此竞争的模型公司、云厂商和算力运营商。它需要中国开源模型、独立AI实验室、独立算力服务商和企业客户继续存在,也需要更多公司能够在超大云厂之外部署算力。

自研芯片正在加剧这种紧迫感。Anthropic被曝与三星初步讨论2nm定制芯片,项目用途与规格尚未确定;路透社引述知情人士称,DeepSeek正在研发推理芯片;较早时候,OpenAI与博通则已正式发布Jalapeño推理加速器。三者虽进度不同,但共同说明大型模型公司正在提高垂直整合程度,争取对算力供应、成本和技术路线更大的控制权。

不过,自研芯片并不意味着通用GPU会被完全取代。专用芯片适合围绕相对稳定的模型架构和成熟工作负载优化,在规模足够大时降低推理成本;但从设计、流片到大规模部署需要较长周期,而模型架构和训练方法的变化可能更快。因此,更可能出现的格局是:头部公司使用自研芯片承接部分成熟工作负载,同时继续采购通用GPU,用于前沿训练、架构探索和难以提前预测的任务。换句话说,通用GPU的价值不只在于当前性能,也在于为技术路线的不确定性提供保障。

在这一背景下,英伟达对独立实验室和独立算力服务商的扶持,具有更深一层战略意义。Sharon AI是其中一个代表性案例。今年6月,该公司披露与英伟达达成一项为期六年的战略算力合作,计划在澳大利亚新增72MW数据中心容量,并分批部署最多4万张GB300。协议最高合同价值为48.8亿美元,并采用收入分成和信用支持机制,这使Sharon AI能以更轻资本的方式扩张,英伟达则获得硬件收入和相关云服务收入分成。

但这并非没有代价。当英伟达通过信用支持推动客户部署GPU,它不仅承担制造和销售风险,也会间接暴露于客户信用、GPU利用率和设备残值变化中。所以,「英伟达需要一个多极世界」并不意味着它在无条件扶持产业生态。更准确地说,维持足够多有能力购买和运营GPU的客户,本身就是英伟达保护市场规模和议价能力的一部分。

追赶AI前沿的三大核心资源:数据、人才与算力

行业分析机构曾在相关报告中提出一套相对简洁的框架:造出前沿模型需要同时拥有数据、人才和算力。三者不是可以独立累加的要素,任何一项明显不足,或者三者无法协同,最终都会成为模型能力的上限。按照这一标准,Meta是目前少数可能同时补齐三块拼图的公司。

不过,“拥有资源”与“追上前沿”仍是两回事。真正的考验在于,一家公司能否通过组织、工程和研究体系,把这三种资源持续转化为模型能力。

数据:强化学习正在创造新的数据供应链

随着模型训练重心从大规模预训练转向后训练和强化学习,数据的定义也在发生变化。过去,数据主要意味着互联网文本。现在,更稀缺的是高质量任务、可交互环境、工具链,以及能够判断结果是否正确的验证器。

一个编程Agent需要代码仓库、测试环境和单元测试;一个金融Agent需要表格、真实工作流程和清晰的结果标准;一个通用办公Agent,则需要接近真实白领工作的操作轨迹。围绕这些需求,一条新的人类数据和强化学习环境供应链正在形成。据分析师所在机构估算,Mercor、Surge、Handshake等数据服务商的年化收入均突破10亿美元;Fleet、Mechanize、Afterquery等成立时间不长的公司也在快速增长。

Meta的特殊之处在于,它本身就拥有庞大的工程、广告、法务、财务和运营团队,理论上能够从内部工作流中提取大量接近真实经济活动的任务,而不必完全依赖外部数据供应商。今年4月,Meta上线了一套内部工具,尝试记录员工屏幕、键盘与鼠标轨迹,用于训练面向白领工作的通用Agent。但上线仅两个月后,便因内部反弹与敏感信息外泄而被暂停。

与此同时,Meta还在组织层面进行调整,将约3000名工程师转岗全职构建RL任务与环境。作为对照,数据公司Mercor二季度全平台记录了251.7万个专家工时,相当于4800人每周工作40小时。如果将Meta的3000名工程师按满季度、每周40小时粗略计算,对应约156万个理论工时,相当于Mercor二季度专家工时的约62%。两组数据在任务类型、工作效率和质量标准上虽不能直接比较,但这一量级足以说明,Meta正尝试把内部工程组织变成一座大规模的RL任务与环境工厂。

人才:前沿能力仍集中在少数团队

模型论文和工程方法正在快速扩散,真正能够组织大规模训练、设计强化学习系统,并解决复杂基础设施问题的人才,却仍集中在少数实验室。过去一年,OpenAI、Anthropic和谷歌DeepMind围绕顶级研究人员和工程师展开了激烈争夺。高额薪酬只是表象,更深层的竞争在于,研究人员能够获得多少算力、什么质量的数据,以及多大的实验自主权。

Meta拥有充足的资金实力,也愿意通过组织重建和高额投入来补齐人才短板。但人才迁移并不会立刻转化为模型能力,新的团队仍需要时间形成稳定的研究文化和工程协作方式。

算力:Meta正把数据中心变成模型能力的一部分

与依赖外部云厂商的模型公司相比,Meta拥有更强的资产负债表,也不需要在内部模型训练与外部云客户之间分配算力。据分析师所在机构预计,到2026年底,Meta的内部AI算力可能超过OpenAI和Anthropic。

为了支撑这一目标,Meta正在同时建设5座1GW以上的“泰坦级集群”,包括俄亥俄州的Prometheus、路易斯安那州的Hyperion,以及位于得州、爱荷华和印第安纳的其他园区。其中,Prometheus并不是一座单体数据中心,而是由6个园区、27座数据中心共同组成。其中5个园区相距不超过6公里,另一个园区则距离主体约75至80公里。

Meta计划通过AI-Backbone网络连接这些站点,在突破单点供电和散热上限的同时,还要处理跨园区通信带来的带宽和延迟问题。届时,前沿模型训练将从单个数据中心内部,变成横跨多个园区、能源系统和光纤网络的系统工程。

但算力领先不等于模型领先。分析师所在机构也指出,Meta当前公开模型在多项指标上仍落后于部分开源模型。Meta拥有追赶前沿所需的资源,但仍需要证明,它能把内部数据转化为有效训练环境,把新引进的人才组织成稳定团队,再把庞大的算力转化为持续的模型进步。

算力缺口:可变现需求增长远超算力供给

既然全球每年都在新增大量数据中心,为什么算力仍然紧缺?问题在于,模型能力扩大可承接经济任务的速度,目前仍快于新算力上线的速度。

Anthropic是这个机制最清晰的样本之一。需要说明的是,下述数据主要来自分析师对Anthropic未公开财务的估算,而非公司经审计披露。据分析师估算,Claude Code的增长推动Anthropic年化经常性收入从2025年底约90亿美元升至2026年中超过600亿美元;约八成收入来自按token使用量计费的API,消费者订阅占比偏低。

分析师同时估算,Anthropic部分API业务的毛利率超过80%;公司在第二季度剔除股权激励后已实现盈利,并可能在第三季度实现超10亿美元的GAAP息税前利润。尽管这些数字不足以证明所有AI公司都找到了盈利模式,但至少说明少数头部实验室已经具备为算力支付溢价的能力。

分析师在播客中给出过一个直观推演:如果一项API业务原本拥有约75%的毛利率,即使算力成本翻倍,毛利率仍可能维持在约50%。对这样的公司而言,新增一张GPU,不只是增加一项资本开支,而是获得一项能够迅速转化为付费token的生产资料——只要新增算力可以被立刻用于推理,并以较高毛利售出,头部实验室就有动力继续竞价购买算力。

据分析师所在机构预测,到2030年,Anthropic与OpenAI合计的未受限算力需求可能超过100GW,而两家公司当前可用算力合计仅略高于6GW。在不考虑供给和资本约束的情况下,头部实验室希望部署的算力规模,仍远高于当前实际拥有规模。

竞争的核心早已超出模型本身

回顾整个分析框架,模型能力只是竞争的起点。它能否转化为真正的竞争优势,还取决于成本下降能否释放足够多的付费需求、稀缺资源能否按时交付,以及新增算力能否产生足够高的回报。

这也是为什么,过去两年被反复讨论的「谁的模型更强」,正进一步扩展为一组更复杂、也更难被追赶的能力:谁能持续把电力、芯片、内存、网络、数据和工程能力,转化为更便宜、更稳定,也更有经济价值的token。

以上内容不代表本平台立场,仅供读者参考