AI算力军备竞赛:巨头与硬件商联手建数据中心

当前全球AI行业正迎来算力竞赛的爆发期,为了支撑大模型的训练与部署,各头部企业的数据中心建设计划已经达到前所未有的规模。
近期两大重磅合作相继落地,先是Anthropic与AMD达成深度绑定,双方签署的协议约定,Anthropic将采购最高2吉瓦的AMD顶级GPU算力,而AMD则会向Anthropic投入最高50亿美元的资金支持,这套硬件设备计划在2027年于尚未敲定选址的数据中心中正式投入使用。
作为AI领域的领头羊,OpenAI也在加速算力基础设施的布局。该公司先是宣布将在佐治亚州东南部建设一座总容量3.2吉瓦的数据中心,预计2028年正式上线。与过往项目不同,这次OpenAI将全权主导项目的设计与融资工作,以此加快建设进度并压缩总成本。为了符合当地的建筑激励政策,OpenAI预计仅项目本体就需要投入至少200亿美元,再加上额外的100亿美元建设成本,这还未包含GPU与其他硬件设备的采购支出。
除此之外,OpenAI还计划在俄亥俄州南部动工建设规模更大的10吉瓦数据中心,这将成为该公司迄今最大的算力基础设施项目。为了抵消最高5000亿美元的建设债务,OpenAI正考虑让Nvidia为其中2500亿美元的债务提供担保,作为交换条件,OpenAI将采购Nvidia的芯片产品并提供其他合作条款。截至当前,OpenAI上一轮融资的估值为8520亿美元,而Nvidia的市值约为4.792万亿美元。
OpenAI的算力战略副总裁Sachin Katti表示,公司正在开发一套通用化、节能且资源利用率高的数据中心设计方案,未来会将其作为开源标准对外发布,这一思路类似于Meta在2011年推出的Open Compute Project。据相关行业媒体披露,AMD与Anthropic也计划将合作延伸至未来的数据中心建设环节,采用与OpenAI和Nvidia类似的金融安排,由AMD为部分建设债务提供担保以抵消成本压力。
行业背后的多重压力
这类大额合作的背后,是AI企业普遍面临的算力争夺压力,同时各家公司都希望将数据中心的支出剥离出资产负债表,以此向IPO投资者展现更高的未来利润空间与更低的未来负债水平。数据中心建设虽然具备长期盈利潜力,但同时也会带来高额的负债压力。再加上当前高利率的市场环境,为数据中心及其内部算力设备融资的成本正在不断上升。除此之外,AI企业还需要应对来自公众的反对声音,随着能源成本持续上涨,社会对于数据中心的建设与扩张的态度正在转向负面。
本周Meta以7.5%的利率发行了125.5亿美元的债券,用于在得克萨斯州西部建设新的数据中心项目,这一利率比美国10年期国债高出2.875个百分点,同时也比Meta近期在路易斯安那州的同类数据中心项目的融资利率高出0.5个百分点。
电力供需的严峻挑战
根据BloombergNEF的预测,到2035年,美国数据中心的用电需求将攀升至194吉瓦,约占全国总电力消耗的20%,而当前这一数字为56.1吉瓦,仅占全国电力的5.9%。即便部署现场燃气发电机,BloombergNEF预计美国数据中心的总电力容量仍将存在19吉瓦的缺口。
节能技术的探索与突破
行业正在积极探索新型的数据中心设计来降低能耗与成本。其中Nvidia计划采用1兆瓦的能源转换侧挂装置,直接连接至服务器机架。这种设计可以减少将电网高压交流电逐步降压转换为芯片所需低压直流电过程中产生的多轮能量损耗,预计能将电力传输效率提升20%。与传统方案将34500伏的电网电力逐步降至415伏交流电来为50千瓦的机架供电不同,搭载侧挂装置的服务器机架可以将功率提升至500千瓦,直接采用800伏直流电供电,而这一电压标准恰好也是大多数可再生能源发电的输出电压与电流。
算力短缺的现实与行业逻辑
尽管各企业都在大手笔建设数据中心,但当前的算力供应仍然无法满足行业需求。算力的充足与否,直接决定了哪些大模型能够被设计、训练并最终部署上线。OpenAI总裁Greg Brockman在上周的一场圆桌讨论中坦言,目前团队不得不在训练哪些模型、拓展哪些产品方面做出艰难的决策,他同时补充道,当前的算力紧张局面在短期内并不会得到缓解。
从本质上来看,AI技术的发展离不开基础设施的支撑,而这类突破性的技术更是需要超大规模的基础设施投入。当前行业内达成的各类合作,既包含财务层面的精巧安排,也涉及与当地社区的政治妥协,但这些合作恰恰反映出从芯片制造商、大模型开发者到普通民众,所有参与者都在承担相应的风险。合作关系能够在一定程度上抵消这些风险,但企业仍然愿意投入如此巨大的资源,核心原因在于AI领域的回报前景足够诱人。


