曙光8000十万卡AI超集群:中国算力标准新标杆

近年来,面对芯片断供、生态封锁与技术围堵,中国AI基础设施在窄径中披荆斩棘,从追赶到并跑,从万卡级迈向十万卡集群,从能用国产芯片到敢用国产芯片,一步步趟出了破局之路。7月10日,在光合组织智能计算应用大会上,中科曙光正式宣布,采用原生超智融合技术路线的首个全国产十万卡AI超集群曙光8000(登峰)正式落成。更值得关注的是,集群落成首日,北京科学智能研究院便与曙光签署战略合作协议,启动第二套全国产十万卡系统的研制工作。
外界大多关注首套十万卡集群落成的技术突破,但真正具有产业意义的信号,是这套系统所具备的可复制工程能力。如果说第一套集群落成验证了技术成熟度,那么第二套系统的启动则验证了产业认可度,这标志着十万卡算力正加速迈入规模化应用的新阶段。率先跑通这条路径的曙光,正在为新一代AI基础设施写下中国标准。
十万卡算力绝非简单堆叠 系统工程才是核心壁垒
很多人惯性认为十万卡集群就是一万卡乘以十,但实际上,当算力规模提升一个数量级,网络、散热、存储、调度的复杂度会呈指数级增长,任何一个环节的短板,都可能让十万张算力卡变成一堆废铁。曙光8000的核心突破,恰恰在于将十万卡算力从“手艺活”转化为标准化的工程学方法论。
该集群采用原生超智融合技术路线,从芯片、硬件、集群到调度系统实现一体化设计,支持从FP64双精度到INT8低精度的全谱系计算,一套算力底座可以同时承载科学研究、大模型训练、AI推理、工业仿真等多种场景,打破了传统分区部署的局限,实现真正的原生融合。
为了驾驭超大规模算力的复杂度,曙光8000搭建了四大核心工程支柱:
第一是稳定可靠的网络架构,搭载国内首款类InfiniBand原生RDMA芯片,从底层SerDes IP到交换机实现全链路自研,通过信用流控实现零丢包,支持毫秒级故障恢复,哪怕单子网承载十万卡算力,也不会随规模扩大出现通信拥堵或中断;
第二是突破物理极限的散热方案,单机柜功率突破MW级,传统风冷方案已无法满足需求,曙光采用浸没式相变液冷技术搭配金刚石铜合金界面导热,全年可利用自然冷却,PUE值稳定控制在1.04,无需依赖压缩机,也无需特殊选址,可在任意城市部署;
第三是高效不闲置的存储系统,通过ParaStor存储方案拿下2026全球IO500生产型双榜第一,将被动的存储仓库转变为主动的数据供给线,十万卡级并发算力不再等待数据加载,彻底解决了存储瓶颈;
第四是智能可控的调度系统,针对175B级大模型训练、上千张卡连轴转57天、遭遇105次节点故障的复杂场景,Gridview7.0采用双智能体架构实现科研运维全自动化,让十万卡集群的管理难度与万卡集群保持一致。
这四项技术单点来看是各自领域的突破,组合起来则是一套完整的系统工程方案:网络可以适配不同规模的算力需求,散热方案无需特殊选址即可部署,存储可以随节点数量灵活扩容,调度系统可以覆盖多类应用场景。每一个关键环节都并非为单一项目定制,而是从设计之初就按照可复制、可交付的标准进行打造。
这正是方法论与工程能力的质变。曙光8000真正验证的,是一套覆盖芯片、计算、存储、网络、散热到应用、服务七大维度的系统级方案,它将十万卡算力从“手艺活”转变为标准化的工程实践,实现了从“能建成”到“能复制”的跨越。
规模是核心门槛 应用才是价值最终落点
算力集群的价值从来不是纸面的峰值参数,而是实际的应用产出。过去几年,行业内不乏追求算力规模竞赛的玩家,但不少集群存在“建而不用、用而不优”的问题,算力的真实价值最终要体现在科研突破与产业成果上,而非单纯的基准测试跑分。
曙光8000的亮眼之处正在于其实际应用价值。据统计,该集群已完成300余项应用优化,覆盖材料科学、生命科学、流体力学、气象预测、量子计算等二十余个行业领域,超过70个应用实现万卡级规模扩展,部分任务达到戈登贝尔奖量级。
在实际科研场景中,该集群实现了多项突破性成果:材料科学领域,9万张卡协同完成3.16万亿个原子的DFT高精度仿真;生命科学领域,8万张卡加速蛋白质折叠全流程模拟,直接服务新药研发;工程仿真领域,8.8万张卡完成328万亿网格湍流直接模拟,支撑航空、船舶等高端制造;能源勘探领域,地震成像核心算法完成国产化平台移植,适配中石油BGP油气勘探项目;量子计算领域,8万张卡完成152自旋轨道FeMoco团簇基态能量高精度计算。这些并非实验室里的跑分数据,而是正在转化为实际生产力的算力成果。
更关键的突破在于,曙光通过OneScience平台将科学大模型的开发周期从天级缩短至小时级,科研人员只需用自然语言描述需求,平台即可自动完成环境适配、代码生成到作业提交的全链路流程,让十万卡级算力从少数团队的专属工具,变为科研人员触手可及的标配资源。
当算力门槛大幅降低,生态便越过了临界点:在此之前,是平台主动寻求应用适配;在此之后,是应用主动涌向平台,形成“越用越好用、越好用越多人用”的正向循环。
率先完成闭环 掌握赛道规则话语权
当应用跑通、生态转起来,另一个核心问题随之而来:十万卡算力赛道的规则将由谁来制定?每一代新基建的更迭,都会诞生新的规则制定者,在十万卡这条赛道上,谁率先完成“建设→交付→复制”的完整闭环,谁就能掌握定义超大规模算力基础设施的话语权,这是产业发展的客观规律,不以个体意志为转移。
目前,曙光已经率先完成了这个闭环:第一套集群验证了技术成熟度,第二套集群的启动则验证了产业认可度。当其他玩家还在讨论是否要建设十万卡集群时,先发者已经在交付第二套系统、规划第三套方案。全链路自研、超智融合架构、十万卡规模落地,这三件事结合在一起,让曙光8000从一家企业的定制方案,转变为全行业可参考的公共标准。
单点技术可以通过对标实现赶超,但一套覆盖芯片、计算、存储、网络、散热到应用、服务全链条,且经过规模化应用真刀真枪验证过的系统工程,短时间内很难被复制,这正是最坚实的护城河。在全球化AI竞赛的时间窗口不断收窄的当下,先发优势的壁垒一旦形成,后来者将面临难以撼动的降维打击。先定义标准的企业,将定义下一代AI基础设施的时代。
当全球AI产业褪去泡沫、转向理性务实的新阶段,中国在十万卡算力赛道上的角色已经实现了历史性翻转:我们不再是跟在身后的追赶者,而是站在了牌桌中央,拥有了直面全球竞争、定义新赛道规则的能力。这份底气并非来自某一项指标的突然反超,而是从芯片到应用、从建设到交付、从能造到量产的整套工程能力,经过千锤百炼后的稳步提升。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

