太初元碁发布HCU架构与超智系统,引领算力系统级竞争

今年的WAIC展会成为国产算力赛道的集中展示场,超200款智算产品、108款芯片齐聚上海,和往年相比,行业的竞争焦点已经发生了显著变化。过去各家企业更侧重单颗芯片的算力峰值、单卡性能,而今年“系统创新”与“高效协同”成为了高频关键词,单卡比拼的时代已经落幕,大规模计算系统的综合性能较量正式开启。
在展会的张江展区,太初(杭州)集成电路有限公司的展位吸引了大量参观者驻足,除了绝佳的地理位置外,一台号称“超智融合”的大型超节点集群,以及刚揭幕的异构众核双模自研芯片,成为了全场焦点。太初元碁CEO杨晋喆表示,算力产业已经从单卡性能比拼进入系统级竞争阶段,这并非客套话。随着大模型参数突破万亿级别,智能体(Agent)和AI4S场景对CPU-GPU协同的要求越来越高,单纯堆叠算力的边际收益正在持续递减,降低单位算力成本才是当前行业的核心命题。
这样的判断和整个行业的演进方向一致。本届WAIC上,多家头部企业都推出了超节点方案,比如华为展出Atlas 950 SuperPoD超节点,沐曦发布“曦景”S系列超节点,阿里平头哥也推出了真武M890×磐久AL128超节点。据行业观察的研报指出,国产超节点已经迎来量产元年,算力竞争的范式正在从单点峰值性能转向全栈系统级效率的比拼。
太初元碁给出的技术解决方案是HCU异构融合计算架构。其核心思路是将CPU和AI算力核集成在同一条高速总线上,支持M:N的可重构配比——CPU负责Agent调度和数据预处理,XPA算力阵列则专注大模型推理计算,再配合共享分级存储实现冷热数据的动态调度。用通俗的话来说,就是一颗芯片里集成了两类核心单元,一类负责调度协调,一类负责高强度计算,并且可以根据实际负载按需调配两者的比例,避免出现资源浪费情况,让算力分配更加精准匹配业务需求。
这一设计其实是提前响应了Agentic AI时代的算力需求变化。传统的AI训练和推理集群通常采用“单路CPU搭配4至8颗GPU”的固定配置,CPU长期作为算力宿主,仅负责任务下发、数据调度和GPU资源托管。而进入Agent智能体时代后,智能体需要自主完成任务拆解、工作流编排、外部工具调用、长期记忆管理的全闭环运行,CPU在规划、决策、交互类通用计算中的算力权重和负载占比出现了结构性的显著提升。AMD CEO苏姿丰在2026年Q1财报电话会上透露,单个计算节点中CPU与GPU的数量正从过去的一对多逐步趋近一比一,未来甚至可能出现CPU数量多于GPU的情况。阿里云的判断也与之类似,Agent的“有状态调度+无状态执行”混合模式,对资源的精细化管控提出了更高要求,算力系统的优化重心已经从单卡峰值性能转向CPU-GPU的高效协同。
基于HCU架构,太初元碁推出了新一代国产自研AI芯片T2 Ultra,其最大的亮点就是双模设计。这款芯片拥有两种工作模式:在自主计算模式下,它可以独立承担完整的计算任务;在加速模式下,则可以配合主机协同工作。这意味着同一颗芯片,既可以作为独立算力节点部署在边缘或者中小规模场景中,也可以作为加速卡插入大型集群中充当算力引擎,极大提升了硬件的适配灵活性。
从性能参数来看,T2 Ultra的HPC算力(FP64)达到38 TFLOPS,可以满足科学计算需求;FP4稀疏算力高达4800 TFLOPS,FP16稀疏算力为1200 TFLOPS,可以覆盖各类AI训练和推理场景,并且原生支持FP64到FP4的全精度覆盖。对于客户来说,这种灵活性的实际价值在于无需为不同场景采购不同硬件,一套芯片体系就能覆盖多种部署需求,有效降低采购和运维成本。
在当前国产AI芯片普遍面临“量产难、落地更难”的行业环境下,能够让客户用得上、用得起,比纸面参数更加重要。如果说T2 Ultra是算力系统的“心脏”,那么元碁HyperIntelliX超智融合计算系统就是整个“身体”,这款平台定位为面向AI+AI4S的全国产智算+超算融合计算平台。
值得注意的是,HyperIntelliX不仅可以运行大模型,还能在AI4S领域发挥重要价值。太初元碁在展会期间同步披露了相关落地成果,包括全球气象预测可视化系统、TecoQSim量子经典模拟器、大规模虚拟药物筛选,覆盖气象、量子计算、生物医药三个核心方向。目前多数国产AI芯片还停留在“跑通大模型推理”的阶段,能够同时支撑AI和AI4S双线任务的平台并不多见。
AI4S(AI for Science)对算力的需求和纯AI推理有很大不同,科学计算通常需要高并发、大吞吐、长时任务,并且对双精度计算能力有硬性要求。太初元碁的团队拥有三次获得高性能计算领域国际最高奖项“戈登·贝尔奖”的积淀,在超算领域的深厚经验为其切入AI4S赛道提供了坚实的技术底气。
硬件再好,也需要实际落地才能从“可用”走向“好用”。太初元碁在本届WAIC期间发布了两款生态产品,直指国产芯片最头疼的“迁移成本”问题。其中人工智能开发者社区2.0已经完成了对Megatron-LM、DeepSpeed、飞桨PaddleHelix、PyTorch、vLLM等主流训练与推理框架的适配,提供了从模型分析、迁移、算子开发到性能优化、精度调试的全流程工具链。
新一代国产AI4S计算平台则针对科学计算高并发、大吞吐、长时任务的特点做了专项优化,这是一款自主研发的一站式科研创新平台,面向气象预测、生物医药、量子力学、化学材料、流体力学等前沿科学领域,全面兼容龙芯、申威、飞腾、x86等国内外主流CPU,提供自研编程模型和涵盖通用算子与科学计算专用加速库。同时,该平台深度适配PyTorch、JAX、飞桨、MindSpore等主流框架,并配套DevKit开发套件,支持算子生成、编译优化与性能分析,有效降低了算子开发门槛和性能调优难度。
依托平台的软硬协同全栈能力,太初元碁已经和清华大学、湖南大学、山东大学、百度、东润等多家高校和行业伙伴展开深度合作,在气象预报、量子模拟、基因分析、材料仿真、流体计算等领域打造了一系列高效精准的科研解决方案,助力科研和产业级科学计算高效落地,真正实现以中国芯解决科学难题。太初元碁的核心逻辑非常清晰:芯片只是入场券,生态才是真正的护城河。
这一判断切中了国产芯片的共性痛点。当前主流框架和算子库深度绑定CUDA生态,模型向国产算力迁移的流程复杂、开发成本高、周期长。据行业调研数据显示,完整的适配周期大约需要3-6个月,其中约60%的工作量集中在性能调优阶段。目前国产芯片的生态建设主要分为两大路线:一条是主打GPGPU路线,追求与英伟达的CUDA兼容,比如寒武纪通过自研Bangware软件栈实现CUDA兼容,将迁移成本降低约70%;另一条是以华为MindSpore为代表的自主生态路线,试图在英伟达生态圈之外建立独立的生态体系。太初元碁的路线更接近前者,通过多元化开发范式支持PyTorch、vLLM等主流框架快速迁移,能够满足80%-90%的主流场景适配需求。
进一步梳理太初元碁在国产化生态搭建方面的长期尝试,可以发现无论是公开信息显示的累计超40款AI大模型的即发即适配,还是联合百余所高校、科研机构、企业推动算力落地的具体实践,都在持续加码生态扩容。比如和清华大学联合研发Teco-QSim量子经典模拟器;携手量旋科技打造“量子-超算-智算”超智融合平台;率先完成清醒异RiverONE模型适配及龙芯平台验证;为清华大学智能产业研究院AtomWorld原子世界模型提供512节点全液冷架构的硬件基础;与百度螺旋桨、神威数智团队成功复现AlphaFold3模型;联合湖南大学发布首个显式建模DNA双链动态交互的基因组语言模型CrossDNA;与山东大学高性能计算团队完成分子对接方法优化,构建大规模药物筛选全流程方案;联合百度飞桨为百家企业提供AI for Science端到端方案;联合百度科学计算团队打造国产气象一体机,支持逐时动态推演与台风路径轨迹精准识别;与东润环能达成战略合作,实现训练吞吐与推理QPS的双提升;深度适配上海人工智能实验室的书生Intern-S1 AI4S多模态大模型,并联合开展AI4S生态赛事等等。
在本届WAIC上,由河南空港智算中心、瑞莱智慧、太初元碁、安势信息、清源智契、典枢科技、数安信七家单位联合打造的全域大模型安全系统也正式发布。瑞莱智慧CTO徐世真现场拆解了整套框架:底层是国产可信算力底座,核心是一体化大模型安全评测治理平台,上层构建大模型安全测评、数据合规、数据安全、软件供应链安全等多种安全系统,顶层配套独立AI安全教育实训中心。这套系统看起来像是“补丁式”的安全附件,但在当前的行业语境下,它可能是整场发布中最务实的一环。当前大模型正在加速进入政务、金融、医疗等敏感领域,安全问题已经不是“要不要做”的选择题,而是“不做就没法落地”的硬性门槛。
将太初元碁的发布放在整个国产芯片版图中来看,会更加清晰。目前华为昇腾950PR已经量产,FP4精度算力达1.56PFLOPS,2026年出货目标上调至150-200万颗;寒武纪思元590在DeepSeek推理场景中的效率已经超越H20,2025年全年营收64.97亿元,同比增长453%;沐曦股份登陆科创板,市值一度突破2800亿元;海光信息深算DCU已经与365款主流大模型适配。和这些企业相比,太初元碁的差异化在于,它想要做的不是某一颗芯片的替代者,而是一整套AI基础设施的构建者。从底层HCU架构支撑的T2 Ultra芯片与HyperIntelliX系统,到中层开发者社区2.0与AI4S计算平台,再到上层七家联合的全域大模型安全体系,这三层架构并不是简单的叠加,而是相互支撑的完整体系。
当然,太初元碁面临的挑战也同样明显:当前国产AI芯片市场正在从“政策驱动”向“市场驱动”深层转型,头部3-5家企业占据80%以上份额的洗牌窗口即将开启。对于太初元碁而言,能否在万卡集群、十万卡集群的规模化部署中证明系统稳定性,能否在生态迁移成本上持续降低开发者门槛,将是决定其能否从“可用”走向“好用”的关键。
国产算力走到今天,早已过了靠单点参数刷存在感的阶段,真正的较量是体系化能力与生态协同效率的综合比拼。本届WAIC的展台已经清晰地传递出这一信号:各家企业比拼的不再是“我有多强”,而是“我的系统有多完整”、“我能不能落地更多场景”。毕竟,只有真正走完产业闭环落地,企业才能在未来的竞争中存活下来。


