集齐四家头部基模,无问芯穹凭什么成AI Infra新基建?

近期的行业动态中,一个颇具代表性的细节引发关注:在不久前的WAIC论坛上,两家国产头部大模型厂商先后亮相同一场AI基础设施主题论坛——MiniMax参与了战略合作签约,而阶跃星辰则带来了主旨演讲。
其实这种合作的苗头更早便已显现:四个月前的中关村论坛上,智谱AI的张鹏与Kimi的杨植麟就曾与这家AI Infra公司的联合创始人兼CEO同台参与圆桌讨论,现场更是明确提及该公司已为Kimi、智谱提供算力服务支持。
截至目前,国内四家顶尖的基础大模型厂商,都已经与这家公司达成了深度合作,按照行业玩笑的说法,集齐这四家合作方,几乎相当于在大模型赛道上“召唤神龙”。
这家AI Infra公司,正是无问芯穹。
它的行业定位颇像电池领域的宁德时代:尽管各家车企可以独立研发、各自精进,但核心的电池供应环节,却是多数玩家无法绕过的关键赛道。无问芯穹想要成为大模型时代所有厂商的共同选择。
那么,这些头部大模型厂商究竟看中了无问芯穹的哪些核心价值?答案需要从行业供需两端的矛盾中寻找。
从需求端来看,行业数据显示2026年大模型推理的算力消耗将首次反超训练,成为AI算力的主要消耗场景。尽管推理成本在两年间下降了280倍,但国内企业的AI总支出却不降反升;当前我国日均Token调用量已突破140万亿,同比增长四成,整体需求呈现指数级增长态势。
而供给端的现状却截然不同:物理算力的扩产依然遵循线性逻辑,通过新增机房、采购显卡的方式很难快速填补缺口,业内普遍认为算力缺口在未来三到五年内都难以完全填平。
一边是指数级膨胀的需求,一边是线性爬坡的供给,两者之间的落差,正是无问芯穹想要切入的核心赛道。
更棘手的是,大模型部署的质量往往难以被外界直观判断:一个看似正常的请求回复背后,模型的输出精度可能已经悄悄下滑了三成,而这类问题常规的监控系统根本无法察觉。
等到用户在实际业务中发现异常时,模型的品牌口碑往往已经受到了不可逆的损害。这道看不见的隐形门槛,才是决定哪些供应商能够留在赛道牌桌上的关键因素。
为什么国内头部大模型厂商都选择了无问芯穹?
随着Token经济的全面爆发,大模型的推理需求持续加速,算力缺口也在不断扩大,而MaaS(模型即服务)赛道的门槛,其实远比外界想象的要高。
四家头部厂商之所以纷纷选择无问芯穹,本质上都是围绕三个核心维度做出的决策:模型效果是否会受损、部署成本是否可控、服务稳定性是否有保障。
首先是模型效果保障。前文提到的精度隐蔽下滑问题,是整个大模型部署行业最棘手的痛点之一。
行业中不乏第三方服务商部署模型后,最终输出精度比原厂标准下降30%的案例,而客户往往直到业务指标出现明显下滑时,才会意识到问题所在。
无问芯穹针对这一问题建立了一套严格的模型准入测试标准:从工具调用的一致性到推理模式的精度对齐,所有维度都需要逐项核验,每一款新模型上架前都必须通过这道严格的关卡。
最终的结果是,用户通过无问芯穹的服务调用模型,和直接使用原厂API的体验几乎没有任何差别。
其次是部署成本优化。在今年的WAIC论坛上,无问芯穹正式发布了一项自研的硬核技术:跨集群异构PD分离架构。
大模型推理过程中的Prefill和Decode是两个负载特性完全不同的阶段,对硬件的需求也存在显著差异,将两个阶段拆分部署,可以让不同类型的芯片各自发挥最优性能。但将流程拆分到不同机房后,又会遇到新的挑战:PD分离后需要通过广域网以太网在异构芯片间传输KV Cache,面临带宽不足、延迟过高的问题,就像两名优秀的接力选手在交接棒时出现失误。
为解决这一问题,无问芯穹首先将Decode实例设计的Radix Cache技术创新性迁移到跨集群架构中,将传输的数据量直接降低了一个数量级;随后又首创了PDD架构,将传统的PD链路拆分为P、RelayDecode、MainDecode三级。
当遇到传输延迟较高的请求时,RelayDecode会先承接任务并向用户返回Token,用户完全感知不到长达数十秒的传输延迟,待数据传输完成后,再无缝切换到MainDecode接手处理。实测数据显示,该架构可将首Token延迟(TTFT)降低51.5%,同时单Token成本降低37.5%。
最后是服务稳定性保障。随着集群规模扩大,算力故障往往更加隐蔽难以察觉。大模型推理需要管理数十上百个集群,承接全国每日上TB级别的流量分发,一旦服务器宕机,依靠人工监控根本无法及时响应。
无问芯穹推出的“智算集群运维智能体系统”,可以端到端解决实际生产场景中的运维难题,实现7×24小时全天候值守,将智算集群的运维从“人找问题”转变为“问题找人”乃至“问题自动解决”。该系统可实现运维人效提升5倍以上,关键故障处理效率提升6倍。
前店后厂一中心:构建完整的系统竞争力
上述效果、成本、稳定性三个维度的优化,仅仅是构成Token工厂层的基础。无问芯穹真正的核心价值,是将算力、Token、生产力串联成一个完整的系统,对应其提出的AI生产力公式:
AI生产力 = 智能资源规模 × Token转化效率 × AI生产力转化效率。
所谓“一中心”,指的是「算力集散中心」,也就是Agentic Infra自主式基础设施平台。针对国产芯片生态天然碎片化的现状,无问芯穹将散落各处的算力资源统一汇聚、实现弹性调度和按需利用,为模型与应用层筑牢充足、稳定且可扩展的算力底座,核心目标是实现智能资源规模最大化。
目前该算力集散中心已部署触达37000P算力,覆盖接入16种主流芯片。
跨集群强化学习的技术难题,正是在这一层被攻克的。无问芯穹认为,在Post-training的Scaling Law持续发展的当下,强化学习成为解锁智能的关键。其算力需求的硬件种类更加复杂、规模量级更加庞大,基于异构和超大算力规模的双重刚需,跨集群强化学习成为智能规模化及持续进化的新锚点,也是无问芯穹Agentic Infra平台重点布局的核心场景。
无问芯穹将网络、平台、框架三层优化贯穿始终,成功实现跨域强化学习训练连续一周0中断稳定运行,让大规模跨域强化学习不仅可以“跑得通”,更能“跑得快、跑得稳”。未来,公司还将针对并行策略、通信融合、智能算子、极致容错等核心技术持续深耕,将跨域计算资源的支撑规模拓展至十万卡级以上。
所谓“后厂”,也就是「Token工厂」,即Agentic MaaS大模型服务平台。这是前文提到的效果、成本、稳定性三重优势的最终落地场景,核心思路是“在规模之上向效率要产能”,拥有一套从网关、路由到底层推理实例的完整服务技术栈,实现“层层可优化、处处有增量”。
在这个“Token工厂”中,除了前文提到的跨集群异构PD分离架构,无问芯穹还与多家头部大模型厂商深度合作,在真实业务场景中持续打磨推理效率和服务稳定性,业务规模的扩张反过来又推动技术迭代加速。
截至今年7月,无问芯穹Agentic MaaS平台的日均Token调用量,较去年12月增长了40倍。公司还与上海移动联合打造了“天问”模型服务门户,与观猹合作推出面向开发者的「TokenDance」平台,对标OpenRouter。
所谓“前店”,则是将技术能力覆盖千行百业的「AI生产力商店」,也就是Agentic Infra行业解决方案。目前这套解决方案已覆盖文娱游戏、医疗健康、法律终端、能源电力等多个领域,将技术势能转化为各行业可用、好用且可复用的落地价值。
比如,与VAST合作推出3D游戏解决方案,帮助上海瑞金医院探索医疗大模型落地场景,为多家律所打造AI合伙人产品,还在与南方电网合作研发智算中心能耗预测系统。
在支撑千行百业智能升级的同时,无问芯穹也将智能体能力应用到AI Infra自身建设中,打造了一套基础设施智能体蜂群,目前已包含三个核心模块:
- 面向用户的平台管家智能体系统:可独立解决80%的日常问题,剩余20%的深度问题转交对应垂类Agent处理;
- 面向集群的运维智能体系统:实现运维模式从“人找问题”到“问题找人”再到“问题自动解决”的转变,可提升运维人效5倍以上,关键故障处理效率提升6倍;
- 面向芯片的算子生成智能体系统:可在真实编译试错与知识沉淀中持续自迭代,稳定交付可直接落地的高质量工业级算子。在GLM 5.2模型的实测中,该系统在NVIDIA旗舰卡中实现了端到端7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升。
前店、后厂与一中心三者相互联动:前店在各行业积累的经验,会反向优化后厂的推理策略和一中心的调度逻辑,形成完整的正向循环。
Token只是赛道入口,而非终极目标
如果仅将无问芯穹理解为一家售卖Token的公司,就会忽略其完整的商业模式布局。“Token工厂”仅仅是赛道入口,公司真正在推进的,是面向Agent时代的「前店后厂一中心」完整Agentic Infra战略布局。
这些业务方向共同构成了无问芯穹想要讲述的完整行业故事。而前文提到的多家深度合作方,正是这套战略最直接的佐证。
将目光投向海外市场,无问芯穹的对标企业包括Baseten、Together AI、Fireworks AI,这些公司的估值区间普遍在130亿到150亿美元之间。但与这些依赖英伟达单一生态的海外企业不同,无问芯穹面对的是远比海外更加碎片化的国产芯片生态,因此将多元异构算力支持和更完整的架构布局,打造为了自身的核心护城河。
回到最初的问题:为什么这些头部大模型厂商都选择在基础设施层与无问芯穹合作?答案其实并不复杂:同时做到懂算力、懂模型结构、懂训推优化、懂应用场景,正是这条赛道上真正稀缺的核心能力。


