文章摘要
无问芯穹在今年WAIC展会上公开“前店后厂一中心”完整Agentic Infra战略布局。其算力集散中心整合算力、实现自主运维;Token工厂降低推理成本;AI生产力商店转化行业价值。此外,还公布云边端一体化平台,延伸至具身智能,筑牢智能时代底层地基。

当你调用AI智能体完成代码调试、文档生成时,大概率见过这样的弹窗:「你已达到使用上限,请等待额度重置。」用过Claude Code、Codex的开发者都曾被这句提示打断工作流——刚修复到一半的bug、还没收尾的任务,随着调用额度耗尽彻底停摆。

如今,当你把复杂业务全权交给Agent时,它不仅替你完成任务,更在按Token消耗结算成本。Token俨然成为了智能时代最接近通用货币的资源,而更值得关注的是,过去一年里,单个Token的生产成本被硬生生压低了10倍。

是谁在背后推动这场变革?答案藏在大多数用户从未留意、却每天都在使用的AI基础设施底层。就在今年的WAIC展会上,无问芯穹正式公开了「前店后厂一中心」完整Agentic Infra(自主式智能基础设施)战略布局,这套体系正在重新定义智能时代的算力与服务底盘。

早在2025年,无问芯穹就率先提出了Agentic Infra的概念,短短一年间这个名词已经成为行业热词,但多数厂商的实践仍停留在传统基础设施之上叠加Agent入口的表层改造——当海量并发请求涌入时,这类脆弱的架构很容易因底层算力调度瓶颈直接宕机,根本无法支撑真正的智能体时代。

真正的破局之道,需要从基础设施底层进行全链路重构。今年6月,海外两家云厂商分别发布了面向智能体的自动化研发平台,与无问芯穹隔空呼应了「Agent时代需要怎样的AI基础设施」这一命题:CoreWeave推出的ARIA智能体可以自主分析实验数据、迭代优化模型,完成从算力提供商到算力+AI自动化研发平台的升级;Fireworks AI则发布了Training Agent端到端平台,用户只需描述任务,就能自动完成模型选型、超参扫描、评估部署全流程。

而无问芯穹的解题思路更为彻底:让整座基础设施本身成为一个自主工作的Agent。在他们看来,完整的Agentic Infra需要同时迈过三道核心门槛:全链路覆盖从算力到Token再到生产力的完整链条,通过全栈优化提升系统性能;AI原生,即用AI改造AI基础设施,不仅服务人类用户,更适配智能体这类数字原生用户的需求;全流程覆盖训练、强化学习、推理全环节,兼顾技术优势与行业客户的降本增效需求。

AI生产力 = 智能资源规模 × Token转化效率 × AI生产力转化效率

这个公式中的三个变量,恰好对应「前店后厂一中心」的三大业务板块,并且通过业务闭环形成了正向循环的增长飞轮。

算力集散中心:盘活全域算力资源

智能资源规模的核心,是打破算力的地域与硬件壁垒,将分散的存量算力整合为可调度的统一资源。当前算力需求增长远超供给,单纯依靠采购新卡不仅成本高昂,更无法追赶上业务爆发式增长的速度,盘活现有存量算力才是更务实的出路。

无问芯穹的算力集散中心主要通过两大技术体系实现算力整合:

  • 异构集群跨域训练系统:联合中国电信完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间实现联合训练性能提升165%;联合4个不同代际、不同型号的GPU集群训练70B参数大模型,四集群协同性能提升41%;同时实现本地私有集群与公有云算力的安全互通混训,将整体性能提升68%,解决了企业「自有算力不足、云端资源闲置」的痛点。目前这套系统已在全国部署覆盖超37000P算力,兼容16种主流芯片。
  • 跨集群强化学习优化:强化学习作为当前智能跃迁的核心技术,所需算力规模动辄达到千卡甚至万卡级别,并非所有机房都能独立支撑。无问芯穹从网络、平台到框架全链路优化,将跨域通信效率提升3-4倍,实现通信开销100%全掩盖,搭配故障无感的训练机制,让跨域强化学习训练可以连续运行一周无中断。公司联合创始人兼CEO夏立雪表示,未来将把跨域计算资源支撑规模拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。

仅仅整合算力只是第一步,真正让「一中心」配得上「自主式」定位的,是基础设施的自我运维与优化能力。无问芯穹发布了「基础设施智能体蜂群」解决方案,通过AI实现基础设施的自主管理:

  • 平台管家智能体系统作为统一入口,用户只需自然语言描述需求,比如「查看昨日失败的训练任务」,系统即可自动遍历日志、监控与任务事件,独立解决80%的日常问题,剩余20%的深度问题则会转交对应垂类智能体处理。
  • 智算集群运维智能体系统提供7×24小时全天候值守的运维服务,可端到端完成告警闭环处置,定位根因后直接生成修复方案并支持一键重建。经大规模生产环境验证,这套系统可实现运维人效提升5倍以上,关键故障处理效率提升6倍,不仅为大规模GPU训练与推理提供了稳定保障,更解放了大量运维人力。
  • KernelMind高性能算子生成智能体则通过AI自动生成面向不同芯片的高性能算子,在真实编译试错与知识沉淀中持续自迭代,稳定交付工业级算子。在GLM 5.2模型实测中,KernelMind在NVIDIA旗舰卡中实现端到端7.3%的性能提升,在AMD旗舰卡中更是带来39%的整体性能跃升——而这一工作在过去需要顶尖专家逐行手动优化。

Token工厂:将推理成本压至极致

Token转化效率的核心命题,是实现规模化、高质量的Token生产,将推理成本控制在可落地的范围内。随着Agent技术的普及,AI产业的战场已经从「模型训练」转向「推理服务」,能否在海量调用下控制单Token成本,成为决定企业能否盈利的关键。

模型推理的不同阶段对硬件需求差异巨大:Prefill阶段疯狂消耗算力,Decode阶段则极度依赖通信与低延迟。无问芯穹给出的解决方案是首创的「跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode,PDD)」,将Prefill与Decode两步彻底拆分,分别部署在不同机房、不同厂商的芯片上,让不同硬件发挥各自优势:擅长算力的专注Prefill计算,擅长低延迟输出的专注Decode环节。

针对跨集群KV Cache传输的带宽与延迟瓶颈,无问芯穹通过两项技术创新解决:将原本用于Decode实例重复前缀存储去重的Decode Radix Cache技术迁移至跨集群架构,将传输数据量降低一个数量级;首创PDD三级分离架构,当跨集群传输需要数十秒时,由少量RelayDecode机器先向用户输出Token,让用户无感知传输延迟,待数据传输完成后再无缝切换至MainDecode完成完整输出。

实测数据显示,这套架构将首Token延迟(TTFT)降低51.5%,单Token成本再降37.5%。结合全链路技术优化,无问芯穹的单位Token推理成本在一年内整整下降了10倍,且未来仍有10倍的下降空间。正如夏立雪在发布会上总结的:英伟达在GTC大会上展示了「算力即收入」的增长曲线,而无问芯穹的Token工厂希望通过「优化即利润」的飞轮,为推理时代交出Token效率的答卷。

Token按量售卖是直接收入,而每一分技术优化省下的成本无需降价让利即可直接沉淀为毛利,节省越多利润越高。目前无问芯穹的合作客户已涵盖国内大半头部大模型厂商,包括Kimi、智谱、MiniMax、阶跃星辰等。随着这些厂商的模型能力持续提升,可承接的业务量呈指数级增长,截止今年7月,无问芯穹Agentic MaaS平台的日均Token调用量较年初增长约40倍,增长飞轮已经全速转动。

AI生产力商店:将技术转化为行业价值

AI生产力转化效率的核心,是将底层算力与Token优势转化为千行百业的真实生产力。在服务客户的实践中,无问芯穹发现一个关键规律:相同的业务效果,在不同的推理路径、模型规模与芯片组合下,Token成本差异巨大,这一差距正是制约大模型从技术验证走向落地的核心障碍。

为此,无问芯穹推出了「AI生产力商店」——Agentic Infra行业解决方案,依托底层智能基础设施的优势,帮助行业客户打通降本增效的「最后一公里」。目前,无问芯穹已深入文娱游戏、医疗健康、法律终端、能源电力等多个垂直行业,与Tripo AI、上海瑞金医院、南方电网等伙伴共同打磨领域专属生产力方案,赋能千行百业重塑AI效能边界。

当算力、Token、生产力三大环节形成闭环,从芯片中挤出的算力优势、被压至极致的Token成本,最终都将在真实业务场景中转化为可见的生产力价值。

从数字世界到物理世界:具身智能的基础设施支撑

到这里的讨论还局限于数字世界,但当所有智能都运行在云端数据中心时,AI基础设施是否已经走到尽头?无问芯穹的答案是否定的。在物理世界中,具身智能的Scaling Law同样需要高效率、大规模的基础设施支撑。

为此,无问芯穹公布了首个面向大规模具身任务的云边端一体化管理与调度平台,首次实现云端GPU集群、边缘算力节点与机器人真机设备的统一接入,支持训练、数据采集、评测与真机执行等全流程任务的统一编排运行。

在训练侧,RLinf V0.3大规模真机强化学习框架解决了具身智能训练的核心痛点:训练机器人需要大量真机同时运行,但设备断电、故障、断网等问题很容易导致训练中断甚至从头开始。RLinf首创HotSwarm与端云协同训练模式,支持真机在训练过程中反复上下线(最多可达1000次)而不中断训练,如同热插拔服务器硬盘一样灵活。

在推理侧,专攻机器人端侧的Mizar-Robo框架则针对机器人有限的算力与电量进行深度优化,从流水线调度、算子内核、量化压缩到计算图全链路压榨性能。在与自变量机器人WALL-OSS系列模型的联合优化部署中,推理性能提升7.14倍,端侧推理时延从500ms压缩至70ms,降幅达86%。

这正是「前店后厂一中心」战略的自然延伸:从数字世界的智能体服务,一路拓展到物理世界的具身智能应用。

筑牢智能时代的底层地基

当前AI行业的聚光灯几乎都聚焦在最亮眼的「大脑」——大模型与智能体上,而托举这一切的底层基础设施却往往被忽视。但真正决定智能革命能走多远、渗透多深的,恰恰是这层地基:再聪明的大脑,如果底层算力调度不畅、Token成本过高无法落地、系统频繁宕机,再宏大的AGI愿景都无法真正触达用户。

无问芯穹在WAIC 2026上交出的答卷,并非某一款单一产品或API服务,而是一整套可以自我迭代的智能基础设施体系。这套体系越是让用户感觉不到它的存在,就说明它的运行越是完美。当同一套地基可以同时托举数字世界中如洪流般的Token调用,与物理世界中机器人迈出的每一步时,它就成为了整个智能时代前进的核心底盘。

正如夏立雪在发布会上所说:「让智能无所不能,是AGI;让智能无处不在,是AGI Infra。」无问芯穹在WAIC上按下的,正是让这层地基自我优化与进化的启动开关,而所有的智能未来,都将从这层坚固的地基之上生长出来。

以上内容不代表本平台立场,仅供读者参考