AICon深圳站:缓解技术焦虑,聚焦行业热点

过去两年,AI基础设施的建设逻辑基本围绕单一核心展开:更大参数的模型、更多的GPU集群、更快的高速网络,以及功率持续攀升的智算节点。但随着AI Agent从单纯的聊天交互工具,进化为能够拆解任务、调用工具、持续运行的智能体,这套单一的建设思路正在被彻底改变。
传统的大模型推理场景中,算力资源的分配高度向GPU倾斜,企业关注的核心指标是GPU数量、显存容量、卡间互联速度和单Token生成效率,CPU更多承担输入输出、任务管理等辅助角色。但Agent的落地让算力分工发生了根本性变化:模型推理只是Agent任务执行中的一个环节,除此之外还包含任务拆解、流程编排、信息检索、工具调用、状态管理和安全隔离等大量工作,这些环节都需要CPU、内存、存储和网络共同配合完成。
在2026开放计算大会上,相关行业专家指出,Agent正在迫使AI基础设施重新进行分工。“AI算力依然是基础设施的核心,但CPU算力也重新回到了行业的视野中。Agent将催生一批独立于传统GPU服务器之外的CPU计算需求。”这并非CPU取代GPU,而是AI基础设施从单一的计算链路,演变为两套彼此耦合的系统:一套负责核心的模型推理(也就是“思考”环节),另一套负责让Agent真正落地执行任务(也就是“行动”环节)。
一个完整的Agent任务流程中,通常不会直接调用大模型生成最终结果。它会先拆解用户需求,确定需要调用的工具和实时信息,再将不同步骤分配给不同的模型或Agent执行。行业专家将这类运行环境描述为CPU沙箱:“Agent一定是运行在CPU之上的,因为任务中的整型运算、逻辑推理、分支预测等工作,都需要CPU来完成。”
以一个包含八个步骤的任务为例,真正需要GPU执行模型推理的可能只有其中1-2个环节,而信息查询、任务拆解、决策分析、工具调用和流程控制等大部分工作,都依赖CPU完成。需要明确的是,Agent时代的CPU需求并非简单地在现有AI服务器中增加CPU数量,传统围绕GPU设计的AI服务器不会消失,新增的是一批专门承载Agent编排、工具服务、沙箱运行和状态管理的高密度CPU宿主机。
不同类型的Agent对资源的需求差异极大:临时Agent完成任务后会释放资源,而企业级Agent则需要长期驻留;简单的信息查询可能只需要单核2G内存就能稳定运行,但像AI Coding这类需要持续读取代码仓库和历史上下文的任务,则对内存、存储和网络提出了更高要求。企业面临的核心挑战,是如何根据Agent的生命周期、上下文长度和工具类型,动态分配计算资源。
多Agent协作能够显著提升任务处理的质量,但同时也会带来计算成本的提升。当单个模型难以稳定处理复杂任务时,行业通常会采用两种路径:一种是通过多Agent群智协同,另一种是通过多模型融合。前者通过任务拆解、信息查询和多轮协作提升系统稳定性,后者则让擅长不同领域的模型分别处理任务,再通过评审模型整合结果。
“GPU决定了模型的智能上限,多Agent是通过工程化手段提升模型治理水平,而多模融合则是通过技术化能力打破智能上限。”以旅行规划任务为例,内部测试中系统会启动30多个Agent,分别查询交通、景点、行程和休息安排,再将结果汇总。相比单个快速模型直接生成的答案,多Agent的输出更完整,也更容易发现不存在的车次或不合理的行程安排,但这种质量提升并非免费。
传统的单次请求只调用一个模型,而多Agent和多模型融合场景下,可能同时调用多个模型,经历检索、推理、评审和融合多个环节,模型调用次数和Token消耗都会成倍增加。企业需要平衡质量和成本:并非所有任务都需要使用多模型融合,而是应该先对任务进行分级。简单问答可以交给推理速度快、参数较小的模型;OCR、格式转换等任务也不需要调用万亿参数模型,只有代码生成、复杂逻辑分析或高价值决策,才需要进入多模型融合链路。
以市场洞察报告生成为例,Agent首先从网络上查找信息,其中的图片和PDF可以交给几十亿参数的小模型处理;企业内部知识库和文档,可以由千亿参数模型归纳;最后只有在整合十几个甚至几十个来源、生成完整报告时,才需要调用更强的万亿参数模型。因此,多模型融合的核心并非简单堆砌更多模型,而是精准的模型路由。
模型路由是当前行业的核心难点之一,企业需要通过路由机制,让融合模型的成本低于所有任务都使用万亿参数大模型的成本,因为简单任务会被全部卸载。从这个角度来看,模型数量越多并不一定意味着成本越高。如果一个能力不足的模型需要反复生成、人工修改和重新调用,累计的Token消耗可能高于一次融合推理。但这一切都取决于路由的准确性,一旦平台无法判断任务难度,将大量简单请求错误送入大模型或融合链路,多模型系统反而会成为新的成本黑洞。未来企业AI平台的竞争力,将不再只是拥有多少模型,而是能否准确判断何时调用哪个模型,以及何时根本不需要调用大模型。
Agent Infra与传统AI基础设施最大的区别,在于过去相互独立的CPU计算集群和GPU推理集群必须重新连接。“从今年开始大家会发现,必须把CPU和GPU结合起来,关键问题在于如何结合、系统如何搭建、CPU的Agent集群和GPU推理集群如何匹配连接、如何共享存储。”这种连接不仅是网络层面的连接,Agent需要读取企业数据、调用模型、访问知识库,并在多个沙箱之间传递状态,CPU集群与GPU集群之间的距离、带宽和延迟,都会直接影响任务的完成时间。
传统的数据中心规划中,通用业务和GPU训练集群可以相对独立:高耗能的GPU集群可以部署在电力更便宜的地区,面向用户的业务系统则部署在靠近市场的位置。但Agent的运行需要在CPU和GPU集群之间频繁往返,“你可能需要让Agent更靠近AI集群,以往东数西算的思路是将GPU放在西部,业务放在东部靠近用户,但未来这种模式已经不够了。”这意味着Agent可能改变的不只是服务器配置,还包括数据中心选址、网络架构、存储布局和资源调度方式。
对于已经建设传统数据中心的企业,改造成本并不低。如果现有基础设施主要是通用服务器,通常无法承载最新的万亿参数模型,服务器和交换机都可能需要更新,网络也会从传统带宽升级到400G甚至800G。只有已经部署一定规模AI服务器和高速网络的企业,才可能通过增加互联设备和节点完成平滑升级。因此,Agent Infra并非所有企业都必须自建的标准配置,对于中小企业而言,大规模采购CPU机柜、GPU超节点和高速交换网络未必是最经济的选择,云服务、托管集群或者更小规模的一体机,仍然是更现实的路径。行业也正在将大型超节点架构缩小到企业级设备中,这也反映出Agent基础设施产业化面临的核心问题:行业知道系统需要重构,但尚未形成统一的部署形态。
Agent增加CPU需求的同时,大模型训练和多模型推理仍然在推高GPU功耗。国内部分AI机柜的功率正向300千瓦发展,海外兆瓦级机柜也在进入产品化阶段。相关企业推出的高密CPU整机柜,一个重要原因就是让CPU集群的功率密度与现有AI数据中心的供电、液冷基础设施相匹配。
当单机柜功率达到数百千瓦甚至兆瓦级后,传统380V供电将难以继续扩展,800V高压直流供电需要直接进入机柜。“只有提高电压,才能使用更细的电缆,保障基础设施可控,所以800V进机柜是未来基础设施的第一个大变化。”随之改变的还有UPS、变压器、母线、液冷和机房布局。此次推出的CPU机柜采用“算电分离”设计,将电源从液冷计算节点中移出,通过独立供电模块和Busbar为节点供电,既提高了计算密度,也在电源难以全面液冷的情况下,实现了计算节点的液冷覆盖。
行业专家进一步判断,兆瓦级机柜最终会推动吉瓦级智算中心出现,而现有数据中心难以直接承载此类设施。不过吉瓦级智算中心仍是面向未来的设想,预计将在未来两到三年落地。目前绝大多数企业面临的更现实的问题,是如何提高已有算力的利用率,而非立即建设吉瓦级数据中心。这也是Agent Infra讨论中容易被忽略的一面:产业一边在追求更大的集群、更高的密度和更快的Token生成速度,另一边大多数企业甚至还没有解决模型调用成本、资源闲置和应用价值的问题。
随着大模型厂商和互联网公司研发ASIC,未来AI基础设施不会只有CPU和GPU,还会出现NPU以及针对Prefill、Decode、Attention、FFN等环节设计的专用芯片。行业专家将未来的Token生产类比为汽车流水线:不同环节将使用不同的系统和芯片,以提高整体效率。Prefill可能运行在一类系统上,Decode运行在另一类系统上;Decode内部还可能继续拆成Attention和FFN,由不同架构承载。这意味着芯片本身只是计算单元,真正决定AI应用能否规模化的,是如何把CPU、GPU、ASIC、内存、存储和网络组合成一套稳定运行的系统。


