文章摘要
随着智能体应用增长,推理速度的价值认知正在修正。Groq创始人Jonathan Ross分享创业历程,指出GPU与LPU是互补关系,将不同任务分配给二者可优化大模型推理表现。他提出“模型越快越聪明”,还从组织、决策与人才维度分享AI企业商业化观点。

在人工智能基础设施的演进历程中,推理速度长期被业界视为单纯的工程优化指标,其价值仅被限定在改善用户体验、降低服务成本的范畴内,而非决定模型智能上限的核心变量。但随着智能体应用的爆发式增长与实时交互需求的急剧攀升,这一传统认知正在经历深刻修正。

Groq创始人、前Google TPU核心开发者Jonathan Ross在近期访谈中,系统分享了自己的创业历程与行业洞察。从2016年创立Groq,到2025年行业头部企业以200亿美元收购其IP并吸纳核心团队,再到2026年行业大会发布搭载Groq LPU的专属平台,这段十年的创业路径背后,既有技术探索的执着,也有商业合作的智慧。

协同算力架构:GPU与LPU如何赋能大模型智能升级

外界曾将Groq视为行业头部企业的直接挑战者,但Ross明确表示,GPU与LPU本质是互补关系。他用物流网络打比方:如果只能在长途重载卡车和末端配送货车中二选一,显然两者都不可或缺。GPU擅长通用计算与模型训练,依赖高带宽存储资源;而LPU则专为AI推理场景设计,针对不同计算瓶颈做了定向优化。

在大语言模型的推理过程中,不同计算环节面临的瓶颈截然不同:注意力机制环节受限于算力资源,而权重应用环节则受制于内存吞吐带宽。Ross的团队通过测试验证,将计算密集型任务交由GPU处理、内存吞吐密集型任务分配给LPU,可以在全性能曲线上实现更优表现,这一整合方案最初由Groq的COO Sunny Madra提出,经过团队反复验证后落地。

当团队向行业头部企业创始人展示这项技术成果并表达采购10万块GPU的意向时,对方当即判断该技术应该面向所有客户开放。从首次沟通到交易完成、资金到账,整个过程仅耗时三周。

基于GPU与LPU的协同架构,Ross提出了“模型越快越聪明”的核心观点。推理速度的提升不仅解决了工程效率问题,更直接扩展了模型的搜索深度与反思能力。他用“快思考与慢思考”的理论类比:更快的硬件允许模型在相同时间内探索更多的决策路径,从而找到原本因计算深度不足而被忽略的最优解。

Ross以经典AI案例为例进行说明:当AI面对棋盘上270种可能的走法时,会对所有选项进行排名并虚拟演练。更快的硬件可以让模型在相同时间内搜索更深的决策链,发现那些原本难以触及的最优方案。某知名AI模型在通用算力设备上的评分约为3200,迁移至专用推理硬件后跃升至3900以上。在该模型与顶尖棋手的对局中,著名的创造性走法在训练数据中仅出现万分之一的概率,在通用算力设备上运行时因搜索深度不足未能被找到,而当专用推理硬件提供了足够的推理速度后,这一突破性的走法才被“思考”出来。

推理速度带来的智能提升,同样可以优化多智能体的协作效率。Ross认为,当AI调用其他AI工具时,人类可以容忍的1至2秒延迟对机器而言是严重的资源浪费,LPU带来的极速响应可以让智能体以接近自身思维的节奏运行,形成自我强化的高效工作流。他还分享了自己的个人实践:他的AI助理会在主任务执行期间自动启动子Agent调研备选工具,进一步提升整体工作效率。

适配AI赛道的领导力体系:如何打造长期竞争力

在企业发展与策略制定的话题中,Ross从组织、决策与人才三个维度分享了AI企业商业化的观点与实操教训。他提出,打造具备长期竞争力的组织,需要建立量化核心目标、意向性领导与信息透明的管理机制。在人才筛选方面,他主张以“现实商数”和“制造不满”作为标准,挑选适配长周期竞争的团队成员。

Ross还提到,高效的领导力应当具备少约束、高置信与去政治化的特点,让团队成员能够专注于技术探索与业务落地,而非被不必要的流程或政治博弈消耗精力。

以上内容不代表本平台立场,仅供读者参考