文章摘要
当前AI开发领域,模型评估除成本、准确率外,包含延迟、吞吐量两个维度的响应速度已成为新核心指标。近期OpenAI联合Cerebras、谷歌、英伟达分别推出三款主打速度优势的高速AI方案,实测均实现数倍不等的速度提升。高速推理可优化现有AI应用体验,还能拓展AI应用边界,业内正探索基于速度优势的全新应用场景。

对于AI开发者来说,过去评估模型时重点往往放在成本与准确率上,但如今,响应速度正成为越来越关键的第三项核心指标。

在AI领域,速度通常包含两个核心维度:一是延迟,也就是从发起请求到模型返回首个回答token的等待时间,也常被称为首token时间;二是吞吐量,即模型启动后每秒可以生成的token数量,不同的硬件和模型架构对这两项指标的优化方向各有侧重。

OpenAI与Cerebras联合推出的Ultrafast API服务层,是近期最受关注的高速推理方案之一。这款服务搭载GPT-5.6 Sol模型,并未使用OpenAI常规的基础设施,而是基于Cerebras的专用硬件打造。Cerebras将模型权重直接存储在44GB的片上SRAM中,避开了基于GPU的推理常见的外部存储器访问瓶颈。

从实测数据来看,Ultrafast宣称最高可达到每秒750个token的吞吐量,而在OpenAI常规API上以最高推理强度测试的同型号模型,仅能达到每秒65个token,速度提升约11倍。第三方测试显示,标准版GPT-5.6 Sol在最高推理强度下,首个回答token的出现时间为97.2秒,对比前代GPT-5.5在高负载下的14.5秒,延迟问题尤为突出,而Ultrafast的延迟数据目前尚未公开。在6个匹配质量的GDPVal(用于衡量真实、经济价值较高工作任务的基准)任务中,Ultrafast完成单个任务仅需83秒,而标准版GPT-5.6 Sol则需要7.7分钟,端到端速度提升5.6倍。

在覆盖100多个学科的2500道专家级考题的Humanity’s Last Exam测试中,Ultrafast完成全部答题耗时11小时11分钟,对比Claude Fable 5的78小时27分钟,速度提升约7倍;Fast模式下则比Claude Fable 5快11倍,比Claude Opus 4.8快5倍。不过目前这款服务仅对部分客户开放有限预览,尚未公布正式定价与全面上线日期,且其基准测试结果尚未获得独立第三方验证。

除此之外,OpenAI还发布了与Broadcom合作研发的Jalapeño推理芯片的首批测试结果,在运行自家模型与开源权重模型时,该芯片在延迟与吞吐量方面都展现出了不错的表现。芯片厂商也需要在速度、用户承载量与硬件功耗之间找到平衡,这些因素都会直接影响推理的成本与可靠性。

同一周内,还有两家科技巨头推出了以速度为核心卖点的AI模型。Google发布的Gemini 3.7 Flash虽然未公开官方的吞吐量与延迟数据,但第三方测试显示其输出速度可达每秒330个token,仅次于Gemini 3.5 Flash-Lite,首token等待时间为13.2秒,其AI指数平均分为56,高于前代Gemini 5.6 Flash的52分。

Nvidia推出的Nemotron 3.5 Lightning则宣称输出速度最多比同类模型快4倍,智能体类任务的完成速度提升30%。第三方测试显示其平均吞吐量为每秒302个输出token,首token时间为7.5秒。同时Nvidia还发布了开源路由库NeMo Switchyard,该工具可以将智能体工作流中的每一步路由到最适合该步骤需求的可用模型,兼顾速度、质量与成本,通过该库进行路由的任务完成成本,仅为单独使用Claude Opus 4.8的约三分之一。

高速度的推理能力,不仅能优化现有AI应用的体验,更能拓展AI的应用边界。在实时对话类应用中,用户对延迟的感知非常直接:如果语音助手的停顿超过1秒,用户体验就会明显下降,因为人类日常对话的轮次间隔通常在0.3到1秒之间。

对于使用AI辅助写代码的开发者来说,等待数分钟才能得到结果,很容易导致注意力分散、忘记当前的问题上下文,再次返回时需要重新梳理思路,增加上下文切换带来的心理疲劳。对于常驻式智能体来说,低延迟与高吞吐量可以让其实时监控系统、网站或安全信息流,并在事件发生时立即做出反应,如果需要花费一分钟才能完成分析,很可能已经错过了实时干预的窗口。此外,工具调用流程也高度依赖速度,搜索、代码执行与数据检索等工具会为智能体工作流增加额外的时间成本,更高的推理速度可以抵消这部分开销,让智能体的工作流更加流畅高效。

如今更快的AI模型已经让智能体能够实现代码编写、数据检索,甚至以接近人类语音的速度回应用户对话。我们建议开发者不仅要思考哪些现有应用需要更高的吞吐量与更低的延迟,更要去探索那些只有借助新一代模型与硬件所提供的速度优势才能落地的全新应用场景。

以上内容不代表本平台立场,仅供读者参考