文章摘要
8月26日晚间,智谱推出并开源GLM-5系列首款原生多模态模型GLM-5.3-Flash,该模型性能跻身全球前沿,得分与Anthropic Claude Opus 4.8持平。商汤大装置为其提供国产算力支持,实践验证国产算力已可高效经济支撑前沿大模型大规模推理需求,商汤也提出国产算力规模化商用破局方案,将推进相关产业发展。

8月26日晚间,智谱正式推出并开源了GLM-5.3-Flash(320B-A18B),这款模型作为GLM-5系列的首款原生多模态产品,总参数量为320B,整体性能优于GLM-5.2版本。在全球权威的AA综合智能指数评测中,它拿下了57分,跻身全球前沿模型阵营,得分与Anthropic旗下热门模型Claude Opus 4.8持平。该模型的架构专门针对极致低成本进行设计,结合智谱最新的30万亿Token多模态预训练语料,能够以更少的计算资源实现更出色的模型表现。

本次项目中,商汤大装置凭借先进的国产异构混合推理技术,为GLM-5.3-Flash的上线提供了大规模国产算力支持与Token服务,成为国产算力规模化商用的又一标志性落地案例。

这一合作背后,依托的是商汤打造的“一套模型、一座Token工厂、一套智能体管控系统”核心能力框架。其中Token工厂承担着智能能力规模化生产的核心职能:它通过多模态模型与大装置基础设施的联合优化,将不同架构的芯片、算力集群、能源资源以及交付节点进行整合调度,持续产出质量更高、成本更低的Token。同时Token工厂与大模型之间形成了双向反哺的闭环机制,能够更好适配原生多模态模型的迭代升级需求,商汤大装置高效支撑GLM-5.3-Flash上线的实践,正是这套闭环能力的有力证明。

长期以来,行业普遍认为国产算力存在性价比不足、难以实现大规模商用的痛点。而在正式发布前,GLM-5.3-Flash以匿名模型Ox-Alpha(国内社区称之为“牛来”)的身份,在OpenCode和OpenRouter平台完成了大规模测试,累计Token调用量达到62万亿,所有请求流量均由国产芯片提供算力支撑。测试结果显示,相较于同一硬件环境下的初始基线,基于国产芯片集群的GLM-5.3-Flash端到端服务性能提升3倍,硬件效率与单Token成本已经达到主流英伟达GPU的同等水平。

这一实践充分证明,国产算力已经能够在大规模真实业务场景中,高效且经济地支撑前沿大模型的推理需求。

作为深度适配大模型的AI基础设施服务商,商汤大装置全面拥抱国产化路线,并持续推动国产算力从“单点可用”向“大规模商用”迈进。在今年的行业展会期间,针对当前国产算力规模化商用的核心卡点,商汤大装置从性价比、适配性、能效比三个维度系统性提出破局方案。

在性价比层面,商汤大装置打破了传统单卡性能比拼的思路,通过先进的异构混合推理技术,根据不同推理阶段对计算资源、带宽的差异化需求,让不同架构、不同定位的国产芯片各尽其用、协同高效运转。整体推理性价比达到NVIDIA H系列的1.25倍,相较于国产同构推理方案,同等成本下的Token产能提升约2.5倍。

在适配性方面,商汤大装置通过底层算子优化、多卡并行调优以及工具链适配等一系列手段,大幅降低了国产算力的应用门槛。

在能效比维度,商汤大装置推出了算电协同Agent,并重新定义了TPW(Tokens Per Watt)作为AIDC领域的全新价值衡量标准。

此外,通过整合多元算力资源并持续优化推理引擎与芯片性能,商汤大装置的Token Factory已经形成了大规模、高效率、低成本的Token供给能力。数据显示,今年7月其日均Token服务量达到2.42万亿,预计到2026年底将突破日均10万亿,全年Token服务量级将实现25倍增长。

未来,商汤大装置将持续加大基于国产化算力的Token服务建设投入,打造高性能、低成本、可规模化交付的AI基础设施,推动国产算力从单点技术突破走向产业体系化繁荣。

以上内容不代表本平台立场,仅供读者参考