GLM-5.3-Flash开源:原生多模态,性能比肩Opus,定价仅1/40

我们正式推出并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首款原生多模态模型。
长久以来,行业和用户似乎都默认前沿人工智能能力必然伴随着高昂的使用成本,而这被看作技术迭代的必经代价。但GLM-5.3-Flash的推出打破了这一固有印象:这款总参数量320B的模型,综合能力超越参数量更高的GLM-5.2,在全球权威的AA综合智能指数中拿下57分,跻身全球前沿模型梯队,得分与Anthropic旗下热门模型Claude Opus 4.8持平。在专业代码性能测试中,其编程表现同样与Claude Opus 4.8不相上下。
更值得关注的是这款模型的定价策略:常规状态下,其使用成本仅为GLM-5.3的十分之一;限时优惠期间更是低至GLM-5.3的二十分之一,仅为Claude Opus 4.8的四十分之一。同等性能水平下仅需原成本的四十分之一,意味着前沿智能工具终于可以摆脱“按需省着用”的限制。
在正式发布前,我们以匿名测试模型在主流开发平台上开展了大规模用户反馈收集工作,该模型上线当周便成为平台最受欢迎的工具,创下双平台调用量新高。值得一提的是,本次测试的全部算力均由国产芯片集群提供支持。
这款模型能实现性能跃升与成本控制的双重突破,核心在于全新的架构设计。GLM-5.3-Flash的架构专为低负载场景优化,总参数量与GLM-4.5相近(约320B对比355B),但激活参数量从32B缩减至18B,模型层数也从92层减半至45层。搭配最新的30T Token多模态预训练语料,这款模型能够以更少的计算资源实现更强的综合性能。同时,它也是首款采用稀疏注意力与线性注意力混合架构的开源前沿大模型,在保留精准长上下文处理能力的同时,大幅降低长文本场景的服务成本;此外还引入了流形约束超连接技术,进一步提升模型的扩展能力。更多技术细节可查阅官方技术博客。
极致降本的架构优化
为降低长上下文场景下的注意力计算成本,我们采用了线性注意力与稀疏注意力结合的混合架构方案:线性注意力通过递归机制捕捉局部语义依赖,稀疏注意力则通过轻量级索引模块召回全局上下文信息。我们还新增了IndexPool模块,通过加权池化将索引器的4个缓存向量压缩为1个,进一步降低1M长度上下文下索引模块的时延与内存开销。
为验证架构效率,我们将GLM-5.3-Flash与同系列及主流竞品模型进行对比,重点考察单Token计算量与KV缓存占用。对比结果显示,相较于GLM-5.3,GLM-5.3-Flash的注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍。在所有参与对比的模型中,GLM-5.3-Flash的单Token注意力计算量最低,仅KV缓存规模略高于另外两款竞品,这也是我们后续优化的重点方向。
视觉驱动的代码开发新范式
作为GLM-5系列首款原生多模态模型,GLM-5.3-Flash的视觉编码能力绝非简单的图像处理,而是极大拓展了编程任务的边界。对于前端开发、游戏制作、3D仿真等需要产出可视化交互产物的任务来说,原生视觉能力让模型能够自主判断何时需要“观察”界面或场景,并通过视觉反馈来调整下一步行动。
我们针对视觉编码任务搭建了专属的数据合成流水线,重点优化模型的自主视觉判断与迭代改进能力。生成的训练数据要求模型与虚拟环境交互,主动检视自身输出并完成迭代优化。在前端开发场景中,我们还探索了基于环境反馈的强化学习方案,通过真实用户流程的智能体验证,进一步强化模型的GUI界面判断能力,将验证范围从功能正确性拓展到渲染效果与交互体验层面。
更值得一提的是,代码开发能力让模型能够成为表达和验证世界知识的载体:在没有外部素材的情况下,GLM-5.3-Flash仅靠自主运行16小时,就搭建出了一套约400平方米的专业主厨自宅与测试厨房场景。通过专用的多模态智能体,模型可以在代码、浏览器与图形界面之间协同工作,主动观察并验证自身的输出结果——很多只有在实际渲染、交互或试玩过程中才会暴露的问题,都能被模型自主发现并修正。从图像生成可运行工程,到将两小时素材剪辑为8分钟成片,再到生成专业交付文档,GLM-5.3-Flash在代码工具平台上的实测效果远超预期。
多场景专业协作能力
GLM-5.3-Flash在专业办公场景中的表现也远超同级别模型。针对PPT、PDF、Word、Excel等常用文档类任务,新增的视觉理解能力让模型能够主动检查并优化自身输出,同时具备更强的审美判断能力。模型可以将生成结果与视觉上下文和预期目标进行对比,实现更高效的自我验证与优化,包括更精准的内容质量评估和视觉呈现判断。
我们还针对金融、法律等垂直专业领域做了针对性优化:在金融场景中,它可以覆盖从来源溯源的金融研究、报告生成到金融建模分析的全流程,每个环节都能提供可追溯的参考依据;在法律场景中,它能够审查合同中的费用、账户与责任条款,按照律师行业惯例进行批注留痕,还可以直接起草符合实务规范的律师函、合同与诉讼文书,生成成果即可直接交付使用。
国产算力支撑的大规模部署
在本次发布前的测试阶段,我们首次尝试使用国产芯片集群为大规模用户流量提供服务,这批芯片通过自研的高带宽互联网络实现互联。为克服单张芯片算力与内存容量有限的问题,我们在现有推理框架基础上搭建了专属的推理引擎,整个开发过程由AI驱动的基础设施智能体大幅加速,它协助工程师开发优化算子、诊断性能瓶颈、改进部署服务栈,形成了“模型优化系统,系统承载模型”的正向循环。
由于国产芯片在内存容量与带宽上存在天然瓶颈,尤其是支持1M长度的上下文极具挑战,我们针对底层架构做了激进的内存优化:包括以算力换带宽、以通信换显存等定制方案。技术栈上结合了节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split等优化手段。在集群层面,我们采用了生产级的Encode-Prefill-Decode分离架构,将多模态编码、Prompt预填充和逐Token解码拆分为可独立调度、独立扩缩容的工作池,最终在国产加速芯片上实现了高效可靠的服务。
与初始基线相比,端到端服务性能提升了3倍,硬件效率与单Token成本已达到与主流英伟达GPU相当的水平。这一实践证明,国产芯片完全可以在大规模场景下高效、经济地支撑前沿大模型的推理需求。
目前,GLM-5.3-Flash已正式面向全球开源,已接入多个专业编码与办公平台,并纳入专属体验计划,每天限量发放体验资格,同时开放官方API调用。
快速使用与获取方式
- 官方API接入
- 官方开放平台:官方文档链接
- 专业开发平台:官方文档链接
- 专属体验计划:活动页面链接
- 在线体验
- 官方对话平台:平台链接
- 移动端应用:应用地址
- 智能体工具
- 专业代码工具:工具地址
- 办公场景智能体:工具地址
- 技术博客:技术细节链接
- 开源仓库:模型开源地址

