智谱AI正式开源GLM-5.3-Flash:3200亿参数国产多模态模型,价格仅为Claude Opus 4.8的四十分之一

2026年8月26日,智谱AI正式开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。该模型总参数量320B、激活参数量18B,在全球权威的Artificial Analysis Intelligence Index中取得57分,与Claude Opus 4.8得分持平。智谱AI正式开源GLM-5.3-Flash采用MIT协议,权重已上线Hugging Face,全部推理服务由超10万张国产芯片承载。

一、智谱AI正式开源GLM-5.3-Flash:匿名模型“牛来”终揭面纱
1.1 从Ox Alpha到GLM-5.3-Flash:一场为期六天的匿名测试
2026年8月20日,一个名为Ox Alpha的匿名模型悄然出现在OpenRouter和OpenCode两大海外AI模型聚合平台。没有官方公告,没有技术论文,没有公司背书——只有一串模型ID和供全球开发者免费调用的API接口。
然而,这个“来历不明”的模型迅速引爆了全球AI社区。Ox Alpha上线首日即冲至OpenRouter榜首,刷新了该平台单日Tokens用量历史纪录,相较此前最大Tokens量提升了4倍。在OpenCode上,Ox Alpha一出世即终结了DeepSeek在OpenCode连续56天霸榜的纪录。短短六天内,全球开发者消耗了超过62T Tokens。
中文社区给这个神秘模型起了一个接地气的名字——“牛来”。
直到8月26日晚,智谱AI正式发文“认领”。Ox Alpha的正式身份揭晓:智谱AI正式开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列的首个原生多模态模型。
1.2 MIT协议开源:全球开发者可自由部署商用
智谱AI正式开源GLM-5.3-Flash,采用了业界最宽松的MIT开源许可证。模型权重已同步上线Hugging Face平台(zai-org/GLM-5.3-Flash),全球开发者可以自由下载、部署和商用,无需支付任何授权费用。
这意味着,任何个人开发者、研究机构或企业都可以基于智谱AI正式开源GLM-5.3-Flash进行二次开发、微调和商业化应用。开发者可以使用vLLM、SGLang和KTransformers等主流推理框架直接部署模型。
此外,智谱AI还同步开放了GLM-5.3-Flash的API调用服务,已接入ZCode等编码平台,并纳入GLM Coding Plan,每天限量发放10,000张体验卡。
二、GLM-5.3-Flash核心技术架构解析
2.1 320B总参数/18B激活:MoE架构的效率革命
智谱AI正式开源GLM-5.3-Flash采用混合专家(Mixture of Experts,MoE)架构,总参数量达到320B(3200亿),但每次推理仅激活18B(180亿)参数。
这一设计意味着什么?传统的稠密模型(Dense Model)每次推理需要调动全部参数,计算成本与模型总参数量成正比。而GLM-5.3-Flash的MoE架构让模型可以在保持3200亿参数“知识储备”的同时,每次只调动180亿参数进行计算。
与GLM-4.5相比,GLM-5.3-Flash的总参数量相当(355B vs 320B),但激活参数量从32B降至18B,层数从92层减至45层,几乎减半。这意味着在保持相近知识容量的前提下,推理计算量大幅降低。
2.2 混合注意力架构:稀疏注意力+线性注意力的首次结合
智谱AI正式开源GLM-5.3-Flash,是首个采用稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)混合架构的开源前沿模型。
这一架构创新的核心价值在于解决大语言模型最棘手的问题之一:长上下文的计算成本。
传统的Transformer架构采用全注意力机制,模型需要逐一比对输入序列中每一个Token与其他所有Token的关系。当上下文长度达到1M Tokens时,注意力计算量呈平方级增长,硬件成本急剧攀升。
GLM-5.3-Flash的混合架构采用了两种互补的策略:
- 线性注意力通过递归机制捕获局部依赖关系,计算复杂度与序列长度呈线性关系
- 稀疏注意力借助轻量级索引器(IndexPool)召回全局上下文,只关注最相关的Token,而非全量比对
智谱AI还引入了流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)来进一步提升模型的Scaling能力。
根据官方数据,相比GLM-5.3,GLM-5.3-Flash的注意力计算量降低了3.01倍,KV缓存大小降低了4.44倍。这意味着在同等硬件条件下,GLM-5.3-Flash可以支撑更长的上下文、更低的延迟和更高的并发。
2.3 30T多模态预训练:原生视觉能力融入Coding闭环
智谱AI正式开源GLM-5.3-Flash基于全新的基础模型训练,在30T Tokens的多模态预训练语料上完成训练。
与传统的“文本模型+视觉适配器”方案不同,GLM-5.3-Flash的视觉能力是原生集成的。它不是在一个纯文本模型上外挂一个视觉处理模块,而是从一开始就将图像和视频理解能力构建在模型的基础架构之中。
这一设计带来的最大变革体现在编程领域。传统编程模型的工作方式是:开发者提出需求→模型输出代码→开发者运行代码、查看效果、发现问题→再将问题反馈给模型。这是一个“人在闭环里当裁判”的流程。
而GLM-5.3-Flash将视觉能力原生融入Coding循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。模型不再只是“写代码”,而是能够“看效果”并自主迭代。无论是前端开发、游戏构建、Blender 3D场景,还是BUA、CUA驱动的真实环境操作,模型都能在代码、浏览器和图形界面之间协同完成任务。
三、性能评测:57分进入全球前沿梯队
3.1 Artificial Analysis Intelligence Index:与Claude Opus 4.8持平
智谱AI正式开源GLM-5.3-Flash在Artificial Analysis Intelligence Index(AA综合智能指数)中取得了57分。
这一分数的含金量需要放在全球坐标系中理解:
- 超过了上一代旗舰模型GLM-5.2
- 高于DeepSeek旗舰模型V4 Pro正式版的53分
- 与Anthropic最受欢迎的模型Claude Opus 4.8得分持平
- 远高于同类模型的中间值(18分)
Artificial Analysis Intelligence Index是一个综合评估大模型智能水平的权威第三方基准,涵盖了推理、编程、知识、多语言等多个维度。57分意味着智谱AI正式开源GLM-5.3-Flash已经跻身全球前沿模型能力区间。
3.2 编程与Agent任务:逼近Claude Opus 4.8
在编程和智能体(Agent)任务上,GLM-5.3-Flash的表现尤为突出。
在智谱自研的Z.ai Code Bench体感评估中,GLM-5.3-Flash的编程表现与Claude Opus 4.8相当。在Z.ai Code Bench v1.0内部评测中,GLM-5.3-Flash在各个计算强度级别均明显胜过GLM-5.2,而在最高计算强度下几乎追平Claude Opus 4.8(29.0对比29.5)。
在具体基准测试中:
Terminal-Bench 2.1:GLM-5.3-Flash得分84.3,超过GLM-5.2的81.0
DeepSWE v1.1:GLM-5.3-Flash得分63.4,较GLM-5.2的46.2提升17.2分
AutomationBench v1.0.6:GLM-5.3-Flash得分48.8,较GLM-5.2的26.2提升22.6分
值得关注的是,虽然智谱AI正式开源GLM-5.3-Flash的综合得分与Claude Opus 4.8持平,但在单项基准测试、长任务稳定性和真实Agent任务上仍可能存在差异。然而,一款开源模型能够进入此前主要由高价闭源旗舰模型占据的能力区间,这本身就是一次里程碑式的突破。
四、价格革命:同等智力,四十分之一价格
4.1 API定价:每百万Token输入0.8元
智谱AI正式开源GLM-5.3-Flash的API定价为:
- 输入:每百万Token 0.8元
- 输出:每百万Token 2.8元
- 缓存命中:每百万Token 0.23元
这一价格仅为GLM-5.3的十分之一。限时折扣期间进一步降至GLM-5.3的二十分之一。
4.2 横向对比:比DeepSeek V4 Flash更便宜
将GLM-5.3-Flash与市场上的主流轻量旗舰模型进行对比:
| 对比维度 | GLM-5.3-Flash | DeepSeek V4 Flash | Claude Opus 4.8 |
|---|---|---|---|
| 总参数量 | 320B | ~300B | 未公开 |
| 激活参数量 | 18B | 未公开 | 未公开 |
| AA智能指数 | 57分 | 53分(V4 Pro) | 57分 |
| 输入价格(/百万Token) | 0.8元 | 1.5元(谷时) | ~35元 |
| 输出价格(/百万Token) | 2.8元 | 4.5元(谷时) | ~175元 |
| 价格倍差(vs Opus 4.8) | 1/40 | — | 1 |
| 开源协议 | MIT | 有限开源 | 闭源 |
| 国产芯片支持 | 是(100%) | 部分 | 否 |
数据来源:
综合输入和输出成本,智谱AI正式开源GLM-5.3-Flash在绝大多数常规调用场景下比DeepSeek V4 Flash更便宜。而与Claude Opus 4.8相比,差距更为悬殊——按当时汇率折算,Opus 4.8每百万Token输入约35元、输出约175元。GLM-5.3-Flash的价格仅为对方的四十分之一左右。
智谱在发布公告中写道:“同样智力,1/40价格,前沿智能,第一次不需要省着用。”
4.3 打破“参数越大、价格越贵”的铁律
长期以来,大模型行业遵循着一条不成文的规律:参数越大、能力越强、价格越贵。OpenAI的GPT-4系列、Anthropic的Claude Opus系列,乃至智谱自己的GLM-5.3,无不遵循这一定律。
智谱AI正式开源GLM-5.3-Flash的出现,打破了这条曲线。
它用更少的激活参数(18B vs GLM-5.3的更大激活规模)、更浅的层数(45层 vs 92层)、更高效的混合注意力架构,实现了超越GLM-5.2、比肩Claude Opus 4.8的性能。
这不再是简单的“降价促销”,而是一次工程能力的系统性验证——用更低的成本结构支撑更低的价格,同时不牺牲模型能力。
五、国产芯片的里程碑:10万张国产卡撑起全球流量
5.1 全部跑在国产芯片上
智谱AI正式开源GLM-5.3-Flash最令人震撼的一点,或许不是性能,也不是价格,而是它的算力底座。
智谱官方确认,GLM-5.3-Flash的全部线上流量由超过10万张国产芯片承载。从8月20日以Ox Alpha身份匿名上线,到8月26日正式开源,六天内全球开发者消耗的62T Tokens,全部跑在国产芯片上。
据《晚点LatePost》了解,算力供应商或来自华为、摩尔线程与海光。智谱官方未对具体芯片型号发表评论。
这意味着什么?这不是实验室环境下的峰值性能展示,也不是小规模的概念验证。10万张国产芯片集群直接承载了来自全球开发者的真实线上负载。用户不知道模型背后是谁,也不知道使用什么芯片,只根据速度、稳定性和效果决定是否继续调用。国产算力因此接受了一次持续的真实流量测试。
5.2 技术攻关:让前沿模型跑在国产芯片上
要让一个320B参数的前沿模型稳定跑在国产芯片上,绝非易事。
单张国产芯片当前面临的主要瓶颈包括内存容量和带宽,而GLM-5.3-Flash又原生支持最长1M上下文,对显存和通信提出了更高要求。
智谱的工程团队基于SGLang构建了专用推理引擎,并实施了多项针对性优化:
- 节点内张量并行:拆分计算任务到多张芯片并行处理
- W8A8量化与INT8/FP8/BF16混合缓存量化:在精度和效率之间取得平衡
- Layer Split技术:优化层间通信
在集群层面,智谱采用了Encode-Prefill-Decode(EPD)分离架构。多模态编码、Prompt预填充和逐Token解码被拆分为三个可以独立调度和扩缩容的工作池,让不同阶段按照各自的算力特征运行。
按照智谱公布的数据,与同一批硬件上的初始基线相比,这套方案将端到端服务性能提高了3倍。智谱称,最终硬件效率和单Token成本已经达到与主流英伟达GPU相当的水平。
5.3 “1/40价格”的真正含义
这里需要做一个重要区分。
所谓“价格为Opus 4.8的1/40”,并不是说国产芯片的硬件推理成本只有海外GPU的1/40。公开数据并不足以支撑这样的比较。
更准确的理解是:一款全部由国产芯片集群承载的前沿模型服务,把面向用户的价格压到了Claude Opus 4.8的大约1/40。
这一定价能力的实现,来自两个层面的叠加:
- 架构效率:混合注意力架构、MoE设计带来的计算量降低(注意力计算量降3.01倍、KV缓存降4.44倍)
- 工程优化:针对国产芯片的深度适配和推理系统重构(端到端性能提升3倍)
这是中国AI产业第一次用完全自主的算力底座,向全球输出前沿AI服务。
5.4 国产芯片与开源生态的双重突破
智谱AI正式开源GLM-5.3-Flash在国产芯片上跑通并服务全球用户,这一事实的意义超越了模型本身。
长期以来,全球AI算力高度依赖英伟达GPU。国产芯片虽然在持续进步,但在大规模商业部署中仍面临生态、软件栈和性能的多重挑战。GLM-5.3-Flash的实践证明:通过深度的系统优化和算法-硬件协同设计,国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。
这不仅是智谱一家的工程成就,更是国产算力生态走向成熟的标志性事件。
六、GLM-5.3-Flash的开源生态与开发者体验
6.1 多重入口:开源权重、API与Coding Plan
智谱AI正式开源GLM-5.3-Flash提供了三种使用方式,覆盖不同层次开发者的需求:
第一,开源权重(Hugging Face) 。模型权重以MIT许可证在zai-org/GLM-5.3-Flash仓库开放。开发者可以自由下载、本地部署,使用vLLM、SGLang、KTransformers等框架进行推理。这是最灵活的方式,适合需要深度定制、数据隐私要求高或有特殊部署需求的场景。
第二,API调用(BigModel.cn) 。智谱开放平台同步提供GLM-5.3-Flash的API服务。开发者无需管理硬件资源,通过标准API即可调用模型能力。API支持流式输出、Function Calling、上下文缓存、结构化输出(JSON)等能力。
第三,GLM Coding Plan。智谱AI正式开源GLM-5.3-Flash已纳入GLM Coding Plan,相较于GLM-5.3,可用额度增加至3倍。新版GLM Coding Plan采用基于积分的配额系统,在包括周末全天在内的非高峰时段进行的模型调用仅消耗标准积分的50%。
6.2 开发者实测:从3D引擎到多模态字幕
在Ox Alpha匿名测试期间,全球开发者已经用GLM-5.3-Flash(当时还叫Ox Alpha)做了大量实测。
其中最引人注目的案例之一,是开发者用GLM-5.3-Flash生成了一个SpaceX Raptor猛禽发动机的3D交互网页。博主Tim Jayas时隔几日用同样的Prompt让模型做了两次这个任务后,直接感慨:“感觉‘牛来’是一个能自己持续学习的模型。”
量子位的测试团队也拿到了GLM-5.3-Flash的内测资格,做了同款项目。输入Prompt之后全程无需任何操作,模型自动完成了3D猛禽引擎的生成。从效果对比来看,GLM-5.3-Flash做出来的3D猛禽引擎比之前版本更加精进。
在多模态能力方面,测试团队给GLM-5.3-Flash提供了一个多人说话的视频,要求它基于原视频分清谁在说话并精准配上字幕。这一任务考验的是模型的视频理解、人物识别、语音分离和时间轴对齐等多重能力——这正是原生多模态模型相比“文本+外挂视觉模块”方案的优势所在。
七、行业影响与未来展望
7.1 轻量旗舰模型市场的竞争格局
2026年8月,大模型行业正处于一个微妙的转折点。
6月,智谱发布GLM-5.2;7月,Kimi发布K3模型;8月,DeepSeek V4 Pro正式版发布,随后DeepSeek V4 Flash完成提价。性能提升的同时,涨价一度占据了叙事的主流——Kimi K3的输出价格高达100元,智谱在上半年提价后输出价格也达到28元。
智谱AI正式开源GLM-5.3-Flash选择了截然不同的路径:用更低的成本结构支撑更低的价格,同时不牺牲模型能力。
这一选择的市场信号非常明确:轻量旗舰模型市场正在从“性能竞赛”转向“性能-成本综合竞争”。随着AI模型能力持续提升,轻量旗舰模型能够负担越来越多的工作任务,这创造了新的增长空间。
7.2 开源 vs 闭源:一条新的分界线
智谱AI正式开源GLM-5.3-Flash的MIT协议开源策略,在商业模型纷纷提价的背景下显得尤为突出。
MIT许可证是现存最宽松的开源协议之一,允许任何个人或组织自由使用、修改、分发甚至商业化部署,唯一的条件是保留版权声明。这意味着GLM-5.3-Flash不仅仅是一个可以“试用”的模型,而是一个可以真正拥有和掌控的模型。
在全球AI领域,开源与闭源模型的分界线正在变得日益清晰。闭源模型(如Claude Opus 4.8、GPT系列)提供强大的性能,但使用成本高昂且受制于供应商的定价策略。开源模型(如GLM-5.3-Flash、DeepSeek系列)则提供了另一种可能:性能接近主流闭源模型,但成本大幅降低,且开发者拥有完全的控制权。
智谱AI正式开源GLM-5.3-Flash,以57分的AA指数和1/40的价格,为“开源模型能否进入前沿能力区间”这一问题给出了一个强有力的回答。
7.3 从“氛围编程”到“智能体工程”
智谱AI一直将“推动编程范式从Vibe Coding转向Agentic Engineering”作为GLM-5系列的核心使命。
GLM-5.3-Flash的视觉Coding能力,正是这一愿景的具体实现。当模型能够主动观察界面、渲染结果与交互反馈并据此持续改进时,编程从“人写代码、人看效果、人修Bug”的循环,变成了“模型写代码、模型看效果、模型修Bug”的自主闭环。
这不仅是效率的提升,更是编程范式本身的变革。开发者不再需要事无巨细地描述每一个UI组件的位置和样式,只需要描述想要的效果,模型就能自主完成从设计到实现的全流程。
7.4 国产算力的全球化验证
智谱AI正式开源GLM-5.3-Flash的另一层深远意义在于国产算力的全球化验证。
10万张国产芯片集群承载来自全球开发者的真实流量——这不是一次公关演示,而是一次持续六天的大规模生产环境压力测试。模型在OpenRouter和OpenCode上登顶榜首、刷新历史纪录的事实证明,用户(包括海外用户)在乎的是速度、稳定性和效果,而不是芯片的品牌。
当国产芯片能够在前沿AI模型的推理服务中达到与主流英伟达GPU相当的水平时,整个AI产业的算力供应链将迎来结构性的变化。这不仅是技术上的突破,更是产业自主可控的重要一步。
八、FAQ:关于智谱AI正式开源GLM-5.3-Flash的常见问题
问1:智谱AI正式开源GLM-5.3-Flash的总参数量和激活参数量分别是多少?
答:GLM-5.3-Flash总参数量为320B(3200亿),激活参数量为18B(180亿)。它采用MoE(混合专家)架构,每次推理仅激活180亿参数进行计算。
问2:GLM-5.3-Flash使用什么开源协议?
答:智谱AI正式开源GLM-5.3-Flash采用MIT开源许可证。这是最宽松的开源协议之一,允许自由下载、部署、修改和商业化应用。
问3:GLM-5.3-Flash的性能处于什么水平?
答:GLM-5.3-Flash在Artificial Analysis Intelligence Index中取得57分,与Claude Opus 4.8得分持平,超过GLM-5.2和DeepSeek V4 Pro(53分),进入全球前沿模型能力区间。
问4:GLM-5.3-Flash的API价格是多少?
答:每百万Token输入0.8元、输出2.8元、缓存命中0.23元。这一价格仅为GLM-5.3的十分之一,限时折扣期间为二十分之一,约为Claude Opus 4.8的四十分之一。
问5:GLM-5.3-Flash支持哪些模态输入?
答:GLM-5.3-Flash是GLM-5系列首个原生多模态模型,支持文本、图像和视频输入。上下文窗口长度为1M Tokens。
问6:GLM-5.3-Flash跑在什么芯片上?
答:GLM-5.3-Flash的全部推理服务由超过10万张国产芯片承载。算力供应商或来自华为、摩尔线程与海光。
问7:GLM-5.3-Flash和GLM-5.3是什么关系?
答:GLM-5.3-Flash并不是GLM-5.3的蒸馏版本或精简版本,而是一个重新训练的基础模型。它采用与GLM-5.3不同的架构设计,总参数320B(GLM-5.3为753B),但性能超越了GLM-5.2。
问8:在哪里可以下载GLM-5.3-Flash的模型权重?
答:模型权重已在Hugging Face平台上线,仓库地址为zai-org/GLM-5.3-Flash。开发者也可以通智谱开放平台(BigModel.cn)调用API。
问9:GLM-5.3-Flash的“原生多模态”和“外挂视觉模块”有什么区别?
答:“原生多模态”意味着视觉理解能力从一开始就构建在模型的基础架构之中,视觉信息与文本信息在同一个模型中进行联合处理。而“外挂视觉模块”是在纯文本模型上额外添加一个视觉编码器,两者在信息融合深度和任务协同效率上存在本质差异。
问10:GLM-5.3-Flash的“牛来”这个名字是怎么来的?
答:在智谱AI正式开源GLM-5.3-Flash之前,模型以Ox Alpha的匿名身份在OpenRouter和OpenCode上测试。中文社区根据其匿名状态和“牛”的意象,给它起了“牛来”这个昵称。

