牛来真身!智谱GLM-5.3 Flash多模态开源国产芯

此前在全球AI社区引发广泛讨论的神秘模型「牛来」(Ox Alpha),终于正式公开了身份——它是国内团队智谱全新发布并同步开源的GLM-5.3 Flash,同时也是GLM-5系列首款原生多模态模型。
在智谱正式认领之前,这款模型已经凭借出色的表现席卷海外平台:在OpenRouter上线首日便登顶榜首,刷新了单日Token使用量的历史纪录;在OpenCode平台,它更是直接终结了DeepSeek长达56天的霸榜状态。大量海外开发者在不知情的情况下反复使用该模型完成各类任务,硬生生将其推上了热度巅峰。
这款模型的核心参数仅为320B,但实际激活参数仅有18B,模型层数也从前代的92层压缩至45层,却在综合能力上全面超越了体量达753B的GLM-5.2。根据最新AA榜单数据,GLM-5.3 Flash拿下了57分,与Claude Opus 4.8的得分持平,跻身全球前沿AI模型行列。
在定价方面,GLM-5.3 Flash的售价仅为GLM-5.3版本的1/10,限时折扣下更是仅为GLM-5.3的1/20、Claude Opus 4.8的1/40,价格低于DS-V4-Flash,大幅降低了高端AI模型的使用门槛。
更值得关注的是,这款模型的所有算力支撑均来自国产加速芯片,此前匿名测试期间产生的62T Token全部跑在国产卡上,真正做到了核心技术与算力的自主可控。
为了全面验证这款模型的实力,我们针对其核心能力展开了多维度实测。
首先是编码与交互能力测试:我们先为模型提供了一份完整的移动端购物APP UI设计稿,要求其还原设计稿中的配色、字体、布局,并实现首页、商品列表、详情页、购物车、支付等全流程交互功能。对应的提示要求如下:
按照这张 UI 设计稿实现一个完整的移动端购物 App,尽量还原原设计里的配色、字体、图片、卡片和页面布局,并把图中展示的主要页面和购物流程做成可实际交互的版本。实现首页/发现、商品列表、筛选、商品详情、评价、收藏、购物车、配送、地址、支付、订单完成、门店地图、个人中心和设置等功能。
最终生成的可交互应用完美匹配了设计要求,各个功能模块均可流畅操作。针对复杂3D开发任务,智谱官方还展示了GLM-5.3 Flash独立运行12小时完成的Blender 3D场景构建项目,证明其可以高效完成耗时较长的专业开发任务。
作为首款原生多模态模型,GLM-5.3 Flash的多模态能力同样亮眼。我们先向其提交了一段多人对话视频,要求模型识别不同说话人,并生成带有颜色区分和实时高亮效果的精准字幕。对应的提示要求如下:
先识别不同说话人,再制作兼具人物颜色和卡拉 OK 跟读效果的字幕:人物底色保持固定,当前读到的词或短语进一步高亮。配色使用青蓝、暖黄、珊瑚红和白色的高对比组合,当前词由低亮度平滑过渡到高亮色。区分主讲人、主持人和短暂插话者,背景音乐、掌声与环境人声不单列为说话人。字幕必须基于最终时间轴重新对齐,任何剪辑后的片段都不能沿用源视频的旧时间位置。先通览全片再做决定,避免只依据开头样本推断后续结构。请保持剪辑点自然,优先保证人声清晰。字幕放在画面安全区,并用描边或底板保证复杂背景下可读。
模型不仅准确识别了每位说话人,还能捕捉到画面中仅出现一次的名签细节,完成了说话人与身份、声音的精准对应,字幕对齐也完全符合要求。我们还尝试让模型对完整电影《神话》进行解说视频制作,要求梳理剧情主线、突出关键冲突与情绪转折,并生成配套配音与中文字幕,对应的提示要求如下:
请将这部完整电影剪辑成一条中文电影解说视频,梳理主线剧情和人物关系,突出关键冲突与情绪转折,确保解说内容与原片一致,并生成配音和中文字幕。
最终产出的解说视频完整覆盖了核心剧情,剪辑连贯自然,解说内容与原片高度匹配。此外,我们还参考海外开发者的实测案例,尝试让模型生成SpaceX Raptor猛禽发动机的3D交互网页,有博主在使用后感慨:
感觉「牛来」是一个能自己持续学习的模型。
我们实测后发现,最终生成的项目效果比此前的测试版本更加精进,全程无需额外调整即可正常运行。
很多人好奇,仅320B参数的GLM-5.3 Flash为何能拥有如此出色的表现?答案就藏在「Flash」二字之中。
智谱从模型架构层面就开始深度优化效率:首先采用了线性注意力+稀疏注意力的混合架构,线性注意力负责捕捉局部信息,稀疏注意力通过轻量级索引器提取关键全局上下文,避免了超长上下文下全量Token的冗余计算。同时,模型新增了IndexPool模块,将索引器的缓存向量从4个压缩至1个,最终让注意力计算量相比GLM-5.3降低了3.01倍,KV Cache体积缩小了4.44倍。
针对Visual Coding任务,智谱专门搭建了数据合成流水线,让模型可以在执行过程中自主查看最终页面、交互效果与3D场景,并根据视觉反馈进行迭代修改,这也是其能完成设计稿还原、3D建模等任务的核心原因。
在国产算力适配方面,智谱将多模态编码、Prompt预填充与逐Token解码拆分为可独立调度、扩缩容的分离式架构,结合Layer Split、混合缓存量化等底层优化,让模型在国产加速芯片上也能稳定支撑多模态任务与1M超长上下文。端到端服务性能相比初始基线提升了3倍,单Token成本达到了与主流英伟达GPU相当的水平。
GLM-5.3 Flash的爆火并非偶然,它不仅打破了高端AI模型价格高昂的痛点,让前沿AI能力真正成为可日常使用的工具,更实现了模型、算力与开源生态的完整自主可控。
目前,GLM-5.3 Flash已经正式面向全球开源,同时接入ZCode与开放API,开发者与企业可以轻松获取模型权重并自行部署,进一步推动了国产AI生态的发展。
再看「牛来」这个名字,确实十分贴切:这款模型不仅性能强劲、效率出色,更实现了核心技术与算力的自主可控,真正做到了「能干活、吃得少」,是一款纯血国产的顶尖AI模型。

