文章摘要
此前在海外爆火的匿名大模型“牛来”(Ox-Alpha)身份揭晓,为智谱推出的GLM-5.3-Flash。该模型是GLM-5系列首款原生多模态大模型,能力对标顶级闭源模型Opus 4.8,全流量由国产加速卡承载,定价仅为对标模型的1/40,现已以MIT协议面向全球开源开放,多场景实测表现优异,打破了顶尖大模型高成本的行业固有认知。

如果你常逛海外社交平台,大概率见过一个代号Ox-Alpha的匿名大模型刷屏的场景,国内社区给它取了个形象的昵称“牛来”模型。

该模型在上线海外模型聚合平台后调用量暴涨,连续占据周榜首位,单周token消耗量达到23.2T,成为当期最受用户欢迎的大模型。

在开源开发平台上,它同样创下新纪录:6天内token调用量突破42T,打破了此前DeepSeek Flash保持了56天的纪录。

没过多久,这个神秘模型的身份终于揭晓:它正是智谱推出的GLM-5.3-Flash,和谷歌等厂商的模型并无关联。

这款模型全称为GLM-5.3-Flash,总参数量320B,但仅激活18B即可运行,同时它也是GLM-5系列首款原生支持多模态的模型。

更让人惊喜的是,支撑每日超T级token处理量的算力基础设施,全部采用国产加速卡。

尽管参数量仅为320B,GLM-5.3-Flash的综合能力已经超越GLM-5.2,达到了与顶级闭源模型Opus 4.8相当的水准。

根据全球权威的智能指数评测结果,该模型的AA综合智能指数得分为57分,与Opus 4.8完全持平。

最吸引人的还要属它的定价:限时折扣价仅为GLM-5.3的1/20,更是仅为Opus 4.8的1/40。

此前行业普遍认为,顶尖AI模型的高性能必然伴随着高成本,想要使用顶级模型就需要付出高昂的成本。而GLM-5.3-Flash打破了这一固有认知,真正实现了物美价廉,重新定义了大模型的性价比标杆。

接下来我们通过多个实测案例,来直观感受这款模型的能力,建议先收藏以便后续参考。

从PDF到企业官网:一键生成多语言站点

用户上传一份产品年册的PDF文件,只需输入提示词即可直接生成专业的企业官网。我们的测试中,要求模型基于PDF内容生成纯日文的企业官网,文案需要地道自然,避免机翻腔,同时要求视觉效果精美大气、适配PC和移动端,还要包含好用的询盘表单,并且兼顾SEO和地域适配。

具体提示词为:基于这个PDF的内容,帮我做一个纯日文的企业官网,文案要地道自然(不是机翻腔)。视觉要精美大气、有高级感,PC和手机都能完美适配。要有一个好用的询盘表单,网站要考虑SEO和GEO。

由于这份PDF完全由图片组成,GLM-5.3-Flash的多模态能力发挥了关键作用:自动完成OCR识别、素材裁切与整理,生成网页后还能自主检查排版布局,真正实现了“有视觉能力”的AI体验。

一键生成带真实素材的专业PPT

不少人知道,苹果创始人乔布斯曾在一段时间内特别偏爱极端金属摇滚乐。我们以此为主题,尝试生成一份介绍该风格演变历史的PPT。

测试中使用的工具可以自动调用外部资源,获取真实的乐队成员照片、专辑封面,甚至会选用极端金属音乐常用的荆棘体字体。第一版生成的PPT部分页面布局略显杂乱,但模型会自动调用浏览器工具进行检查和调整,既聪明又省心。

复刻Linux桌面环境:Web版Omarchy界面生成

近期开源Linux发行版Omarchy 4.0在海外社区热度很高,我们尝试用一句话提示生成Web版的Omarchy桌面模拟界面。

最终生成的界面还原度极高,除了Hyprland的自动窗口布局交互细节略有不足外,终端、记事本、计算器、主题设置以及Super+K快捷键等核心功能都得到了完美模拟。

具体提示词为:使用HTML/CSS/JS在浏览器中复刻Omarchy Linux桌面环境,包括窗口装饰、任务栏和可用的启动器。

在线电子表格编辑器:全功能复刻

我们在海外社区发现了一个测试案例,尝试用GLM-5.3-Flash生成在线电子表格编辑器,结果完全符合预期:不仅支持公式计算,还可以生成图表、插入数据并导出CSV文件。

提示词为:重现一个基于网页的电子表格编辑器,包含编辑栏、单元格网格、自动求和、排序/筛选和图表插入功能。

基于视频素材生成互动小游戏

我们从免费商用视频素材平台下载了一段第一人称视角的林间摩托车骑行视频,以此为基础测试GLM-5.3-Flash的视频理解能力,让它生成一款摩托车骑行游戏。

最终生成的游戏操控手感流畅,除了手部建模略显抽象外,整体体验不错,还加入了赛道内加速、出界减速的合理设定。我们还尝试生成了《沙罗曼蛇》横版射击游戏,设计了完整的Boss关卡,虽然手残很难通关,但Boss的设计细节相当到位。

AI自动剪辑:三分钟电影解说制作

抖音上的三分钟电影解说大多依赖人工剪辑,我们尝试用GLM-5.3-Flash实现AI自动剪辑流程。经过一下午的探索,我们找到了一套无需手动下载原片的稳定剪辑方案。

最终生成的解说视频虽然字幕大小可调、开源TTS模型的效果还有提升空间,但整体节奏和画面匹配度都相当不错。最初我们尝试使用腾讯视频链接,但因版权问题无法下载素材,后来改用第三方台词素材平台,通过脚本自动搜索下载电影片段。

更有意思的是,模型自动调用了本地的硅基流动CosyVoice2模型来生成中文解说旁白。算下来成本极低:第三方平台会员每月仅29元,包含5000积分,单条解说仅需200左右积分;而GLM-5.3-Flash的token消耗仅十余万,几乎可以忽略不计。未来搭配更优质的TTS模型,就能快速批量生成电影解说视频,轻松成为影视解说博主。

性价比拉满的技术底层逻辑

官方公布的基准测试数据显示,GLM-5.3-Flash的DeepSWE v1.1表现优于Claude Opus 4.8。目前该模型限时五折,活动仅持续两周,百万token输入仅需0.4元,输出仅需1.4元,命中缓存后单价更是低至0.115元,堪称真正的价格屠夫,重新拉高了大模型的性价比阈值。

GLM-5.3-Flash采用了全新的模型架构:稀疏注意力与线性注意力混合架构。具体技术细节包括:

  • 采用稀疏注意力+线性注意力的混合架构,线性注意力通过递归机制捕捉局部依赖,稀疏注意力则依靠轻量级索引器召回全局上下文
  • 通过IndexPool技术将索引器缓存压缩至原来的四分之一
  • 与GLM-5.3相比,注意力计算量和KV缓存分别降低了3.01倍和4.44倍
  • 基于30T token的多模态预训练语料,原生支持1M上下文长度

这款模型的低价并非依靠补贴,而是通过架构优化和算力效率提升实现的。

官方透露,GLM-5.3-Flash的全部线上流量都由数万张国产加速卡承载,单日token处理量达到峰值,承接了全球范围的用户请求。这也是国产算力芯片首次实现大规模“集体出海”,证明国产加速卡完全可以在超大规模场景下,高效且经济地支撑前沿大模型的推理需求,这一成果值得肯定。

此前海外社区曾有人猜测该模型使用了英伟达的算力,显然并不属实。

目前GLM-5.3-Flash已经正式面向全球开源,采用MIT开源协议,300B参数规模的版本可以在所有国产加速卡上顺利部署。

行业意义与使用入口

从代号“牛来”的匿名模型爆火,到智谱正式公布身份,这段时间社区内的猜测热度很高,甚至有相关从业者出来蹭热度,也有人质疑这是过度营销。但不可否认的是,GLM-5.3-Flash将新架构、国产算力和极致性价比结合在一起,重新定义了大模型的性价比标杆。

当一款能力对标顶级闭源模型的开源大模型,售价仅为对手的1/40,且完全由国产加速卡支撑时,“顶尖AI模型昂贵且难以获取”的行业叙事或许真的要被改写了。

目前GLM-5.3-Flash已经接入ZCode等开发平台,纳入GLM Coding Plan,每日限量发放10000张体验卡,同时开放了API调用接口:

  • 国内用户可以通过BigModel开放平台使用
  • 海外用户则可以通过Z.ai平台访问
  • 开发者还可以通过GLM Coding订阅套餐获取更多资源
  • 代码工具平台ZCode也已支持该模型

评测不易,如文章对你或身边人有用,请一键三连。 ღ( ´・ᴗ・` )比心。

以上内容不代表本平台立场,仅供读者参考