文章摘要
近期国产轻量化大模型GLM 5.3 Flash发布,该模型运行于国产AI芯片,发布前就以匿名身份获得极高人气。行业数据显示其性能成本比优于竞品DeepSeek V4 Flash,多项测试胜出,视觉领域优势明显。作者实测网页复刻、3D交互、游戏开发等多类任务,完成度表现出色,当前国内大模型赛道竞争加剧,该模型推出引发行业关注。

近期两款轻量化大模型同日登场,让不少开发者和爱好者眼前一亮,其中GLM 5.3 Flash的表现尤为引人关注。早在这款模型正式发布前,外界就曾猜测代号“牛来”的匿名模型属于GLM系列,很快便通过分词探测技术得到了实锤。

首先被讨论最多的就是定价问题:GLM 5.3 Flash的调用成本为每百万输入Token 0.8元,每百万输出Token 2.8元。而另一款热门模型DeepSeek由于采用分时段定价策略,很难直接用单一数值对比,不过结合实际使用场景来看,两者的成本差距并没有想象中悬殊——因为GLM 5.3 Flash会通过多轮尝试提升回答准确性,会消耗更多的输出Token,和DeepSeek针对高准确率优化的缓存策略相比,实际的账单差异需要通过实际测试才能明确。不少开发者选择将两款模型放在同一环境中进行为期一周的AB测试,来选出更具成本优势的方案。

笔者此前开源的AI提示语案例网站goodcase,此前一直使用DeepSeek V4 Flash来生成提示语、案例摘要和技能描述,累计已经录入了700余个完整的提示语案例。随着平台的使用量增长,成本压力也随之上升,笔者甚至只能选择在夜间定时运行批量任务来控制开支。在GLM 5.3 Flash发布后,笔者第一时间将其用于重做goodcase的主页设计,目前已经面向用户征集两款设计方案的投票,计划将更受欢迎的版本更新到正式版本中。此外,笔者近期还在HICOOL 2026活动中为goodcase站台,欢迎感兴趣的朋友前来交流。

从行业公开的性能对比数据来看,GLM 5.3 Flash的表现相当亮眼。有行业分析机构发布了包含59个模型的“斩杀线图”,将模型智力得分与单次任务成本进行对比,GLM-5.3-Flash的红点落在了0.045美元对应57分的位置,恰好卡在性能成本比的前沿线上,而DeepSeek V4 Flash则位于其右上方,成本高出一倍的同时得分还低了6分。

进一步拆解14项基准测试的对比结果,GLM 5.3 Flash在与DeepSeek-V4的对决中赢下了11项:编码能力几乎打平,智能体场景的表现开始拉开差距,在视觉任务领域更是实现了碾压式胜利,六项视觉相关测试全部获胜,最大分差达到了40%。在AutomationBench测试中领先10分,GDPval测试更是赢下了近100分的差距。

值得一提的是,GLM 5.3 Flash在正式发布前曾以“ox-alpha”的匿名身份在OpenRouter平台运行一周,直接成为了当周最受欢迎的模型,处理的Token总量是第二名的2.3倍,而且所有的推理任务全部运行在国产AI芯片上。在行业的国产模型AA指数榜单中,GLM、Kimi、通义千问、DeepSeek、MiniMax等模型同框亮相,堪称国内大模型领域的群星闪耀时刻。

为了验证纸面性能在实际场景中的表现,笔者针对多个真实任务进行了实测,涵盖网页复刻、界面设计、3D交互和游戏开发等多个领域。

首先是网页复刻任务,按照官方宣传,GLM 5.3 Flash可以根据一张截图复刻出完整的网页。笔者最初对此持怀疑态度,先提取了官方演示案例的截图,向模型发送了“帮我根据这张图复刻这个网页,做个一模一样的出来”的提示词,仅用很短的时间就得到了还原度极高的结果:左侧侧边栏、底部导航栏的布局和原版完全一致,配色、间距和字体都贴合原图,就连一些模糊的细节也被模型自动完善,甚至连页面中的地图缩放功能都完整实现。

既然可以根据静态图片复刻网页,那么支持视频输入也就顺理成章。GLM 5.3 Flash官方宣传支持视频输入并自动抽帧分析,笔者随即上传了一段网页演示视频,要求模型根据视频画面复刻网站。模型自动使用ffmpeg工具将视频拆解为单帧进行分析,还原了视频中的所有视觉元素和过渡动画效果,仅用半个多小时就完成了复刻,静态页面的还原度达到了96%,仅在页面间的交互跳转流畅度上还有优化空间。

除了根据素材复刻网站,直接输入GitHub的官网链接也能快速得到复刻版本,仅用20分钟就完成了从0到1的搭建,细节还原度拉满,甚至可以发起一个无奖竞猜,让读者分辨复刻版本和原版的区别。

接下来尝试从零开始创作界面,首先要求模型生成钢铁侠贾维斯风格的2D科幻UI界面,给出的提示词为:

超写实的JARVIS赛博朋克桌面UI仪表盘,显示器上呈现真正可用的软件界面。
整体采用暗黑与深蓝配色,搭配发光的霓虹青色点缀和玻璃拟态面板。
中央是带有全息光环与粒子效果的AI能量球;
左侧显示系统状态和波形图;
右侧为神经网络聊天面板;
底部设有极简程序坞。
整体呈现电影级HUD视觉效果,精致度极高,16:9 画面比例。

生成的界面完美贴合了所有要求,包含了状态面板、中央蓝色能量球带轨道环、右侧对话窗口和底部命令输入栏,甚至还原了电影中的细节参数,比如ARC REACTOR 98.7%、THREAT LVL 0.02等。

原本以为2D界面已经达到了预期,随口提出能否制作3D可交互版本,模型随即按照要求生成了支持鼠标拖拽旋转的3D界面:中央的能量球变成了可旋转的3D模型,轨道环带有景深和动态效果,粒子会随模型旋转而动,左侧添加了控制输入区域,右侧实现了实时对话窗口,整体视觉效果拉满,审美在线。

最后尝试复刻一款完整的3D游戏,选择了浏览器端的像素风FPS游戏Krunker,直接提供官网链接要求模型复刻。整个过程耗时约一个多小时,核心的游戏逻辑包括3D场景搭建、移动、射击和碰撞检测在一开始就顺利完成,后续主要是修复一些小的BUG,比如W/S按键方向颠倒、开火时敌人偶尔无法刷新等问题。最终得到的游戏不仅可以正常游玩,还支持自定义音效,每局的敌人配置都会随机生成,完成度远超简单的模板复刻,表现直逼Opus5和GPT 5.6 Sol等顶级模型。

经过一系列实测可以明确,GLM 5.3 Flash并不是那种跑分好看但实际使用拉胯的模型,所有任务的完成度都相当高。笔者接下来的计划是,将日常批量运行的编码和智能体任务分流给GLM-5.3-Flash,进一步降低使用成本。

今年的大模型赛道整体呈现出内卷的态势:各家模型的定价越来越亲民,性能却越来越强劲,而且不少厂商选择直接开源模型,让开发者有了更多的选择空间,同时也降低了使用成本,每隔几周就能体验到全新的模型功能。不少人都在期待,被GLM 5.3 Flash拉低了成本阈值的DeepSeek,会推出什么样的应对方案。

以上内容不代表本平台立场,仅供读者参考