智谱GLM-5.3-Flash登顶双榜 仅1/40顶级模型价

此前在海外AI社区横空出世的匿名模型Ox-Alpha,终于揭开了神秘面纱。这款模型并非来自谷歌或是新晋海外团队,而是国内厂商智谱推出的GLM-5.3-Flash。
在上线前的一周里,这款模型没有官方发布会,也没有公开模型参数,厂商一栏只标注了“stealth”(匿名)。上线仅一天,它就同时登上了两大AI调用平台的调用量榜首,不仅创下了新发布模型的登顶纪录,还终结了另一个头部模型连续56天霸榜的记录,期间累计调用量达到62T token。
相关领域的开发者直接评价称,这款模型在所有内部基准测试中都表现碾压级,甚至发出了“这到底是什么存在”的感叹。
一时间全球开发者纷纷猜测其背后的研发团队,甚至有账号伪装成Gemini团队来蹭热度,还有截图流传称其性能疑似大幅超越另一款顶级模型。
最终谜底揭晓,Ox-Alpha正是GLM-5.3-Flash。作为GLM系列的首个原生多模态模型,它支持100万token的上下文长度,核心主攻方向为代码开发与智能体应用,上线当天就以MIT协议完成开源。
不要被名字里的“Flash”误导,这款模型并没有降低性能档位,而是直接跻身顶级模型第一梯队。根据公开榜单数据,它的表现明显优于DeepSeek V4,能力对标Claude Opus 4.8,而调用价格仅为后者的1/40。
极具冲击力的定价优势
就在两周前,另一款头部模型刚刚调整了定价策略,分时段收取不同的调用费用,当时有人感叹“地板价”的时代可能要结束了。但GLM-5.3-Flash直接打破了这一局面,国内公开定价为每百万输入token仅0.4元,输出token为1.4元,甚至比对手的闲时段底价还要低。
即便是优惠折扣结束后的正价阶段,输入token0.8元、输出2.8元的定价,依然低于对手的闲时段底价,全时段价格仅为对手闲时价的30%左右。
这就是行业所说的“价格斩杀线”:对手精心设计的分时定价,闲时段价格是留给开发者的最低优惠,但GLM-5.3-Flash的五折优惠价就已经低于对手的闲时段底价,即便恢复正价,依然比对手的闲时段底价更有优势。
在五折优惠期间,GLM-5.3-Flash的性价比几乎碾压了所有同档位模型,剩下未被覆盖的,都是价格高出数百甚至数千倍的顶级模型,称其为性价比之王毫不为过。
当然,价格只是入场券,真正能留住用户的还是模型的实际表现。在官方官宣后,我们第一时间将GLM-5.3-Flash接入测试平台,开展了多维度的能力验证。
复杂3D空间建模能力
第一项测试我们直接拉满了任务复杂度:要求模型根据公开的城市建筑数据,将北京北站到北五环的京张铁路遗址公园沿线约11.4平方公里的区域,构建成一座可交互的微缩3D城市。这项任务的数据来源极其繁杂,包含建筑、道路、铁路、水系、公共空间和各类POI信息,且不同数据的坐标系、格式都存在差异。
这类任务非常考验模型的数据预处理能力,但GLM-5.3-Flash完成了所有数据的清洗、格式转换与坐标系统一,最终成功搭建出了一套完整可交互的3D城市沙盘。最终生成的场景中,包含了4522栋建筑、2489条道路、106条铁路线路、23处水系要素,以及1077个实地POI信息。
我们在搜索框输入“北京北”,页面自动给出了真实的地点候选;点击“北京北站”后,镜头会沿着铁路沙盘自动跳转,对应的建筑会高亮显示,同时弹出定位标记与详细属性面板。模型不仅支持精准搜索与跳转,还能直接查询对应建筑的数据源信息。我们对比了多个地标位置,与真实遥感卫星影像几乎完全一致,表现堪称完美。
这项测试最能体现模型的智能体能力:它需要完成的并非简单的代码编写,而是一整套完整的数据处理链路——从数据清洗、坐标系转换,到最终3D场景搭建,任何一个环节出现疏漏,最终的沙盘都会变成华而不实的空架子,无法正常交互。
原生多模态能力
接下来我们测试了模型的原生多模态能力:我们提供了两张喀斯特地貌照片和一段时长近一分钟的视频,要求模型基于这些素材,制作一个博物馆风格的教学网站,完整演示喀斯特地貌的形成过程。模型需要先理解图片与视频中的地质信息,提炼出完整的演化逻辑,再将其转化为可交互的动态演示内容。
GLM-5.3-Flash首先分别解析了三份素材,随后将喀斯特地貌的形成过程拆解为六个连贯阶段:酸性雨水形成、雨水渗入岩石裂缝、裂缝逐步扩张、落水洞与地下河形成、洞穴持续扩大,最终形成钟乳石与石笋。
生成的教学网站还提供了降雨量、裂隙数量、岩石可溶性与地下水位四个可调参数,用户可以自由调整参数观察地貌变化的差异。这项测试不仅验证了模型对视觉素材的理解能力,更证明它能梳理出不同变量之间的联动关系,并将这些逻辑转化为可交互的动态效果。
不过将视频素材转化为网页内容只是第一步,我们进一步挑战了更复杂的视频剪辑任务:让模型直接重构视频的时间轴,重新组织人物、声音、镜头与字幕。我们准备了两个难度差异极大的剪辑任务。第一个任务是一段多人对谈视频。
要求模型先识别不同的说话人,再为每个人生成固定底色的字幕,并实现“当前词句高亮卡拉OK”的双层字幕效果:每个说话人对应一种固定配色,当对应词句被读出时,文字会从低亮度平滑过渡到高亮。配色限定为青蓝、暖黄、珊瑚红与白色的高对比组合,同时需要区分主讲人、主持人与短暂插话者,背景音乐、掌声和环境人声不能被识别为说话人。字幕必须基于剪辑后的最终时间轴重新对齐,不能沿用原视频的旧时间戳。
目前市面上很多自动字幕工具经常会在剪辑后出现时间轴错位的问题,最终还需要人工逐一调整。但GLM-5.3-Flash轻松完成了这项任务。我们回看执行记录时发现,模型并非仅通过声音识别说话人:有一位说话人的身份铭牌仅在画面中一闪而过,模型单独截取了这一帧画面,通过铭牌信息确认了说话人身份。最终生成的字幕位于画面安全区域,带有描边与底板,在复杂背景下依然清晰可读,剪辑点过渡自然流畅。
第二个任务则是将完整的电影《神话》片源交给模型,要求剪辑为一条中文解说视频:梳理电影主线剧情与人物关系,突出关键冲突与情绪转折,确保解说内容与原片完全一致,并自动生成配音与中文字幕。这相当于让模型完整看完一整部电影,再重新梳理并输出完整的解说内容。
请将这部完整电影剪辑成一条中文电影解说视频,梳理主线剧情和人物关系,突出关键冲突与情绪转折,确保解说内容与原片一致,并生成配音和中文字幕。
最终生成的解说视频开场就能快速带入剧情,主线清晰,人物关系与关键转折交代明确,剪辑节奏稳定,镜头衔接自然,几乎没有生硬的跳转,成品已经接近可直接发布的专业解说视频。作为一款定位为“Flash”的模型,它一次性完成了长视频理解、时间轴重构、配音与字幕合成的完整链路,表现远超预期,堪称惊艳。
代码开发与智能体能力
第一项代码相关测试是网页复刻:我们仅提供一段网页录屏,要求模型根据视频中的界面内容复刻出完整网站。原页面是一个黑底创意工作室主页,包含首屏标题、两侧悬浮画廊、底部胶囊导航,以及滚动交互的文字与图片,前端交互逻辑相当复杂。
最终复刻的页面虽然存在一些细节瑕疵,无法做到100%还原,但已经达到了80%的完成度——要知道这是一个视觉与交互都非常复杂的站点。很多模型在复刻网页时容易制造“完成”的假象:首屏颜色、卡片与按钮看起来相似,但实际点击后,上传、算法处理与导出功能往往无法正常使用,这是因为没有明确的验收标准时,模型通常只会优先完成最表层的视觉复刻。
为了验证模型的完整工程能力,我们让它开发一个兼具前端界面与后端逻辑的图片风格处理工具。参考资料仅包含两张界面截图、一段9.8秒的操作视频与四张样例图,模型需要自主完成从上传图片、选择算法、调整参数到最终导出结果的完整流程,同时要求不能照搬原站点品牌、不能调用外部生成式图片API,也不能仅用CSS滤镜敷衍了事。
GLM-5.3-Flash并没有停留在界面复刻层面,它真正将六种像素算法写入了Canvas,实现了六套调色板,以及分辨率、阈值、对比度、反转等可调节参数。在拖动参数时页面不会卡顿,相同的输入与参数组合也能得到稳定一致的处理结果。最终生成的工具支持从本地上传图片、实时切换算法与调色板、调整参数,并能将处理后的图片导出为PNG格式。这项任务虽然没有3D城市测试那么震撼,但却是四个测试中产品完成度最高的一个,也证明了这款模型不仅能复刻现有网页,更能完整还原产品逻辑,将算法、交互与导出功能整合为可用的完整工具。
最后一项测试是基于图片素材开发小游戏:我们提供了四张图片,分别是一头黄牛、一只小鸭、一只猫,以及浮岛搭桥的场景,要求模型开发一款搭桥小游戏。游戏规则为:将有限的桥块拖拽到浮岛之间的空位,当路线连通后,黄牛可以沿着桥梁走到浮岛找到小鸭。测试共设计了三关,后续关卡会加入L形桥、T形桥与简单分岔路线。
这项任务看起来简单可爱,但实际极易出现问题:3D场景搭建、拖拽命中检测、关卡状态管理、路径连通判断、移动端触摸适配、角色移动逻辑与庆祝动画,任何一个环节出现疏漏,游戏都无法正常运行。
完成所有测试后,再回看“对标Opus 4.8、价格仅为1/40”的宣传,我们由衷感到震撼。顶级旗舰模型当然也能完成这些任务,但GLM-5.3-Flash的价格优势实在太过突出。这种性价比带来的冲击,不亚于此前另一款顶级模型的开源发布。因为模型价格越高,开发者就越舍不得反复调整其生成的内容,但使用GLM-5.3-Flash时,即便代码出错、界面不够完善,我们也可以放心地让模型反复迭代优化,不用担心Token成本过高。这也正是这款模型名字“牛来”的贴切之处:它能完成繁重的任务,却只需要极低的使用成本。
当然,这款模型的低价并非依靠补贴硬撑:GLM-5.3-Flash采用了线性注意力与稀疏注意力结合的混合架构,对于近距离信息采用成本更低的处理方式,仅在需要回溯长上下文时,才会调取相关的信息片段。根据官方数据,相较于GLM-5.3,这款模型的注意力计算量降低了3.01倍,KV缓存缩小了4.44倍。正是因为计算量与显存占用的优化,才能让它在保持顶级性能的同时,将价格压到如此低的水平,这是结构性的成本优化带来的低价优势。
还有一个至关重要的细节:在相关平台上的真实请求,全部由国产芯片承载。此前谈及国产芯片在AI领域的应用,讨论焦点往往集中在能否稳定运行、是否兼容主流模型上,但这一次,GLM-5.3-Flash在匿名状态下承接了全球开发者的真实流量,并且成为了当周最受欢迎的模型,用实际表现证明了国产算力的实力。
最后为大家整理了当前的免费使用方式:在OpenRouter平台搜索stealth/ox-alpha即可找到该模型;在OpenCode终端中依次输入opencode、/models,搜索“Ox Alpha Free”即可使用。目前该模型免费开放,支持100万token上下文与多模态功能。欢迎大家在评论区交流讨论。

