文章摘要
爆火于海外AI社区的匿名模型OX Alpha(中文名“牛来”),正式揭晓真身是智谱推出的GLM-5.3-Flash。它是GLM-5系列首款原生多模态大模型,性能接近顶尖大模型,定价远低于同类竞品,性价比极高,匿名测试阶段全程由10万张国产显卡提供推理算力。运营百万月活免费AI公益平台的作者测试后,已将平台服务全面切换至此模型,同时对国产算力能否支撑后续需求存有担忧。

我运营着一个面向大众的免费AI工具公益平台,目前月活已经接近百万,还有不少开发者基于我们的免费API进行二次开发。之所以能坚持免费提供服务,核心原因就是我们选用的模型性价比足够高,成本在可承受范围内。

但自从8月中旬某主流模型官宣涨价后,我们的运营成本直接翻倍,后续如果要扩大服务规模,成本还会进一步飙升。更让人头疼的是,该模型更新版本后,信息筛选的精准度和内容品味都出现了明显下滑,于是我花了一个周末的时间,手动标注了近千条新闻资讯,自建了一套评测集,用来寻找更适合我们平台的高性价比模型。

就在这时,一款匿名发布的神秘模型突然在海外AI社区爆火,它就是后来被证实为智谱全新发布的GLM-5.3-Flash。

这款最初名为OX Alpha的模型,在8月20日突然上线两大海外AI服务平台,自带100万原生上下文窗口,支持多模态功能,且全程免费试用,没有任何官方信息。短短几天内,它就登顶了两个平台的热度榜首,引发了整个AI圈的疯狂猜测。社区用户还给它起了个中文名“牛来”,因为OX的谐音与“牛”相关,相关猜测的帖子在社区刷屏,有人猜是小米、有人猜是其他厂商,甚至连其他头部模型都被拉来凑热闹,相关讨论的热度一路走高。

虽然有硬核用户通过技术手段实锤这款模型属于智谱,但直到8月27日晚,官方才正式官宣,这款神秘的OX Alpha正是GLM-5.3-Flash。

作为GLM-5系列的首款原生多模态模型,GLM-5.3-Flash采用了320B总参、单次激活18B的MoE架构,并非简单对现有模型进行蒸馏优化,而是基于30万亿Token的多模态预训练数据全新训练而来,支持图像、视频和文本三种输入形式,原生上下文窗口达到100万Token。不过这款模型的命名方式有些让人意外,明明是全新的预训练模型,却被命名为GLM-5.3-Flash,按照常规逻辑,GLM-5.5-Flash可能更符合它的定位。

从性能跑分来看,这款模型的表现相当亮眼:在多个专业基准测试中,成绩基本逼近顶尖模型Claude Opus 4.8。在Terminal-Bench 2.1中拿到84.3分,接近Claude Opus 4.8的85.0分;DeepSWE 1.1得分63.4,Toolathlon得分78.4,Agents' Last Exam得分26.3。在智谱内部的专业代码评测中,最高思考档位下得分29.0,仅比Claude Opus 4.8的29.5分稍低一点。匿名测试阶段,社区用户的反馈也一致好评,整体体验与顶尖模型相当。

不过很多人会疑惑,在当下的技术环境中,对标顶尖模型似乎并不算最前沿,但这款模型真正的杀手锏,其实是它的定价策略。官方公布的定价为每百万输入Token 0.8元,每百万输出Token 2.8元,且在2026年9月9日24:00前,用户可以享受半价优惠,输入仅需0.4元/百万Token,输出1.4元/百万Token,缓存输入更是低至0.115元/百万Token。

这个价格比此前被称为大模型性价比标杆的同类产品还要低,甚至比同档位其他模型的空闲时段价格还要便宜一半,同时模型能力还要强于同价位的竞品,堪称当前性价比最高的高性能大模型之一。有用户戏称,智谱这次终于掌握了“滑动变阻器”式的定价策略,把高性能模型的价格调到了大众能轻松接受的区间。

更值得关注的是,这款模型在海外匿名测试的一周时间里,全部推理算力都是由10万张国产显卡支撑的。研发团队针对国产芯片的显存容量和带宽特点,对整套推理系统进行了针对性优化,让国产显卡能够稳定承载全球用户的免费流量,这一突破对于国内AI产业来说意义重大。

回到我自建的评测集,原本我担心这款全新的大模型在信息品味和世界知识上可能有所欠缺,但测试结果却让我非常惊喜。GLM-5.3-Flash的精选率达到了68.1%,也就是近七成的内容筛选结果和我手动标注的标准一致,而其他几款同价位的竞品精选率都未超过50%。在垃圾内容拦截率上,几款模型的表现都接近90%,差异可以忽略不计。

从打分分布来看,GLM-5.3-Flash的分值分布最接近自然的正态分布,代表模型的评分逻辑更合理、多样性更好。而其他竞品的打分高度集中在少数区间,多样性严重不足,这也解释了为什么它们更新后内容筛选效果下滑明显。

基于这些测试结果,我已经决定将免费AI工具公益平台背后所有的AI服务全面切换到GLM-5.3-Flash,它不仅价格低廉、性能强劲,还完美契合我们对内容品味的要求。

作为GLM-5系列的首款原生多模态模型,GLM-5.3-Flash的多模态能力同样超出预期。我尝试用它开发基于传统螺钿工艺的数字艺术实验网站,只需要简单的提示词和几轮对话修改,它就自动生成了带有光影动画的螺钿工艺效果,配套的文案也极具意境,比如“老翁不语,钓起半江灯火”“帆一转,家就近了一寸”这样的句子。

我还让它生成了一个由墨水线条组成的交互生物,鼠标移动时它会跟随转向,按下空格键还能随机重组形态,最终成品的审美和可用性都非常出色,甚至不需要额外的设计技能就能做出一个以蓝色为主色调的极简专业网页。

我还测试了该模型的代码开发能力,短短五个多小时的高强度测试,消耗的额度也在合理范围内,进一步验证了它的高性价比。

我一直认为,真正有价值的AI模型,应该是能够被大众日常使用的基础设施,当前沿智能的使用成本降低到可以被适度消耗时,它才能真正赋能各行各业。GLM-5.3-Flash正是这样一款产品,它凭借原生多模态能力、顶尖的性能和极致的性价比,有望成为未来很多用户的默认选择。

根据我的使用经验,目前我会将不同模型搭配使用:日常快速开发任务使用速度快、用量充足的模型;高难度长程任务依然依赖稳定性拉满的顶尖模型;而所有系统自动化任务、后端开发和日常办公任务,则全面切换到GLM-5.3-Flash,实现成本和性能的最优平衡。

当然,我也有一点担心,就是研发团队的算力储备能否支撑起这款模型爆发后的Token消耗,尤其是在依赖国产显卡的情况下。希望未来能有更多国产算力厂商加入,共同撑起国内AI产业的天空,也祝愿国内的AI产业能够越来越好。

好了,今天的分享就到这里,大家晚安。

以上内容不代表本平台立场,仅供读者参考