爆火“牛来”模型揭晓 实为智谱GLM-5.3-Flash

过去的一个周末,全球AI开发者都在热议一款突然出现在OpenRouter平台的匿名模型Ox Alpha。这款没有公开研发方、未披露参数规模、也未发布技术报告的工具,仅以匿名身份开放测试,却在短短数日内冲上热门榜单,凭借出色的代码生成、复杂推理和长周期智能体任务表现,引发了行业广泛猜测。
如今谜底正式揭晓,这款引发热议的模型正是智谱推出的GLM-5.3-Flash。Ox Alpha最早于8月20日匿名登陆OpenRouter,当时平台将其定位为面向代码开发、持续智能体工作和生产负载的专业推理模型,支持文本、图片、视频输入,匿名测试版本提供104万Token的上下文窗口。
测试期间,平台推出了为期一周的免费开放活动,号称每日可提供100万亿Token的服务额度,这种近乎无限制的免费测试让模型快速积累了大量真实用户,就连Stripe联合创始人兼CEO体验后都评价其“非常令人印象深刻”。不少开发者发现,Ox Alpha在代码修改、前端生成、大型代码仓库理解以及连续工具调用方面的表现远超普通低成本模型,外界对其背后研发团队的猜测也愈发热烈。
实际上,Ox Alpha并非智谱全新打造的独立模型,而是GLM-5系列的新成员。这次匿名上线更像是一次大规模公开盲测:隐藏厂商和模型名称,让开发者基于实际使用效果自主判断,之后再正式公布身份与技术细节。智谱此前也曾用类似方式测试过Pony Alpha,这种方式可以减少品牌认知对评价的干扰,同时在正式发布前获得更真实的负载数据和用户反馈。根据官方披露,Ox Alpha在测试期间一度成为当周最受欢迎的模型,更值得关注的是,整个测试期间的全部推理流量,都由搭载国产AI芯片的大规模集群承载。
模型核心架构与基础特性
GLM-5.3-Flash属于混合专家模型,总参数量达3200亿,但每次处理Token时仅激活约180亿参数。这意味着它保留了大模型的参数容量,却无需在每次推理时调用全部参数,会根据输入内容将任务分配给部分专家网络,在模型能力、推理速度和部署成本之间找到平衡。
与GLM-4.5系列相比,两者总参数量相近,但GLM-5.3-Flash的激活参数从320亿降至180亿,模型层数也从92层减少到45层,直接降低了单个Token推理的计算量,这也是其名称中“Flash”的含义之一:并非单纯缩小模型,而是通过架构优化,用更少的实际计算量保留接近大型模型的性能。
作为GLM-5系列首款原生多模态模型,它可以同时处理文本、图片、视频和文件,还提供约100万Token的上下文窗口。官方表示,该模型采用了最新的30万亿Token多模态预训练语料,视觉能力并非在纯文本模型训练后外挂实现,而是在预训练阶段就将文本与视觉信息纳入统一模型。目前模型权重已在开源平台开放,采用宽松的MIT许可证,开发者可以通过多个主流框架进行本地部署。
三大核心亮点解析
1. 适配百万上下文的全新注意力架构
长上下文一直是大模型推理成本增长最快的部分,上下文越长,注意力计算量和KV Cache占用的显存就越大。为了降低开销,GLM-5.3-Flash采用了线性注意力与稀疏注意力结合的混合架构,这也是业内首款采用该架构的开源前沿模型。
线性注意力通过状态建模捕捉局部依赖,稀疏注意力则通过轻量级索引器从长上下文中检索相关信息,让模型不必在每次生成时让所有Token彼此进行完整计算,而是先处理局部信息,再检索全局内容。此外,团队还设计了IndexPool,通过加权池化压缩索引器Key向量,进一步降低百万Token场景下的延迟和内存占用。
根据官方测算,相比GLM-5.3,GLM-5.3-Flash的注意力计算量降至约三分之一,KV Cache规模降至约四分之一。不过官方也坦言,模型仍有优化空间,在与其他模型的对比中,其KV Cache规模仍略大于部分竞品。除此之外,模型还引入了Manifold-Constrained Hyper-Connections(mHC),用于提升模型扩展过程中的训练稳定性和参数利用效率。
2. 突出的代码与智能体能力
从官方公布的测试结果来看,GLM-5.3-Flash的优势集中在代码开发、工具调用和长时间智能体任务上。在DeepSWE v1.1测试中,它取得63.4分,高于GLM-5.2的46.2分,该测试考察的并非简单代码补全,而是模型能否进入真实代码仓库,理解项目结构、定位问题并完成修改。
在AutomationBench测试中,它拿到48.8分,而GLM-5.2仅为26.2分,此外它在NL2Repo、Toolathlon Verified、Agents’ Last Exam和Terminal-Bench 2.1中分别取得56.3分、78.4分、26.3分和84.3分。Terminal-Bench主要测试模型能否在真实终端环境中完成软件工程、系统管理和数据处理任务,需要模型实际调用命令、观察结果、处理错误并推进任务,更贴近真实的Coding Agent工作场景。
在官方内部的Z.ai Code Bench v1.0测试中,GLM-5.3-Flash在不同推理强度下都超过了GLM-5.2,最高推理强度下取得29.0分,接近Claude Opus 4.8的29.5分。第三方机构Artificial Analysis给其综合智能指数打出57分,在优惠价格口径下,平均每项任务成本约0.045美元,官方称过去需要约十倍成本才能获得相近水平的综合表现。
需要说明的是,不同模型的测试框架、环境、预算等存在差异,官方自测的结果仍需要更多第三方复现,而Ox Alpha的匿名测试恰恰补充了跑分之外的真实体验证据,在开发者不知晓厂商和模型名称的情况下,依然凭借实际使用获得了高关注度。
3. 视觉能力与代码执行的闭环融合
传统代码模型生成网页、游戏或3D场景后,主要通过程序运行和测试结果判断任务完成情况,但很多问题无法仅通过代码检查发现,比如网页按钮颜色与设计稿不符、Blender脚本运行正常但场景存在模型穿插、游戏可以启动但无法完成交互等。
GLM-5.3-Flash尝试打造“观察-实现-使用-修正”的闭环:模型先读取截图、设计稿、录屏或真实软件界面,生成代码并运行,再观察渲染结果并与参考画面对比,最后进行修改。为了实现这一能力,官方构建了面向视觉编码的数据合成流程,重点训练模型的自我视觉判断和改进能力,在前端开发场景中还引入了环境反馈强化学习,通过真实用户流程的智能体验证提升模型对GUI界面和交互结果的判断能力。该能力可以覆盖前端页面复刻、游戏开发、3D场景建模、CAD设计以及Computer Use等任务。
国产芯片支撑的全流量测试
GLM-5.3-Flash的官方披露中提到,匿名测试期间的全部推理流量都运行在国产AI芯片集群上。为了克服单颗国产芯片在计算能力和显存容量上的限制,团队基于SGLang开发了专用推理引擎,针对模型架构和硬件特点做了多项优化,比如线性注意力和LM Head采用节点内张量并行,引入ReplaySSM、W8A8量化、INT8/FP8/BF16混合KV Cache量化以及Layer Split等方案。
在集群层面,采用Encode-Prefill-Decode分离架构,将多模态编码、提示词预填充和逐Token解码拆分为独立调度的工作池,三个阶段的计算特征不同,拆分后可以分别分配硬件资源,避免不同负载互相等待。根据官方披露,这套系统已经运行在数万颗国产加速芯片之上,相比最初在同一硬件上的基线版本,端到端推理性能提升了3倍,每Token成本和硬件效率达到了与主流英伟达GPU相当的水平。
实测体验:覆盖逻辑、规划与视觉理解
不少开发者都对这款模型进行了实测,我们也进行了简单测试。GLM-5.3-Flash主打原生多模态、代码开发、长上下文和智能体任务,我们将测试重点放在“看懂-规划-执行-检查”的闭环能力上。
首先我们给出了一道逻辑题:有三个盒子,标签分别为“苹果”“橘子”“苹果和橘子”,全部贴错,只能从一个盒子拿一个水果,如何确定三个盒子的内容。模型仅用13秒,消耗2303 Token就给出了正确答案:从标有“苹果和橘子”的盒子取一个水果,因为标签全错,该盒子不可能是混合,只能是苹果或橘子,若取出苹果则该盒为苹果,“橘子”标签盒不能装橘子,只能装混合,“苹果”标签盒则装橘子,反之亦然。
接着我们又给出了一个日程规划需求:下周去上海出差三天,需要参加两场会议、采访三家公司,完成一篇2500字报道,要求每天工作不超过9小时,采访间隔至少40分钟,第一天晚上不能写稿,第三天下午5点前交稿,并检查时间冲突。模型给出了详细的三日日程方案,整体规划较为合理,但也存在一些细节疏漏,比如未计算通勤到机场的时间,且任务衔接过于紧凑未预留休整时间。
最后我们用一张财报截图测试其图片理解能力,要求提取模型名称、分数和排名并整理为表格,再总结三个结论,模型准确提取了图中所有数据,没有出现漏项或错位,并基于数据给出了三点合理结论:收入高速增长、毛利率改善、亏损结构分化。
海外社区的广泛讨论
模型正式发布后,海外社区围绕其技术路线、免费策略和实际部署展开了广泛讨论。有用户遗憾免费的Ox Alpha测试已经结束,可见其积累了不少用户;还有用户直接询问模型运行的具体国产芯片型号,也有人希望将其与其他编程模型套餐进行对比。
不过也有海外用户实测后提出质疑,称其在处理长时间编程任务时可靠性不足,连续测试多个周期仍无法解决简单Bug,有效输出有限。整体来看,海外用户的关注点已经从单纯的模型跑分,延伸到技术机制、底层硬件、使用成本和真实编程体验等多个维度。

