文章摘要
Z.ai推出GLM-5家族首款原生支持视觉能力的多模态语言模型GLM-5.3-Flash,其免费预览版完全基于国产自研芯片搭建,模型权重以商业友好的MIT许可开放免费下载。该模型采用混合注意力优化长上下文处理,性能优异、推理成本远低于同类模型,是当前表现最佳的开放权重模型,仅存在生成偏冗长、速度较慢的短板,印证了国产芯片可低成本部署高性能AI模型。

最近有一款匿名AI模型在主流模型服务平台上迅速蹿红,成为一周多时间里热度最高的服务之一,其背后的研发厂商和具体型号曾一度成谜。直到近期,这款模型终于揭开面纱——它是Z.ai推出的GLM-5.3-Flash视觉语言模型,此前曾以“Ox Alpha”的代号进行匿名预览。更令人意外的是,该团队透露,这款模型的免费高流量预览版完全基于国产自研芯片搭建,现在用户已经可以免费下载其模型权重进行使用。

模型核心参数与基础特性

这款模型是Z.ai自今年4月推出GLM-5V-Turbo以来的首款视觉语言模型,也是GLM-5家族中第一款原生支持视觉能力的产品,而非通过后期拼接视觉与文本模块实现多模态功能。它的输入输出能力覆盖全面:支持文本、图像与视频作为输入,最长可处理1048576个token的上下文,文本输出上限为128000个token,生成速度可达44.6 token/秒。

从架构上看,它采用混合专家(MoE)Transformer结构,总参数量达到3200亿,每个token仅激活其中180亿参数。它支持三级可调推理级别(低、高与默认max模式),且无法完全关闭推理优化;同时具备流式输出、工具调用与上下文缓存等实用特性。

根据第三方AI评测机构的测试数据,这款模型在综合评测中拿到57分,在真实世界知识工作任务榜单中位列所有模型第三,同时是开放权重模型中的表现最佳者。

获取与使用方面,用户可以通过GLM Coding Plan订阅获取服务,月费区间为18美元至168美元;API调用价格为每百万输入token 0.15美元、缓存token 0.03美元、输出token 0.50美元。模型权重采用商业友好的MIT许可证,可免费下载安装,但官方未披露该模型的知识截止时间与预训练数据来源。

技术架构与训练细节

GLM-5.3-Flash的核心设计思路是从底层原生构建多模态能力,而非将视觉模块与语言模块简单拼接。与同系列的更大尺寸模型GLM-5.3不同,这款模型是从零开始预训练的全新基础模型,团队还重新设计了注意力机制以优化长上下文处理效率。

它是GLM系列中首款混合使用两种注意力机制的模型:线性注意力是一种内存占用更低的变体,计算成本随输入长度线性增长,更擅长处理邻近上下文;稀疏注意力则可以覆盖完整的上下文范围。团队表示,这种组合将注意力计算量降低到GLM-5.3的三分之一左右,同时也优于DeepSeek-V4-Flash和Kimi K3两款竞品。

为了进一步优化百万级上下文的内存占用,模型加入了名为IndexPool的优化步骤,将每四个检索向量平均合并为一个向量。结合混合注意力机制,GLM-5.3-Flash的键值缓存占用仅为GLM-5.3的四分之一以下,不过仍略高于DeepSeek或Kimi的最优表现。

该模型在30万亿token的多模态语料库上完成预训练,同时采用了Manifold-Constrained Hyper-Connections技术,该技术将传统的层间连接拆分为多条并行路径,并在路径合并时保持训练稳定性,帮助模型实现高效扩展。

在训练数据生成环节,Z.ai让模型在可渲染前端页面、游戏场景或3D环境的平台中运行,通过让模型完成场景创建、修改并验证渲染结果的方式生成训练样本。针对前端开发任务,团队还尝试了强化学习方法,根据最终渲染页面的效果为模型输出打分,以此优化模型表现。

推理阶段,该模型仅会调用288个专家网络中的8个,同时仅使用约一半的网络层(总计45层,而GLM-4.5为92层)。此外,模型还加入了多token预测层,提前生成若干token供主模型校验,进一步提升生成速度。

实测性能表现

第三方实测数据显示,GLM-5.3-Flash的综合表现略低于顶级开放权重模型,但单任务成本仅为同类开放模型的八分之一左右,比顶尖专有模型低10到35倍。在长时间编码任务中,它的表现几乎与更大尺寸的GLM-5.3持平,但后者的单任务成本是它的16倍。

具体来看,在第三方AI评测机构的Intelligence Index评测中,该模型拿到57分,该榜单综合了九项高经济价值任务的测试结果,单任务平均成本仅0.09美元。在相近的成本下,它的表现接近开放权重领域的领跑者Kimi K3和GLM-5.3,两款模型均开启max推理模式,得分60分,单任务成本分别为0.84美元和0.68美元,它与Claude Opus 4.8持平,并优于Gemini 3.7 Flash。

在GDPval-AA v2的经济相关任务对决榜单中,GLM-5.3-Flash以1765 Elo的得分位列第三,落后于Claude Opus 5和xhigh推理模式的同系列模型,领先于Grok GLM-5.3和Grok 4.6。

在DeepSWE v1.1软件工程技能测试中,该模型可以一次性解决63%的任务,该测试要求完全从头编写代码,而非复用公开代码库。单任务成本为0.24美元,对比来看,GLM-5.3的解决率为69%,单任务成本3.99美元;Claude Opus 5开启max推理时解决率74%,单任务成本高达11.84美元。同尺寸的DeepSeek V4 Flash以两倍的成本仅解决了53%的任务。

不过该模型也存在明显短板:生成的文本内容偏冗长,且整体生成速度较慢。在完成Intelligence Index评测时,它总计使用了1.5亿个token,超过了评测的中位数1.1亿token。在多个硬件平台上,它的平均生成速度为每秒45个token,明显慢于GLM-5.3的每秒78个token,也低于第三方评测中所有测试模型的平均速度每秒69个token。

发布背后的策略与细节

在正式发布前的一周时间里,Z.ai以匿名方式推出了GLM-5.3-Flash的预览版,仅在专业编码开发平台和知名模型服务平台上免费独家提供。这种匿名发布的方式让团队可以在开发者不知情的情况下收集真实反馈,而这款代号Ox Alpha的模型也在一周内成为这两个平台上最受欢迎的服务。用户通过模型的tokenizer输出特征,仅用几天时间就猜测出这款神秘模型属于GLM家族。

8月26日,Z.ai正式确认了该模型的身份,并在标准MIT许可证下公开了其权重。两天后,团队又发布了旗舰模型GLM-5.3的权重,采用类似的MIT许可,但新增了一项条款:任何年收入超过100亿美元的企业,在将该模型权重用于商业用途前,必须先通过Z.ai的安全审查。

产品价值与行业启示

尽管GLM-5.3仍然在文本基准上领先于GLM-5.3-Flash以及几乎所有开放模型,但就目前而言,Z.ai的低价模型也是更先进、更多用途的那个。GLM-5.3只是一个能力很强的微调版,而Flash则拥有新的基础模型、架构和视觉能力。公司表示,其下一代旗舰模型将继承这种多模态、混合注意力架构,同时使用更多数据训练并展现更强能力。几个月前,GLM-5V-Turbo在视觉语言任务上超过了Claude Opus 4.6;下一代GLM系列模型或许也会同样挑战顶级专有多模态模型。

这款模型的匿名预览策略制造了足够的话题度和神秘感,同时也让用户可以基于真实表现评判模型。而最引发行业讨论的一点,是该模型的预览版依赖国产自研芯片搭建——这证明只要采用合适的内存优化方案,企业完全可以在低成本商用硬件上,规模化部署兼具成本效益与出色性能的AI模型,尽管这类模型的尺寸和速度可能暂时无法达到顶级前沿模型的标准。

以上内容不代表本平台立场,仅供读者参考