GLM 5.3后训练Scaling:750B小基座游戏音乐场景突破

近期一款新的大模型引发了行业关注——GLM5.3不仅拿下了行业AA榜前十的成绩,更以750B的参数量成为同分段中体量最小的选手,同时还将保持前代定价并于下周开源,堪称AI领域的性价比之王。
目前GLM5.3的API已经上线,其定位非常清晰:擅长复杂编码任务、长程Agent开发,同时强化了防御性网络安全能力。在最新的AA榜单中,GLM-5.3拿到了60分的成绩,跻身前十行列。整个榜单中得分60分及以上的模型共有六款,GLM5.3的体量仅750B,是其中最小的——对比来看,Kimi K3约2.8T参数量,Grok 4.6约1.5T,通过IKP方法预估的GPT 5.6 sol和Claude Opus5的参数量则分别达到1.99T和2.1T。
值得注意的是,GLM5.3并没有选择通过堆叠参数来提升性能,而是沿用了和GLM-5.2完全相同的基础模型,仅通过后训练就实现了分数的大幅提升。这一突破也为AI模型的优化思路提供了新的参考:我们平时讨论AI变强时,往往默认会想到扩大模型参数量、投喂更多训练数据,但模型扩展(Scaling)并不应该只关注参数量这一个维度。
从行业发展脉络来看,从Kaplan提出的优先堆参数量的思路,到Chinchilla提出的“相同算力下模型和数据应该同步增长”的结论,已经说明参数和数据之间不存在永恒不变的最优比例;当加入大规模推理成本的考量后,最优解会进一步转向参数量更小但训练更充分的模型;而MoE(混合专家)结构则让模型参数量拆分为总容量、激活计算、有效深度等多个维度,不同维度的作用也各不相同。因此,真正的Scaling应该是对模型全生命周期的算力进行重新配置,而智谱选择后训练的优化路径,正是因为这一方向剩余的优化空间最大。
在实际测试中,GLM5.3的表现同样亮眼。我们首先测试了它的编码能力:给出“编写一段可视化单向街道红绿灯与随机车流的Python代码”的prompt,没有提供UI规范、红绿灯切换规则或者车辆移动逻辑,第一次生成的代码就完整实现了核心功能:车流以随机频率出现,车速有明显变化,遇到红灯会自动停下,没有出现穿模或者模拟崩溃的问题。
write a python code that visualizes how a traffic light works in a one way street with cars entering at random rate.
之后我们补充了“保留现有交通模拟逻辑,优化UI和视觉质量,让效果更接近成品”的提示,仅用一句话就大幅提升了视觉质感。对比deepseek v4 pro + deepseek harness标准模式,在质量相近的情况下,GLM5.3的生成速度比deepseek快了两倍左右,而且UI细节更加丰富,比如为小车添加了大灯和刹车尾灯,适配夜间场景的视觉效果。
Keep the existing traffic simulation logic, but refine the UI and visual quality to make it feel more polished and closer to a finished product.
除了编码能力,GLM5.3还重点提升了安全分析能力,甚至公开了其团队联合安全团队发现的2404个漏洞,其中1088个属于中高危漏洞,最早可以追溯到约40年前,覆盖Android、Windows、macOS和常用App等多个软件生态。
我们用一款曾给我们带来困扰的菜单栏管理工具Ice的源代码进行测试,要求GLM5.3排查菜单栏图标隐藏、状态恢复相关的逻辑问题。原本以为这类问题很难定位甚至无法根除,但GLM5.3很快就缩小了问题范围,一路追踪到Ice隐藏图标的机制、菜单栏状态恢复逻辑,以及对macOS私有API和模拟拖拽事件的依赖。更难得的是,它还主动对照了项目官方文档和GitHub Issues,找到了和我们遇到的现象高度一致的上游问题,将外部线索和本地源码进行了对应,最终给出了完整的问题链:现象是什么、为什么会发生、哪段代码负责、为什么新版macOS更容易触发、如何恢复以及代码层面的修复方案。同时它还完成了一轮安全审查,将私有API、Accessibility权限、屏幕录制权限以及强制终止其他菜单栏App的高风险行为单独列出,明确区分了真正的安全风险和兼容性/设计缺陷。
我们将同样的提示语交给当前使用的Grok 4.6进行测试,发现两者的思路差异明显:Grok更倾向于提供环境配置方案或者替换工具的建议,而GLM5.3则直接给出了软件代码层面的修复方案,针对性更强。
接下来我们提升了测试难度,开始复刻经典游戏。首先测试的是2D节奏跑酷游戏,要求实现角色移动、跳跃、音效和特效等功能。GLM5.3生成了三个不同主题的关卡,搭配自研的Canvas渲染器,实现了角色移动和碰撞逻辑。实际运行后,完成度远超预期:角色起跳时有对应的音效,撞击、死亡和场景元素都有反馈;背景、障碍物和前景有清晰的空间层次,镜头跟随角色高速推进的效果自然,方块碰撞时有物理变形,撞到尖锐物体会爆开,挂掉后可以快速重启,不会打断游戏节奏。唯一的小遗憾是我们自己都很难通过第一关。对比字节的Seed-Evolving模型,GLM5.3在游戏背景和实体互动性上表现更突出,比如关卡中的球体使用了弹性物理效果,而Seed-Evolving则使用了发光球体效果。
之后我们尝试了3D版的《愤怒的小鸟》,这是我们童年熟悉的经典游戏,但这次要求将其转换为3D版本。整个过程耗时较久,我们一晚就消耗了20%的周额度,但最终的结果令人惊喜:GLM5.3生成了三个关卡,补充了弹射、碰撞和关卡流程的音效,实际游玩时基本玩法都能正常运行,鸟可以被拉动、发射,碰撞建筑后有真实的物理反馈。整体完成度远超预期,唯一的明显Bug是发射完一只鸟后,弹弓有时会空掉,下一只鸟没有正确补位。对比Kimi K3的测试结果,GLM5.3设计的关卡数量更多,而且物体被击破后的消失效果是粉末状爆破,而Kimi K3则是物体延迟掉落再爆开,两者各有特色。
最后我们尝试开发一个自用的音乐工作台Cadence:因为喜欢Spotify的音乐工作台界面,但不想为UI付费,我们将需求整理成prompt交给GLM5.3。它不仅实现了Listening、Library、Album、Playlist等核心功能模块,还考虑了不同页面之间的层级和整体视觉质感,第一次生成的结果就已经非常完整。更难得的是,它没有使用大量重复的占位符,不同专辑、歌曲、封面和内容之间都有自然的变化,第一眼看起来没有明显的AI生成页面的生硬感。我们后续或许会开源这个本地AI音乐播放器。
六个测试场景全部完成后,我们可以看到,所有的优秀表现都基于同一个750B的基座模型,也是同分段参数量最小的模型。这再次证明,我们不需要永远追逐更大的基座模型,当优化环境足够真实、奖励机制足够明确、系统足够灵活时,即使参数量只有同分段的1/4,也能实现出色的性能表现。GLM5.3的这次升级,是一次笃定的、基于正确思路的技术实践,也让我们更加期待GLM系列的下一次更新。

