GLM-5.3成绩揭晓:Scaling Law不再只看参数量

近期,国内大模型领域推出的GLM-5.3在相关评测中拿到60分,而上一代的GLM-5.2得分仅为53分。两款模型使用了完全相同的基座,总参数规模达到753B,激活参数为40B,不少开发者反馈其代码编写体验出色,被认为是当前国产大模型的领先水平。不过也有不少声音提出疑问,为何此次研发方没有训练全新的基座模型。
针对这一疑问,国内大模型企业创始人唐杰在社交媒体平台上发布的一篇分享给出了清晰的解答,其中关于大模型缩放规律(Scaling Law)的解读充满了干货。
唐杰指出,大模型的缩放优化从来不止参数量一个维度。过去我们讨论大模型时,往往最先关注参数量,但单独的参数量其实无法完整反映模型的实际表现。如今评估大模型的表现,需要同时结合三个核心维度:模型训练所用的数据规模、算力资源的分配方向,以及模型运行的具体条件。这背后正是Scaling Law在近几年发生的迭代变化。
2020年,Kaplan等人通过研究得出了参数增长与数据增长的比例关系,认为参数量的增长速度应当远超数据量,大致比例为2.7比1。当时整个行业都遵循这一思路,不断推高模型参数量,万亿参数规模一度被视为大模型进步的必经之路。
到了2022年,Hoffmann团队基于四百多款不同规模的模型重新开展实验,结果发现算力最优的资源分配更接近每个参数对应20个Token。当持续增加算力投入时,参数量和训练数据量应当以相近的速度同步增长,这就是后来被称为Chinchilla Scaling Law的行业共识。
回头来看,此前推出的一批超大参数量模型,反而存在算力分配失衡的问题:参数量增长过快,配套的训练数据没有跟上,实际的模型效果并没有达到预期。
不过Scaling Law的迭代并没有停止,Chinchilla的研究前提是仅计算单次训练的成本,但如今上线后的大模型,每天可能被调用数十亿次,后续的推理成本往往远超单次训练的投入。如果将这部分成本纳入整体计算,模型的最优解会向参数量更小、训练周期更长的方向倾斜。
到了混合专家模型(MoE)的时代,此前简单的20比1的参数与数据比例已经不再适用。唐杰在分享中还区分了两个关键概念:总参数量决定了模型能够承载的知识总量、事实信息以及长尾数据的存储能力;而激活参数和每次前向计算的有效深度,则直接决定了模型的长程推理能力。
一般来说,需要依赖记忆的任务更依赖总参数量,而需要逻辑推理的任务则更依赖训练数据的规模。后续的研究进一步发现,当每个参数对应的Token数量固定时,继续增加总参数量反而可能降低模型的推理表现,而激活更多的专家模块则可以稳定提升模型的推理能力。
因此,大模型的实际能力早已无法单纯通过总参数量来概括。此次推出的GLM-5.3,更像是一次精心设计的控制变量实验,验证了在现有基座框架下,通过合理调整训练资源配比可以实现模型性能的提升。
大模型的缩放探索仍在持续,只是它已经从单纯追求参数量数字增长的路径,转变为一场寻找整体最优资源配比的系统性游戏。

