文章摘要
2026 AI技术有预训练回归与Scaling law新解。大模型缩放优化受多因素影响,行业对缩放定律认知不断演进,从早期配比到更优配比。推理成本使模型设计转向“参数少但训练充分”。MoE模型参数需分开看,不同任务需求不同。GLM - 5.3实验验证有效推理深度优化重要性,大模型缩放探索仍在继续。

大模型的缩放优化早已超越了单纯的参数堆叠维度,数据规模、算力分配策略以及实际部署的成本与条件,共同决定了模型最终的性能表现。

行业对缩放定律的认知演进

早期行业曾普遍遵循2020年Kaplan团队提出的2.7:1参数与数据增长比例,GPT-3、Gopher等一众万亿参数模型正是基于这一思路开发。但后续研究发现这一配比存在显著误差,2022年Hoffmann团队通过四百个不同规模的模型实验,得出了更符合计算最优的配比:每个参数对应约20个token,且参数与数据应保持同步增长,而非前者增速远超后者。早期的拟合误差会随着算力提升被不断放大,也正是当年万亿参数模型出现严重资源错配的核心原因,成为了行业共同走过的一段弯路。

推理成本带来的优化转向

Chinchilla的研究主要聚焦于训练阶段的算力优化,但如今的大模型往往需要每日被调用数十亿次,推理成本占据了模型生命周期的绝大部分开支。当把推理成本纳入优化目标时,最优的模型设计会转向“参数更少但训练更充分”的方向,也就是所谓的刻意过训练。比如Llama-2-7B和Gemma-2-9B就遵循了这一思路,每个参数对应的token数分别达到了约290和889。

MoE模型的参数分层逻辑

在混合专家模型(MoE)中,总参数和激活参数需要被分开看待:总参数决定了模型能够承载的知识总量、事实储备以及长尾信息的存储能力;而激活参数与有效深度则决定了模型的推理能力,也就是能否完整走完一条长因果推理链条。稠密模型的20:1配比并不能直接套用在MoE模型上,2025年的研究还发现,最优的每参数token数其实和任务强相关:记忆类任务更偏好更多的参数,而推理类任务则需要更多的数据支撑。在固定每参数token数的前提下,单纯提升总参数反而会损害推理能力,激活更多的专家模型才能稳定提升推理效果。

具备完整走完二十步推理链的能力,并非来自于单纯的知识记忆也就是检索类能力,而是依赖于模型的推理深度,这一点并不由总参数数量决定。这也是安全防护、智能体开发以及长程推理场景中,从业者普遍的共识。

GLM-5.3的实验验证

这一结论在GLM-5.3的开发中得到了完美验证。GLM-5.3与前代的GLM-5.2拥有完全相同的基座、架构、总参数和激活参数,唯一的区别是团队花费了一个月的时间,针对长程环境与强化学习进行了专门的后训练优化,最终获得的性能提升并非边际性的小幅改进,而是显著的质变。这也证明了当总参数达到足以覆盖基础知识的阈值后,模型的额外性能提升来自于有效推理深度的优化,尤其是后训练环节。

大模型的缩放从来不是只有单一的“旋钮”,我们可以调整基座规模、预训练数据量、单次前向传播的算力消耗,或是后训练策略。本次GLM-5.3的优化选择了后训练这一余量最大的方向,也证明了下一个值得调整的优化维度,往往和上一次并不相同。后续我们还会在中训练、预训练等方向继续探索,缩放的探索远未停止。

以上内容不代表本平台立场,仅供读者参考