智谱GLM-5.3:能力展示与安全升级

时隔两个月,全新的GLM-5.3模型正式推出,从当前行业反馈来看,其实际表现超出了不少人的预期。不少从业者认为,这家团队在过去一年里已经找到了清晰的模型优化路径。
根据官方发布文档说明,GLM-5.3并未对基座模型进行升级,也没有增加参数量,但其综合能力相比上一代GLM-5.2有了显著提升,而所有的优化全部来自后训练环节。
从团队背景来看,这家公司起源于学术研究,核心团队在大模型技术领域拥有深厚积累,其公开的模型技术文档也值得所有关注大模型路线的开发者仔细研读。
一、行业两大核心优化方向:预训练与后训练
近两年,主流大模型厂商的研发主要围绕两大方向展开:一是持续推进预训练规模拓展,二是不断深化后训练优化,不同团队在不同阶段会有不同的侧重点。
先来看预训练规模拓展这条路径。行业内最直观的感受就是模型参数规模不断扩大,比如部分产品将总参数提升至2.8万亿,还有厂商透露其研发的模型参数将朝着10万亿量级迈进。参数量已经成为大模型发布时最受关注的指标之一,但实际上,参数量本身并不能单独决定模型能力,还需要结合训练数据量、算力投入以及最终部署场景综合判断。
2020年,OpenAI的Jared Kaplan等人发表了《Scaling Laws for Neural Language Models》,这篇论文为行业奠定了大模型规模拓展的理论基础,当时的核心结论是:随着算力投入增加,模型规模可以持续扩大,参数量的增长速度可以超过训练数据的增长速度。此后行业快速跟进,先后推出了GPT-3(175B参数)、Gopher(280B参数)、MT-NLG(530B参数)等大模型,行业普遍认为模型参数越大,综合能力越强。
但到了2022年,DeepMind通过训练四百余个不同规模的模型后发现,行业此前过于追求单模型参数量。在相同算力预算下,与其一味扩大参数规模,不如将更多算力投入到训练数据的获取上,让模型接触更多的训练样本。他们给出了通用配比经验:每1个参数搭配约20个Token的训练数据,且三者需要保持相近的增长速率。
基于该结论训练出的Chinchilla模型仅拥有70B参数,远小于Gopher的280B参数,但使用了1.4T Token进行训练,在相同算力投入下,不仅超越了Gopher,还超过了当时多款参数规模更大的模型。这一结果让行业意识到,模型能力的核心是参数量、数据与算力的整体配比,参数更少但训练更充分的模型,完全可以超越规模更大的同类产品。如今的预训练拓展,早已不是简单的参数堆叠,而是三者的协同优化。
与此同时,后训练优化也逐渐成为了大模型能力提升的核心环节。
如果说预训练是为模型打下扎实的知识基础,那么后训练就是通过强化学习、真实场景交互与任务训练,将基础能力转化为更强的落地实用性。
在GPT-3时代,预训练几乎承担了模型能力提升的核心工作,后训练更多只是做最后的调整,比如让模型学会遵循指令、完成对话交互,当时行业普遍认为模型的能力上限在预训练完成时就已经基本确定,这也是早期“大力出奇迹”说法的来源。但到了O1模型时代,行业发现强化学习不仅可以优化模型的使用体验,还能直接提升模型的核心能力,比如数学推理、代码编写以及多智能体连续任务的完成能力,都可以通过大规模后训练得到强化。
本次GLM-5.3正是通过后训练实现了能力跃升,没有调整基座和参数量就完成了升级,足以证明团队在后训练环节找到了切实有效的优化方法。
二、后训练优化的核心逻辑与演进
后训练优化的核心思路可以概括为:Scale Environment,Scale Experience,也就是拓展训练环境与交互经验。我们可以将后训练的发展划分为三个阶段:
最早的后训练仅支持单轮问答模式:模型完成一道题目后,工作人员会告知其回答正确与否,再通过强化学习更新模型权重。但这种模式过于简单,无法锻炼模型完成复杂任务的能力,因此行业开始将模型放入模拟真实环境中进行训练。
以代码开发为例,早期仅会让模型单独完成一道编程题,而现在则会为模型提供完整的代码库,允许其调用终端工具、修改代码并运行测试用例。模型可以先分析现有代码,定位问题后进行修改,若测试失败则重新梳理逻辑并再次调整,整个过程可能持续数十甚至上百个步骤,最终根据任务是否完成给出奖励反馈。通过这种方式,模型可以学会工具调用、长周期任务目标维持等高阶能力。
过去一年里,大模型在长程任务上的快速进步,很大程度上都依赖这类后训练方法的迭代。同时行业也意识到,想要让模型具备更专业的高阶能力,必须同步提升训练环境的复杂程度。
后训练拓展与预训练拓展的核心差异在于:预训练主要扩大模型规模、训练数据与计算量,而后训练则是让模型接触更复杂的任务、更真实的场景以及更长的任务流程,二者的关系就好比“读万卷书”与“行万里路”。
官方发布的技术文档中提到了IndexShare、SAO、Slime等多项技术细节,相关论文与开源地址如下,感兴趣的开发者可以自行研究:
https://arxiv.org/abs/2603.12201
https://arxiv.org/abs/2607.07508
https://github.com/THUDM/slime/blob/main/README_zh.md
文档中还提到,该基座模型的智能上限仍有很大的挖掘空间,结合GLM-5系列在开发者群体中的口碑,这一说法确实给行业留下了不少想象空间。
本次官方文档还专门用大量篇幅讲解了网络安全能力的强化,我们可以看到,GLM系列此前一直在重点拓展代码开发与多智能体长程任务能力,而随着训练环境复杂度提升,模型在代码领域积累的能力可以迁移到其他专业领域,网络安全就是其中之一。
网络安全工作本身与代码开发高度相关,再结合团队专门搭建的安全场景训练环境,该能力得到了快速放大。后续模型还可能解锁更多专业领域的能力。
进入2026年,包括OpenAI与Anthropic在内的头部实验室都在模型中应用了Loop Transformer技术,其核心是将Scaling Law的衡量目标从单纯扩大总参数量,转向推理链路的有效计算长度,本质上也是预训练与后训练协同优化的成果。
三、实际应用场景验证
我们团队也针对GLM-5.3做了多个实际测试,以下是几个典型的应用案例:
首先是代码开发场景:一位年轻同事仅用一个多小时,就通过GLM-5.3生成了可用的象棋应用程序,整体完成质量超出预期。
其次是办公效率工具开发:针对团队日常公众号排版耗时较长的问题,我们用GLM-5.3开发了一款自动化排版工具。用户只需要从文档中复制原文到工具界面,系统就会自动完成段落调整、格式加粗等工作,一键复制即可直接粘贴到公众号后台,将原本需要半小时的排版工作缩短到5分钟以内,同时还支持图片的快速适配调整。
最后是生产系统bug排查:我们在筹备上线的购票订单功能中遇到了并发场景下的异常问题,包括重复订单、漏单以及订单状态不匹配等,此前使用其他工具编写的代码未能解决该问题。GLM-5.3通过全链路代码扫描、端到端模拟测试,快速定位到了核心问题,同时还顺带发现了多个关联的安全类漏洞,并给出了完整的修复方案,实际验证了其在复杂系统排查和安全优化方面的能力。
四、行业观察与思考
不少科技公司在发布大模型时,都会在官方文档开头放上一句简短的标语,这些话语往往能反映团队当前的研发思路与行业判断。本次GLM-5.3的官方标语是“单弦不成音,独木不成林”,结合行业现状可以从两个层面理解:
第一层是行业竞争氛围。近半年国内大模型赛道的研发节奏明显加快,多个团队都在快速推出迭代版本,这种良性竞争会推动整个行业共同进步,单个团队的技术突破会很快被同行跟进,避免了技术垄断带来的行业停滞。如果市场只剩下少数几家厂商,反而会降低行业的创新活力。
第二层是生态合作的重要性。本次GLM-5.3重点强化了网络安全能力,这并非单一团队可以独立完成的:官方文档中提到了清华大学、南开大学等学术机构,以及绿盟科技、赛博昆仑、腾讯玄武等安全厂商的合作支持。网络安全作为垂直领域,需要专业的技术知识与场景积累,类似的还有芯片研发、人才培养、开源社区建设等环节,都需要多方协作才能推进。
“单弦不成音,独木不成林”这句话精准概括了当前大模型行业的发展趋势,也期待国内的大模型生态能够持续健康发展,让更多团队从中受益。

