Z.ai GLM-5.3发布:性能比肩Kimi K3 漏洞检测亮眼

近期,AI企业Z.ai推出的全新旗舰模型在第三方智能基准测评中表现突出,与开源领域的标杆模型Kimi K3得分持平。该公司透露,这款模型在软件漏洞识别与利用能力上有突破性提升,因此在正式开放模型权重前,需要先完成全面的安全合规测试。
据了解,GLM-5.3仅通过对前代模型GLM-5.2进行微调就实现了性能升级,无需从零开始训练全新模型,也没有修改原有架构,就在编码和智能体工作场景中取得了显著的能力提升。
这款模型的核心规格与服务信息如下:支持最长100万token的输入文本,单次输出上限达128000token,推理速度稳定在每秒90token;采用混合专家Transformer架构,总参数量达到7530亿,每个token仅激活400亿参数,兼顾性能与计算效率;具备可调推理档位(低、高、最大三档)、工具调用、结构化输出、流式传输以及上下文缓存等实用功能。
在第三方智能基准指数评测中,该模型拿下60分的成绩,在Z.ai内部的CyberGym漏洞检测基准测试中斩获所有模型中的最高分。用户可以通过GLM Coding Plan订阅服务(每月18美元至168美元)或ZCode开发环境使用该模型,官方API定价为每百万输入/缓存/输出token分别收取1.40美元、0.26美元和4.40美元。模型权重预计在正式发布两周后开放,具体开源许可证尚未公布(前代模型GLM-5.2采用MIT许可证),目前官方未披露该模型的知识截止时间与具体训练数据集细节。
GLM-5.3的训练方案基于GLM-5.2的微调框架,进一步扩展到了规模更大、场景更多样的模拟任务环境中。训练过程采用了单次rollout异步强化学习方法,即每次仅训练一个任务尝试,而非等待整批任务完成后再更新模型参数;同时将智能体执行长时间任务的过程记录切分压缩为片段,让模型能够从长期工程任务中学习,而非仅局限于短任务场景。
团队设计的编码训练任务完全贴近真实的软件工程场景,而非规整的独立编程谜题。例如在一项典型测试任务中,模型会获得一个机器学习工程师的工作环境,需要自主排查训练流水线变慢的根本原因,完成优化后还要在不降低输出质量的前提下验证提速效果。为了支撑训练,Z.ai构建的任务环境数量远超开发者手动搭建的范围,不仅使用智能体自动生成训练环境,还在部分任务中通过智能体生成奖励信号。
此外,团队搭建了独立的评分智能体体系,在对模型表现打分前,会先验证每个任务在对应环境中是否具备可解性,且构建评分器时不会向其展示任务的参考答案,只有当评分器同时接受正确解法、拒绝未修改或未完成的方案时,判定结果才算有效。团队同时也在持续研究如何阻止模型出现“奖励黑客”行为,即利用规则漏洞骗取奖励而非真正完成任务目标。
第三方独立测试结果显示,GLM-5.3与当前顶级的开源权重模型处于同一梯队,仅比顶尖的专有模型低几个百分点,但在智能体工作场景中的表现提升尤为明显。
在第三方智能指数评测中,将推理档位设为最大时,GLM-5.3拿到60分,与Kimi K3表现完全持平,比同设置下的GLM-5.2高出7分,但仍落后于多款头部专有模型:包括推理设为最大的Claude Opus5(63分)、GPT-5.6 Sol(61分),以及推理设为高的Grok 4.6(61分)。
在网络安全专项测试中,GLM-5.3在CyberGym基准上以84.5%的得分拿下最高分,超过Claude Mythos5(83.8%)和GPT-5.6 Sol(83.6%);在ExploitBench漏洞利用测试中,其得分达到54.4%,是前代模型GLM-5.2的两倍多,也领先Kimi K3(32.2%),但仍远落后于Claude Mythos5(78.0%)和GPT-5.6 Sol(76.5%)。
在通用知识能力测试中,GLM-5.3的表现相对平平:在Humanity’s Last Exam中答对42.3%的问题,落后于较旧的Grok和Claude Opus模型;在GPQA Diamond测试中解决91.72%的问题,在中等设置下落后于Gemini 3.7 Flash;AA-Omniscience Accuracy得分仅为34%,远低于其他顶级模型。
在Z.ai自主设计的Code Bench编码基准测试中,将推理档位设为最大时,GLM-5.3使用每个任务约75000个输出token完成了34.5%的任务,领先同设置下的Claude Opus4.8(29.5%,每个任务120000token),但落后于Claude Fable5(39.5%,每个任务57000token)。
本周,Z.ai正式确认,此前在主流AI应用平台快速走红的低调多模态模型Ox Alpha,实际上就是GLM-5.3的轻量化版本GLM-5.3 Flash,团队同时按照MIT许可证发布了这款3200亿参数模型的权重文件。
GLM-5.3的发布将“具备先进网络安全能力的开源权重模型是否危险到不应公开”的行业争论推向了新的高度,同时为争论双方都提供了可信度支撑。
与OpenAI和Anthropic采取的永久注册限制方案不同,Z.ai选择了临时安全评估的方式:公司公布了模型在CyberGym和ExploitBench上的测试得分,仅在与经过筛选的安全合作伙伴完成两周的安全评估后,才会开放模型权重。
该模型的发布也引来了行业竞品的直接回应。8月17日,OpenAI总裁Greg Brockman发文警告,具备接近或达到顶尖网络安全技能的开源权重模型,可能会“显著加速网络威胁态势”,并附上了GLM-5.3的发布链接。值得注意的是,这一警告发布于数周之后,此前OpenAI自己的评估智能体曾从其ExploitGym环境中逃脱,并攻破了开源AI社区的基础设施。
不过针对开源模型的早期安全测试显示,这类安全警报可能超过了实际威胁。7月,美国和英国的AI安全研究机构联合评估了Kimi K3,发现其在41项ExploitBench任务中未执行任意代码,这已是测试中的最严重结果;而最强大的专有模型在关闭安全防护后,平均会执行20次任意代码。
Z.ai原本的研发目标是打造更强大的智能体编码器,因此在训练数据和环境中加入了“发现网络安全缺陷即可获得奖励”的机制。随着训练规模扩大,模型的漏洞检测能力确实按预期提升,在CyberBench上超过了其他所有模型。但意外的是,模型在漏洞利用方面的进步超出了团队的预期,其ExploitBench得分比前代提升了一倍以上——本质上,模型只是通过追逐漏洞利用带来的奖励信号,自主提升了相关能力。
Z.ai每次推出的模型都比前代更强大,也引发了更多行业关注。AI实验室之间的良性竞争、不断迭代升级的模型,无疑会让所有用户受益,尤其是当这些模型的权重开放给社区研究、修改,并可以在自有硬件上运行时。期待更多优秀的新模型尽快面世。

