GLM-5.3开源之盾:守护数字世界安全防线

单弦不成音,独木不成林
我们正式推出GLM-5.3模型。相较于前代的GLM-5.2,这款模型的基座架构并未改动,但通过极致的后训练规模化优化,大幅提升了模型的智能上限:我们扩展了数十倍的长程任务环境,丰富了任务场景类型,并投入了超长的后训练时长。实践证明,充分的模型后训练能够催生出超出预期的全新能力。
GLM-5.3的核心能力升级包括:
- 更强的编程能力:作为当前编程表现顶尖的开源模型,在内部自建体感评测中较GLM-5.2提升50%,在Terminal Bench 3.0、Agents' Last Exam (CLI)等公开基准测试中取得开源第一的成绩。
- 突出的网络安全能力:在白盒代码审查、漏洞发现等安全任务中,表现持平前沿闭源模型,展现出强大的安全防御场景应用潜力。
- 后训练规模化优化:所有能力提升均来自后训练环节。基于IndexShare、SAO以及新一代Slime框架,我们在完全相同的基座上高效推进强化学习,这也意味着我们可能尚未完全挖掘出这款基座的全部智能上限。
- 开源计划:我们将在发布两周后开放完整模型权重,在此之前会完成全面的安全评估与模型加固工作。
即日起,官方编程工具、效率工具已正式上线,同时开放GLM Coding Plan全量用户权限与订阅服务。多个主流编码平台已开启抢先体验通道,API接口也将很快上线。完整的模型权重将在两周内开源,期间我们会完成必要的安全加固,尽可能限制潜在攻击能力,保留其防御价值。
今日13:00,GLM Coding Plan的全员使用额度已完成重置,所有用户可在后台用量统计页面查看回满的使用额度。
编程能力的全面突破
在多项主流基准测试中,GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近顶尖闭源模型,实际编程体感优于其他同类国产模型。
在Terminal-Bench 3.0上,该模型的得分从4.6提升至28.3,该测试用于衡量模型在真实终端环境中完成复杂任务的能力;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1中,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam测试中,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2测试中,GLM-5.3得分达到1769,展现出基于编程能力涌现出的专业任务执行能力。
整体来看,GLM-5.3在复杂软件工程、终端操作以及更广泛的真实世界智能体任务中都取得了极为显著的进步。
我们自研的评估体系更贴近真实编程场景的体感体验:将模型置于复杂的本地开发环境中,在不同思考档位下执行端到端任务,还原开发者实际使用编码智能体的完整流程。
测试结果显示,GLM-5.3在效果与Token利用率之间取得了更优的平衡。在High档位下,模型准确率达到31.4%,超过顶尖闭源模型的最高档位表现,且每项任务平均输出仅约5万tokens,而同类模型需要约12万tokens,这意味着GLM-5.3能够以更短的执行路径完成任务。
在训练过程中,我们并未局限于让模型完成简单编程题,而是将训练环境扩展到更接近真实专家工作的完整流程,部分任务的工作量相当于一位工程师连续数日的工作。以机器学习优化任务为例,模型使用与专业算法工程师相同的计算集群、存储系统、内部文档、代码库与实验结果,端到端实现了可量化的性能提速。
在这样的训练环境下,模型学到的不再是单向执行指令,而是从发现问题开始,逐步推进分析、实施验证,最终独立完成完整工作流程。
网络安全能力的意外涌现
在不断扩张任务环境的过程中,我们观察到模型在网络安全领域的表现超出了初始预期。安全能力的出现并非偶然,因为安全工作本质上是约束严格的编程任务。我们从2025年9月开始在该方向投入研究,在GLM-5.2与GLM-5.3的研发周期中,联合国内多家头部安全实验室搭建了更多长程任务环境,并构建了更专业化的评测与执行框架。
从任务链条来看,网络安全能力大致涵盖代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证与利用不同阶段的三个基准测试,对GLM-5.3的网络安全能力进行了全面评估,结果显示其优势主要集中在任务链的前半段。
在CyberGym测试中,模型需要从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分达到84.5%,高于GLM-5.2的77.2%,也略高于同类前沿模型的表现。
在更考验深度推理能力的ExploitBench测试中,模型需要进一步理解真实漏洞的成因并完成相应利用,GLM-5.3得分达到54.4%,是GLM-5.2的两倍多,但仍与顶尖闭源模型存在一定差距。
ExploitGym测试考察模型在限定时间内完成漏洞利用任务的数量,按预算归一化吞吐量后,GLM-5.3在两小时内完成105项任务,六小时内完成130项,相较于GLM-5.2的29项与39项实现了大幅提升。
三个基准测试呈现出一致的趋势:越接近漏洞利用链的前端,GLM-5.3相较前代的提升越明显;而越深入完整的利用流程,模型与顶尖闭源模型的差距也越大。这也说明,GLM-5.3进步最快的方向,正是当前仍需要重点追赶的领域。
安全评估与实践成果
自GLM-5.2发布以来,我们联合国内多所高校与安全团队,开展了密集的红队测试与安全评估。累计发现经过初筛去重的漏洞2436个,其中1097个为中高危漏洞,部分漏洞甚至多年乃至数十年未被发现,最早可追溯至约45年前。
这些代表性漏洞覆盖了系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与互联网协议等269个项目,部分漏洞的威胁等级极高,可能导致主流操作系统与国民级通信软件出现大范围崩溃。
相关发现已发展为持续的漏洞发现与披露工作,相关漏洞已陆续提交至国家漏洞库。为提高披露过程的透明度,我们建立了安全披露账本,记录漏洞从发现、确认到修复的完整进展,账本将持续更新。为确保负责任的安全披露,我们仅公开已经完成披露与厂商修复的漏洞,对于处于协调披露阶段的漏洞,将展示漏洞哈希值以供后续核验。
参考全球漏洞交易与赏金市场的公开报价,这些发现的漏洞总经济价值达到三千万元。
网络安全能力必须更加开放
行业安全事件给我们带来了重要警示:如果强大的攻击能力不断扩散,那么防守能力绝不能只掌握在少数闭源模型厂商手中。闭源模式将前沿安全能力异化为少数机构的特权,仅向少量大型机构提供高端安全服务,而更广泛的企业与开源项目难以获得同等水平的安全支持,甚至在遭遇攻击最需要帮助时被拒之门外。
在当前的技术环境下,不选择开源反而是最不安全的做法。随着GLM-5.3的发布与开源,我们同步启动“开源的盾”计划,具体包括三项核心内容:
- 对重点开源项目开展持续安全审计,帮助项目维护者免费发现与修复安全风险;
- 向开源社区免费提供模型额度与更便捷的防御入口,开源项目维护者可申请用于安全审计与防御任务;
- 在官方编程工具中集成代码审计功能,将安全检查嵌入日常研发流程。
当最强的攻击工具被少数机构掌控时,最好的防御盾牌必须属于所有人。我们将持续优化GLM的安全能力并坚持开源,与全球开发者、安全研究人员共同建设持续生长的防御体系,让前沿模型从少数机构的特权,转化为服务开源社区的安全公共品。
真实场景中的安全实践
追踪AI攻击Agent
2026年7月,一台位于巴西的临时文件服务器进入了追踪分析引擎的监测范围。通过深入分析,我们发现这并非普通服务器,目录中存在大量攻击基础设施信息。进一步溯源后,一个名为“Neo”的AI攻击Agent浮出水面,其目标是攻击特定国家的会计师事务所、税务服务公司与记账机构。
该Agent获取了极高的系统权限,在不到两个月的时间里,管理着4台服务器、7个域名、6万个邮箱与100多个脚本,发出了超过1.8万封钓鱼邮件。面对数千个开放目录、数万份日志与高度碎片化的攻击线索,仅靠人工几乎无法发现其中的关联。
GLM-5.3快速提取关键线索,关联攻击事件,并辅助安全研究人员还原了完整的攻击链:从攻击者搜集特定行业目标、搭建邮件系统,到伪装成企业客户与行业机构准备恶意文件,最终帮助追踪引擎成功捕获该攻击。这与此前的安全事件形成了鲜明对比:在之前的事件中,前沿模型被用于发起攻击,而GLM-5.3则帮助防守方从证据中还原攻击路径。这也说明,模型的应用方向,取决于掌握它的人与最终目的。
提前阻断各类安全风险
潜在的安全风险离我们并不遥远,从一条消息、一封邮件,到互联网底层协议、智能机器人,数字世界的安全边界早已连接起个人设备、企业网络、互联网基础设施乃至真实世界,影响着每一个人。GLM-5.3作为“开源之盾”的核心价值,就是帮助更多安全团队抢在攻击者之前发现风险,让威胁在影响用户之前得到化解与修复。
保护开发者工作台
全球数百万开发者日常使用的AI代码编辑器,在一次能力评估中被发现存在潜在失陷风险。通过对其二进制代码、跨语言架构与权限边界的分析,我们发现其混合架构与权限校验逻辑存在漏洞,攻击者可能借此实现任意文件写入,进一步窃取敏感信息甚至接管开发环境。该风险隐藏在复杂的程序逻辑中,无法通过孤立检查单个代码缺陷发现。在挖掘过程中,GLM-5.3深度参与逆向分析全流程,协助安全研究人员还原程序逻辑、定位异常路径,并从大量候选路径中排除干扰,最终在授权测试环境中完成风险验证。目前相关漏洞已上报国家漏洞库,正推进修复工作。
保护国民级通信设备安全
安全研究人员在一款拥有数亿日活用户的国民级即时通信软件中发现异常:攻击者无需诱导用户点击链接或打开文件,仅发送一条看似正常的消息,就能在用户几乎无感知的情况下触发漏洞,进而完全控制用户设备。整个过程可远程完成,且具备较强的稳定性与隐蔽性。该漏洞深藏于自研私有协议、内容处理逻辑与内存管理机制中,触发条件涉及复杂状态机与极难复现的时序问题。借助GLM-5.3,安全研究人员从海量二进制代码中定位异常、还原逻辑,并逐步完成路径验证,最终在风险波及用户前发现并拦截了该威胁。
保护互联网基础导航系统
DNS如同数字世界的导航系统,一旦大面积瘫痪,全球的网站、邮件与云服务都将无法正常运行。我们联合安全团队在诞生于1983年的DNS协议中,发现了一类潜伏四十余年的关键协议级漏洞。与常见的软件漏洞不同,该漏洞源于互联网底层协议规则本身的缺陷,攻击者只需发送少量特殊请求,就能将服务器的计算压力放大近8万倍,进而导致网站无法访问、邮件中断与云服务失效。根据网络测绘估算,该漏洞可能影响全球九成以上的主流DNS系统,涉及超过1000万处公网DNS服务。GLM协助安全研究人员提前发现这一底层风险,为DNS系统的修复与加固提供了依据,也标志着GLM的安全能力从软件代码审查延伸至互联网基础协议,开始参与保护整个数字世界赖以运行的核心基础设施。
化解全球级办公系统安全事件
一次邮件预览险些成为企业网络的入侵入口。我们联合安全团队发现三枚微软重大漏洞,覆盖全球用户日常使用的邮件与办公系统,涉及客户端邮件预览、文档处理与服务端远程访问等多个环节。这些漏洞可串联成“客户端预览即中招、服务端可被远程攻破”的攻击路径,攻击者可能通过一封邮件进入用户终端,再以终端为跳板渗透企业网络,影响大量用户与部署环境。历史上同类漏洞曾在全球造成严重损失,比如2021年的Exchange服务器沦陷事件。目前相关漏洞已提交微软并完成修复,微软官方致谢了相关团队,一场可能波及全球用户与企业的安全事件被提前化解。
提前阻断人形机器人失控风险
全球顶级具身智能机器人厂商的系统中被发现存在致命级漏洞,攻击者一旦利用该漏洞,可能同时远程劫持上千台机器人,并控制其执行恶意动作。我们联合安全团队,将顶尖安全研究员的经验工作流与GLM的长程网络安全任务执行能力结合,从机器人的公开文档出发,完成信息收集、静态分析、漏洞挖掘与风险验证,逐步还原系统逻辑、梳理安全边界,最终定位并确认了这一关键风险。随着漏洞完成修复,一场可能影响真实世界的“机器人集体失控”事故被提前阻断,GLM的安全保护范围也从代码、终端与网络,延伸至与真实世界直接互动的智能设备。
上述所有漏洞均已联系厂商进行修复,并进入国家漏洞库的负责任披露与协同修复流程。
构建负责任的开源安全体系
随着模型能力的不断提升,我们同步强化了安全防护体系,确保先进智能能够持续广泛发挥作用,同时对最高风险的应用场景施加更严格的审查。针对GLM-5.3,我们构建了迄今为止最稳健的风险审查系统。
该风险审查系统采用分层设计,覆盖从外围API到模型内部的全链路,以提升准确性与冗余度,这遵循了安全防护体系中的纵深防御原则:从不假设某一层防护是完美的,而是让多层相互独立的防线彼此冗余,共同组成鲁棒的防护系统。具体分为三层:
- 外层分类器:通过轻量模型标记并拦截大规模滥用请求;
- 推理监控器:在模型推理过程中实时审查任务意图,判断是否存在潜在危害;
- 深度安全对齐:让模型从根本上自主识别并拒绝攻击性请求,这也是开源权重场景下唯一仍然有效的核心防线。
在设计该分层审查系统时,我们还遵循了风险分级的原则:审查系统的核心任务是抑制高安全风险的攻击性滥用,但不会牺牲实验性质、防御性质与教学性质的合法使用。为了达成这一目标,我们首先让分类器、监控器与模型本身学会以意图为中心而非关键词为中心的审查方法,因为网络安全场景中攻击与防御任务在字面表述上高度相似,真正区分二者的是意图与语境。我们针对性合成了差分数据,并针对大量越狱变体与伪装方法构造了对抗性数据,确保审查系统能够智能高效地工作。
更进一步,我们对网络安全领域的常见任务进行了详细分类,包括安全知识问答、蓝队防御、CTF题目、漏洞挖掘与修复、漏洞利用与攻击、渗透测试、真实入侵等,并为每一类任务构造了大量阶梯型风险的实例数据,让风险审查系统能够精准拦截高风险任务请求,同时不会误杀合法合规、风险等级较低的常规任务。模型最敏感的能力仅通过“网络安全受信访问”计划保留给经过验证的用户使用。值得注意的是,安全对齐是一个持续对抗的过程,对抗数据与风险分级实例数据的合成并非一次性工作,我们会持续进行红队自动化攻击越狱测试,并使用新产生的越狱样本不断加固审查系统。
在全面推出前,我们开展了极为密集的安全性评估与广泛的红队测试。评估结果显示,该系统建立了高标准的安全防护线,能够有效拦截明确的恶意攻击与高危漏洞利用滥用,同时未因安全策略过度收紧而牺牲模型能力,能够正常执行漏洞检测和修补、CTF教学等正向安全任务。在正式开源前,我们也邀请了国内顶级安全团队对模型的风险任务能力进行专业评估,相关团队认为,该模型在风险防护与能力释放之间取得了良好平衡,相较于前代模型显著提高了未授权恶意滥用的门槛。
人工智能的发展不应该是某个国家的独奏,而应当是全球合作的交响。随着GLM-5.3的发布与开源,安全防御能力将不再是少数机构的特权,而是全球开发者都能平等获得并共同完善的公共能力。
感谢所有与GLM-5.3并肩作战的国内安全团队。

