文章摘要
智谱推出全新GLM - 5.3模型,重新夺回国内大模型领先地位。该模型通过精细化后训练,提升编程和智能体能力,在网络安全领域取得突破。官方测试数据表现强劲,自研评测体系中也超竞品。实际测试中,编码能力比肩顶级模型。网络安全方面,前两阶段测评得分略高于竞品,红队测试发现大量漏洞,价值超3000万元。目前已上线相关工具,API将近期上线,模型权重两周内开源。

智谱近期推出了全新的GLM-5.3模型,重新夺回国内大模型的领先地位。这款模型的基座与GLM-5.2保持一致,并未进行更换,而是通过针对743B基础模型的精细化后训练,实现了编程和智能体能力的全面跃升,同时在网络安全领域也取得了突破性进展,推出了全新的开源标准。

官方公布的多项测试数据显示了GLM-5.3的强劲实力:在Terminal-Bench 3.0测试中,该模型在真实终端环境完成复杂任务的得分从GLM-5.2的4.6分大幅提升至28.3分;在DeepSWE v1.1长程软件工程测试中,得分从46.2提升到66.9;在Agents' Last Exam跨工具协作测试中,得分从23.8提升到28.5。

智谱还搭建了自研的Z.ai Code Bench评测体系,模拟开发者实际使用编码智能体的真实场景,将模型放入真实本地开发环境中运行端到端任务。在High档位下,GLM-5.3的准确率达到31.4%,超过了Claude Opus 4.8最高档位的29.5%。更值得关注的是效率表现:GLM-5.3完成同等任务平均仅消耗约5万token,仅为Claude Opus 4.8约12万token的一半左右。

实际测试体验

为了直观验证GLM-5.3的实际表现,我们使用了经典的测试题目进行验证。第一个测试场景是要求使用HTML和Three.js制作一个符合真实物理过程的火星登陆模拟系统,这个任务需要同时处理材质模拟、轨道力学计算、大气层着色、着陆器姿态控制、推进器减速等多个环节,还要完成3D建模,对智能体和编码能力都是极大的考验。

用 HTML 和 Three.js 制作一个火星登陆模拟过程,全程要符合物理过程,逼真,发挥你最大的想象力,开始吧。

对比下来,GLM-5.3仅用了约50分钟就完成了单次测试,而此前测试的多款模型表现各有优劣:Kimi K3耗时1.5小时,DeepSeek V4 pro 0813耗时半小时但后续辅助工具又用了1.5小时,DeepSeek V4 flash 0731耗时约20分钟。虽然GLM-5.3本身不具备视觉能力,而部分竞品在测试过程中可以通过截图完成端到端验证,但最终GLM-5.3模拟的整个物理过程,尤其是火星车登陆的地形设计和流程精度,都远超竞品,带来了超出预期的表现。

第二个测试场景是构建代码仓库分析工具,此前使用GLM-5.2时,需要四轮Goal指令才能完成项目搭建,而本次使用GLM-5.3仅用约1小时就完成了完整的循环测试。这个项目要求从空目录开始,完成初始化、依赖安装、全功能实现到测试的全流程,包含用户分析、今日热榜、AI解读与对话三大模块,还有严格的视觉规范和工程规范要求。

完整的需求指令包括:用Vite + React从零开始构建一个代码仓库开发者分析工具,从空目录开始完成全流程开发,包含用户搜索展示、仓库数据可视化、热榜获取、AI解读对话等多个模块,同时满足严格的视觉和工程规范要求。

/goal 用 Vite + React 从零开始,构建一个 GitHub 开发者分析工具。
项目从空目录开始,包含初始化、依赖安装、完整功能实现到测试全流程。
【模块一:用户分析】
1. 顶部搜索框,输入 GitHub 用户名后拉取数据并展示
2. 用 Recharts 展示该用户所有公开仓库的 Star 总量、Fork 总量、编程语言分布饼图,所有图表配色统一,使用渐变色填充,hover 有 tooltip 交互
3. 最近 12 个月 commit 活跃度热力图,颜色深浅表示活跃程度,点击某一天展开查看当日仓库活跃明细
4. 仓库列表支持按 Star 数、最近更新时间排序,支持按语言筛选
5. API 请求带本地缓存,同一用户 5 分钟内不重复请求 GitHub API
6. 网络错误、用户不存在、超出 API 限流(403/429)时分别给出不同的友好提示
7. 搜索过的用户可以收藏,收藏列表持久化到 localStorage,下次打开直接从收藏夹进入
8. 支持同时输入两个用户名进行对比,并排展示 Star 总量、语言分布、活跃度热力图,布局不错乱
9. 仓库数据支持导出为 CSV,文件能正常打开,数据完整
【模块二:今日热榜】
10. 新增「今日热榜」Tab,与用户搜索并列
11. 通过抓取开源平台获取今日 Top 10 热门仓库,数据包括:排名、仓库名、作者、描述、语言、今日新增 Star 数、总 Star 数、Fork 数
12. 热榜数据缓存 1 小时,1 小时内切换 Tab 不重复请求
13. 每条数据展示今日新增 Star 趋势标签(用颜色区分热度高低)
【模块三:AI 解读 + 对话】
14. 热榜每个仓库有「AI 解读」按钮,点击后调用 GLM API 生成解读
15. AI 解读包含四个维度,以结构化方式展示:
  - 这个项目是做什么的(一句话说清楚)
  - 今天为什么突然火(结合 Star 增速判断)
  - 适合哪类开发者关注
  - 值不值得现在 Star
16. 解读采用流式输出,打字机效果逐字显示,不能等全部生成完再显示
17. 解读完成后,下方自然出现对话输入框,可针对该仓库继续追问
18. AI 以该仓库完整信息(名称、描述、语言、Star 数、今日增速)作为上下文进行多轮回答,能记住本次会话内的上下文
19. 对话框初始展示三个预设快捷追问按钮,点击直接发送:「这个项目适合新手学习吗?」「有没有类似的替代项目?」「怎么快速上手这个项目?」
20. 每个仓库的对话上下文相互独立,切换仓库不串话
21. 对话框顶部显示当前正在聊的仓库名
22. 输入框支持 Enter 发送、Shift+Enter 换行
23. AI 回复过程中输入框禁用,回复完成后恢复
24. 单次对话超过 10 轮时提示用户上下文较长,询问是否清空重来
25. AI 解读结果按仓库名缓存到 localStorage,同一仓库当天不重复请求 GLM API
【视觉规范】
26. 整体深色主题,背景采用GitHub同款深色,卡片使用相近色调,主色调用蓝紫渐变
27. 卡片式布局,卡片间有明确视觉层级和阴影
28. 数据加载时有 skeleton 占位动画,页面切换有过渡动效,不能硬切
29. 响应式布局,移动端和桌面端都正常显示
30. 所有交互元素有 hover 状态
【工程规范】
31. GLM API Key 通过右上角设置面板配置,保存到 localStorage,不硬编码在代码里
32. 所有 AI 请求超时 15 秒,超时后提示用户并支持一键重试
33. 每个组件文件不超过 150 行,超过则拆分
34. 核心模块(缓存逻辑、数据处理、AI 调用)单元测试覆盖率 80% 以上
35. 所有组件有 TypeScript 类型声明,不允许使用 any
36. ESLint 检查通过,零警告
37. npm run build 无报错无警告
38. Lighthouse 性能评分 85 分以上
【验收标准】
- 搜索「torvalds」能正常展示数据,三种图表渲染无报错
- 搜索不存在的用户名,页面不崩溃,显示专属提示
- 同时对比「torvalds」和「gaearon」,两列数据并排展示,布局不错乱
- 收藏一个用户,刷新页面后收藏仍在
- 导出 CSV,文件能正常打开,数据完整
- 「今日热榜」Tab 展示 10 条真实仓库数据
- 点击任意热榜仓库的「AI 解读」,流式输出正常,打字机效果流畅
- 同一仓库第二次点「AI 解读」,直接读缓存,控制台无新的 GLM API 请求
- 连续追问 3 轮,AI 回复始终能引用之前对话内容
- 两个仓库同时展开对话,内容不串话
- 移动端宽度下布局正常,无横向滚动条
- npm run test 通过率 100%
- ESLint 零警告
- Lighthouse 性能评分 ≥ 85

最终交付的产品可以快速分析代码仓库、完成开发者对比、获取实时热榜,并通过AI对项目进行深度解读,还支持一键导出开发者项目数据为CSV文档,整个过程没有出现任何bug,交付质量远超此前的版本。

综合来看,GLM-5.3的编码体验非常流畅,其编码能力可以比肩多款顶级模型,整体体感超过了多款主流竞品。

网络安全能力突破

GLM-5.3在网络安全领域也实现了重要突破,但这个方向的能力相比编码能力更难直观评估,因为普通用户很难直接接触相关场景,也缺乏足够的背景知识判断表现优劣。我们可以将安全领域的测评分为三个阶段:

第一阶段是代码审查与漏洞发现,即让模型读取代码并找出其中的安全隐患,这是最基础的安全能力;第二阶段是漏洞验证,即确认找到的漏洞确实可以被触发,而非误报;第三阶段是漏洞利用,即编写完整的攻击代码,在真实环境中完成渗透测试。

GLM-5.3的优势主要集中在前两个阶段。在白盒代码审查与漏洞验证测试中,GLM-5.3的得分达到84.5%,略高于多款竞品。但在需要完整理解漏洞成因并完成利用的测试中,GLM-5.3的得分仅为54.4%,与顶级水平仍有一定差距。

在模型正式发布前,智谱联合了多家安全团队对GLM-5.3进行了密集的红队测试,同时使用模型进行漏洞发现工作。最终累计发现了2436个漏洞,其中1097个为中高危漏洞,部分漏洞甚至已经潜伏了45年未被发现。这些漏洞覆盖了系统内核、操作系统、浏览器引擎、开源基础组件等多个领域,并非实验室设计的模拟题目,而是真实系统中存在的实际漏洞。按照全球漏洞交易与赏金市场的参考报价,这批漏洞的估算经济价值超过3000万元。

当前使用渠道

目前GLM-5.3已经上线智谱的编程工具ZCode和效率工具AutoClaw,面向GLM Coding Plan的全量用户开放,同时也开放订阅服务。相关API预计将在近期上线,完整的模型权重将在两周内开源。此外,多个编码平台已经开放了抢先体验通道。

GLM Coding Plan的全员额度已经重置,用户可以在后台的用量统计中查看额度恢复情况。对于有编码场景需求的用户,可以先前往相关工具进行体验,后续也会更新更完整的对比实测内容。

以上内容不代表本平台立场,仅供读者参考