文章摘要
近期智谱AI推出GLM-5系列双旗舰大模型:能力旗舰GLM-5.3刷新了开源领域编码与网络安全基准;效率旗舰GLM-5.3-Flash采用全新架构,仅需原有模型十分之一成本即可获得顶尖性能,原生集成多模态能力,已部署于国产AI芯片集群。目前GLM-5.3-Flash已开源,GLM-5.3即将正式开源,已开放预约。

近期,智谱正式推出GLM-5系列双旗舰大模型产品。其中定位能力旗舰的GLM-5.3通过极致的后训练优化,刷新了开源领域的编码与网络安全基准;效率旗舰GLM-5.3-Flash则采用全新的320B/18B架构,仅需原有模型十分之一的成本即可实现顶尖性能,覆盖从前沿研究到日常生产的全场景开发需求。

在正式发布前,研发团队以匿名ID“ox-alpha”对外进行了为期一周的公开测试。测试数据显示,该模型在6天内成为OpenRouter平台最热门的大模型,累计调用量达23.2T token,热度是第二名的2.3倍;同期在OpenCode平台的7天累计token用量突破43T,位列平台第一,且所有运行流量均基于国产AI芯片完成部署。

目前GLM-5.3-Flash已通过MIT协议开源,GLM-5.3计划于次日10:00(UTC+8)正式开源,相关预约页面已上线。用户可通过官方渠道获取两款模型的完整资源与技术文档,包括已开源的GLM-5.3-Flash模型下载链接、即将开源的GLM-5.3预约入口,以及两款模型对应的技术博客资料。

两款模型的研发基底:后训练扩展路线

GLM-5系列的核心研发思路都基于后训练技术的规模化扩展。早在GLM-5.2阶段,团队就已经搭建起完整的后训练技术栈:包括用于高效长上下文处理的IndexShare、面向长周期任务强化学习的压缩版SAO框架,以及支持大规模异步RL训练的slime系统,所有组件都运行在持续积累的长周期任务环境之上。

GLM-5.3和GLM-5.3-Flash都沿用了这套技术路线,但在研发分支上有所区别:GLM-5.3在GLM-5.2的744B基座基础上继续扩展后训练,所有性能提升都来自更丰富的训练环境、更多样的任务类型与更大的计算投入;而GLM-5.3-Flash则从零开始训练了全新的320B基座,从架构设计阶段就围绕推理效率进行优化,再通过后训练完成对齐调整。

能力旗舰GLM-5.3:后训练的极限扩展

训练环境的规模化合成

为了进一步提升模型的实际工程能力,GLM-5.3将训练环境的复杂度提升到接近真实专家工作的水平。训练任务不再是简单的编程练习,而是覆盖完整生产工作流的工程单元,部分任务甚至相当于资深工程师几天的工作量。

以机器学习基础设施任务为例,模型需要像真实工程师一样,拥有完整的工作环境,包括计算集群、存储系统、内部文档、代码库与实验结果,完成诊断训练堆栈瓶颈、实现优化方案、运行实验并交付可衡量的端到端加速效果。为了规模化生成这类训练环境,团队搭建了端到端的合成管线:首先由研究智能体从真实工作场景中收集任务模式,转化为带有多步骤依赖和隐藏状态的可运行长周期环境;再通过判断智能体验证每个任务的可解性;最后由验证器在不接触参考解决方案的情况下合成求解轨迹,用于发现和修正奖励捷径。

通过oracle、无操作和未解决状态检查的验证机制,能够生成足够可靠的二元奖励信号用于模型训练。在系统层面,slime框架还新增了top-p mask、全词表OPD、R3风格的训练-推理一致性配置(将logprob平均差异控制在1e-7级别,相比此前减少99.99%以上),以及面向长周期任务的联合调度与负载均衡优化,最终让端到端RL训练的吞吐提升超过2.3倍。

编码性能的全面跃升

GLM-5.3的编码性能提升在多个公开基准上得到验证:Terminal-Bench 3.0得分从4.6跃升至28.3,DeepSWE v1.1得分从46.2提升至66.9,Agents' Last Exam得分从23.8升至28.5。

在内部Z.ai Code Bench测试中,GLM-5.3在Max努力级别下,每个任务仅需约75K输出token就能达到34.5%的准确率,而GLM-5.2在使用96K token的情况下仅达到23.4%,实现了性能与token使用效率的双重提升。在High努力级别下,GLM-5.3以约50K token达到31.4%的准确率,超越了Claude Opus 4.8的29.5%(该模型需要120K token才能完成相同任务)。

涌现的网络安全能力

除了编码能力,GLM-5.3还在网络安全领域展现出了突出的涌现能力。研发团队将漏洞发现数据与相关训练环境引入后训练流程后,随着训练规模的扩大,模型的网络安全能力提升速度远超预期:不仅能够更精准地识别孤立的代码缺陷,还可以跨利用链进行多阶段推理,形成完整的漏洞利用计划。

在三个不同阶段的基准测试中,GLM-5.3都取得了优异成绩:CyberGym(白盒源代码漏洞识别与验证)得分84.5%,位列该基准第一,领先Mythos 5的83.8%与GPT-5.6 Sol的83.6%;ExploitBench(深层漏洞利用推理)得分达到54.4%,是GLM-5.2的2倍以上;ExploitGym(时间归一化利用任务)在2小时和6小时的测试中分别完成105和130个任务,远超GLM-5.2的29和39个任务。

这种能力提升呈现出明显的规律:越靠近漏洞利用链的上游环节,模型的性能提升越大,这也是当前与闭源前沿模型差距最大的领域,而这类薄弱环节恰恰是能力增长最快的部分。在真实代码库的验证中,团队与国内多个安全团队合作,经过专家审查和去重后,GLM-5.3在269个开源项目中识别出2436个漏洞,其中1097个为中高危漏洞,覆盖系统内核、操作系统、浏览器引擎、Web应用与网络协议等多个领域。这些漏洞中许多已经存在数十年,最古老的可追溯至1981年,平均存活时间达到26.6年。

效率旗舰GLM-5.3-Flash:全新架构的效率前沿

混合注意力的高效架构

GLM-5.3-Flash从零开始设计了面向超低成本推理的全新架构。尽管总参数量与GLM-4.5的355B相近(GLM-5.3-Flash为320B),但激活参数从32B降至18B,模型层数也从92层减少到45层。

其核心采用了线性注意力与稀疏注意力的混合架构:线性注意力通过状态建模捕捉局部依赖关系,稀疏注意力则通过轻量级索引器检索全局上下文。为了降低1M token上下文场景下索引器的延迟与内存开销,团队引入了IndexPool技术,通过加权池化将四个索引器键向量压缩为一个。此外,模型还采用了流形约束超连接(mHC)技术,进一步提升了缩放效率。

与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降低了3.0倍,KV缓存降低了4.4倍,在所有对比模型(包括DeepSeek-V4-Flash、Kimi-K3等)中,GLM-5.3-Flash的注意力计算量最低。结合30T token的多模态预训练语料,GLM-5.3-Flash-Base在LiveCodeBench上以37.6的得分大幅领先同级模型,比如GLM-4.5-Base的28.1与DeepSeek-V4-Flash-Base的29.9。

原生集成的多模态视觉能力

GLM-5.3-Flash是GLM-5系列中首款原生多模态模型,视觉能力被直接集成到编码循环中,模型可以自主决定何时调用视觉输入、并利用视觉反馈指导后续行动。研发团队开发了专门的视觉编码数据合成管线,重点优化了自我视觉判断与测试阶段的表现:训练轨迹要求模型与环境进行交互、检查自身的输出结果并迭代改进。

在前端编码环节,团队还探索了带有环境反馈的强化学习方法,通过基于真实用户流程的智能体验证,增强了模型的GUI判断能力。例如,模型在生成专业文档后,可以自动检查渲染结果并自行修复布局问题。除了编码场景,GLM-5.3-Flash的视觉智能还可以延伸到其他专业工作中,包括解读文档、电子表格、演示文稿、仪表盘等异构视觉信息,并直接根据视觉上下文评估自身输出的质量与美学表现。

国产AI芯片的大规模部署

研发团队已经在大规模国产AI芯片集群上完成了GLM-5.3-Flash的服务部署。为了克服单芯片有限的计算与内存容量(特别是在百万token上下文场景下),团队在SGLang之上搭建了专用的推理引擎,推理堆栈包括节点内张量并行(线性注意力+LM head)、ReplaySSM、W8A8量化、混合INT8/FP8/BF16缓存量化、Layer Split等技术。

在集群层面,团队采用了EPD(Encode-Prefill-Decode)分离架构,将多模态编码、提示预填充与逐token解码分离为独立调度的工作池。与同硬件的初始基线相比,端到端推理性能提升了3倍,达到了与主流NVIDIA GPU相当的硬件效率与每token成本。

性能对比与选型建议

GLM-5.3-Flash在Artificial Analysis Intelligence Index v4.1.1上的得分为57,每任务成本仅0.045美元(折后价),这一智能水平此前需要约10倍的成本才能实现,大幅推进了成本与性能的帕累托前沿。在六项编码与智能体基准的对比中,GLM-5.3-Flash与其他模型的表现各有优劣。

在Z.ai Code Bench的不同努力级别测试中,三款模型与Claude系列的性能与token使用效率差异明显。两款旗舰模型的定位差异清晰:在编码硬指标上,GLM-5.3略胜一筹;而在智能体任务中,GLM-5.3-Flash表现更优,视觉基准则是GLM-5.3-Flash的独有优势。两款模型的API成本相差约10倍,用户可以根据需求选择:如果需要极致的编码与安全研究能力,可以选择GLM-5.3;如果用于日常生产与多模态办公场景,GLM-5.3-Flash是更合适的选择。

本地部署与使用方式

GLM-5.3-Flash已通过MIT协议开源,官方支持四种主流推理框架,以下是详细的部署与使用指南:

模型下载

# 下载已开源的GLM-5.3-Flash
modelscope download --model ZhipuAI/GLM-5.3-Flash --local_dir ./ZhipuAI/GLM-5.3-Flash

下载即将开源的GLM-5.3(开源后可用)

modelscope download --model ZhipuAI/GLM-5.3 --local_dir ./ZhipuAI/GLM-5.3

SGLang部署

sglang serve \
  --model-path ZhipuAI/GLM-5.3-Flash \
  --tp-size 4 \
  --ep-size 4 \
  --dsa-prefill-backend trtllm \
  --dsa-decode-backend trtllm \
  --kv-cache-dtype fp8_e4m3 \
  --moe-runner-backend deep_gemm \
  --disable-shared-experts-fusion \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 5 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 6 \
  --speculative-adaptive \
  --reasoning-parser glm45 \
  --tool-call-parser glm47 \
  --host 0.0.0.0 \
  --port 30000

官方的cookbook文档可参考公开的技术资料。

vLLM部署

docker run --gpus all \
  --privileged --ipc=host -p 8000:8000 \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -e VLLM_ENGINE_READY_TIMEOUT_S=3600 \
  vllm/vllm-openai:glm53-flash ZhipuAI/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --no-enable-flashinfer-autotune \
  --tool-call-parser glm47 \
  --enable-auto-tool-choice \
  --reasoning-parser glm45

官方的recipes文档可通过公开链接获取。

TokenSpeed部署

ts serve ZhipuAI/GLM-5.3-Flash \
  --trust-remote-code \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --moe-backend flashinfer_trtllm \
  --kv-cache-dtype fp8 \
  --draft-model-path-use-base \
  --speculative-algorithm MTP \
  --speculative-num-steps 2 \
  --speculative-num-draft-tokens 3

官方的详细文档可参考对应的技术页面。

KTransformers部署

MODEL_PATH=/path/to/GLM-5.3-flash
CUDA_VISIBLE_DEVICES=0,1,2,3 \
python -m sglang.launch_server \
  --model-path "$MODEL_PATH" \
  --kt-weight-path "$MODEL_PATH" \
  --served-model-name GLM-5.3-flash \
  --host 0.0.0.0 \
  --tp-size 4 \
  --context-length 501025 \
  --mem-fraction-static 0.60 \
  --chunked-prefill-size 4096 \
  --kt-method FP8 \
  --kt-cpuinfer 64 \
  --kt-threadpool-count 2 \
  --kt-num-gpu-experts 40 \
  --kt-gpu-prefill-token-threshold 2048 \
  --cuda-graph-bs 1 2 4 \
  --limit-mm-data-per-request '{"image":8,"video":1}' \
  --mm-process-config '{"image":{"max_pixels":1254400}}' \
  --tool-call-parser glm47 \
  --reasoning-parser glm45

官方的教程可在对应的GitHub仓库中获取。

以上内容不代表本平台立场,仅供读者参考