千问智谱同日开源Flash大模型 预演Qwen4并降价

近日,两款命名中带有“Flash”的大模型几乎同期发布并开源,它们分别是千问旗下的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash,两款产品的技术规格与市场定位都颇具看点,绝非小体量的试水之作。
从基础参数来看,两款模型的规模都相当可观:Qwen3.8-Flash-Next的语言模型主体拥有1250亿参数,单token激活量约60亿,此外还搭载了510亿参数的n-gram embedding模块与40亿参数的MTP模块;而GLM-5.3-Flash的总参数规模达到3200亿,单次推理激活参数为180亿。
Qwen3.8-Flash-Next:Qwen4的前置实验架构
Qwen3.8-Flash-Next的核心定位是为下一代Qwen4模型打前站的实验性架构,这也是该套架构首次对外开放权重文件。
该模型的网络结构共包含48层,集成了Gated DeltaNet、Qwen稀疏注意力(QSA)以及MoE混合专家模块。其中QSA模块采用micro-block的方式处理上下文信息,单次处理预算为512个block,对应2048个token的上下文长度,能够高效完成长文本的处理与生成任务。
GLM-5.3-Flash:大幅降低API使用成本
GLM-5.3-Flash的体量更大,同时也是GLM-5系列首款原生多模态模型,预训练阶段使用了总计30万亿token的语料,具备全面的基础能力与多模态理解生成能力。
在架构设计上,该模型混合了稀疏注意力与线性注意力机制,核心目标是在保留长上下文处理能力的同时,大幅降低服务的使用成本。此前该模型曾以匿名身份ox-alpha出现在OpenCode和OpenRouter平台中,本次正式发布后揭开了神秘面纱。
价格方面,GLM-5.3-Flash的API调用价格仅为GLM-5.2的十分之一:每百万输入token收费0.15美元,每百万输出token收费0.50美元。为了推广新产品,首发期间还可享受五折优惠,输入仅需0.075美元/百万token,输出0.25美元/百万token,优惠活动将持续至9月9日。
相关参考资料
- Qwen3.8-Flash-Next官方发布内容
- Qwen3.8-Flash-Next模型详情页面
- Qwen3.8-Flash-Next技术报告
- GLM-5.3-Flash模型详情页面
- GLM-5.3-Flash官方文档
- GLM-5.3-Flash API价格说明

