文章摘要
近日,千问、智谱同日分别开源两款Flash系列大模型。千问Qwen3.8-Flash-Next参数规模可观,是下一代Qwen4的前置实验架构,系首次对外开放权重,可高效处理长文本。智谱GLM-5.3-Flash是GLM-5系列首款原生多模态模型,API价格降至原GLM-5.2的十分之一,首发期享五折优惠至9月9日。

近日,两款命名中带有“Flash”的大模型几乎同期发布并开源,它们分别是千问旗下的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash,两款产品的技术规格与市场定位都颇具看点,绝非小体量的试水之作。

从基础参数来看,两款模型的规模都相当可观:Qwen3.8-Flash-Next的语言模型主体拥有1250亿参数,单token激活量约60亿,此外还搭载了510亿参数的n-gram embedding模块与40亿参数的MTP模块;而GLM-5.3-Flash的总参数规模达到3200亿,单次推理激活参数为180亿。

Qwen3.8-Flash-Next:Qwen4的前置实验架构

Qwen3.8-Flash-Next的核心定位是为下一代Qwen4模型打前站的实验性架构,这也是该套架构首次对外开放权重文件。

该模型的网络结构共包含48层,集成了Gated DeltaNet、Qwen稀疏注意力(QSA)以及MoE混合专家模块。其中QSA模块采用micro-block的方式处理上下文信息,单次处理预算为512个block,对应2048个token的上下文长度,能够高效完成长文本的处理与生成任务。

GLM-5.3-Flash:大幅降低API使用成本

GLM-5.3-Flash的体量更大,同时也是GLM-5系列首款原生多模态模型,预训练阶段使用了总计30万亿token的语料,具备全面的基础能力与多模态理解生成能力。

在架构设计上,该模型混合了稀疏注意力与线性注意力机制,核心目标是在保留长上下文处理能力的同时,大幅降低服务的使用成本。此前该模型曾以匿名身份ox-alpha出现在OpenCode和OpenRouter平台中,本次正式发布后揭开了神秘面纱。

价格方面,GLM-5.3-Flash的API调用价格仅为GLM-5.2的十分之一:每百万输入token收费0.15美元,每百万输出token收费0.50美元。为了推广新产品,首发期间还可享受五折优惠,输入仅需0.075美元/百万token,输出0.25美元/百万token,优惠活动将持续至9月9日。

相关参考资料

  • Qwen3.8-Flash-Next官方发布内容
  • Qwen3.8-Flash-Next模型详情页面
  • Qwen3.8-Flash-Next技术报告
  • GLM-5.3-Flash模型详情页面
  • GLM-5.3-Flash官方文档
  • GLM-5.3-Flash API价格说明
以上内容不代表本平台立场,仅供读者参考