文章摘要
当前国产大模型技术竞争已下沉至算子底层,智谱GLM-5.3-Flash与月之暗面Kimi K3两款长文本模型,均将KDA架构核心参数“遗忘门下界”设为-5。该数值是兼顾训练稳定性、显存成本与长文本性能的工程试错黄金平衡点,这种参数趋同是国产大模型挺进技术深水区、行业走向成熟的体现。

国产大模型的技术竞争已经进入了前所未有的精细化阶段,连底层算子的参数选择都成为了团队角力的焦点。近期,智谱AI正式将此前在OpenRouter盲测榜登顶的“牛来”模型命名为GLM-5.3-Flash,这款上线首日就拿下调用量榜首的国产模型,凭借极致的长文本性价比引发了行业关注。

这款模型的底层架构融合了多家顶尖技术路线:结合了DeepSeek的稀疏注意力机制(NSA)与Kimi标志性的线性注意力机制,同时叠加了DeepSeek的流形约束超连接(mHC)技术,实现了成本与性能的双重优化。

就在模型发布的次日,月之暗面的核心研究员、“注意力残差”论文作者陈广宇,通过分析GLM-5.3-Flash的配置文件,发布了与Kimi K3的底层代码对比结果。对比显示,两款模型不仅都采用了KDA线性注意力架构,连核心参数“遗忘门下界”(gate_lower_bound)都统一设置为-5,排布逻辑也高度重合。

从Kimi K3公开技术报告到智谱推出GLM-5.3-Flash,间隔还不到一个月。不少业内人士感叹,即便参考了公开的参数配置,能在短短20天内迭代出如此成熟的模型,依然体现了极强的工程落地能力。而这背后,其实是大模型长文本赛道技术发展的必然趋势。

KDA核心参数为何锁定-5

要理解这个统一的参数选择,需要先回顾大模型长文本处理的技术演进路径。传统Transformer架构采用Softmax注意力机制,会保留完整的Token记忆,将所有输入内容存入KV缓存。随着对话或文本长度增加,计算量会以平方级(O(N²))暴涨,KV缓存的显存占用也随上下文长度线性攀升,当上下文长度达到百万级别时,仅KV缓存就需要占用几十GB显存,推理成本高到无法实现商业化落地。

为了破解这个难题,行业开始转向线性注意力路线,月之暗面推出的KDA正是其中的代表性方案。与传统架构不同,KDA不再保存全量KV缓存,而是通过固定大小的状态矩阵压缩历史信息,模型在写入新内容的同时,通过名为“遗忘门”的组件控制旧信息的衰减。无论后续涌入多少文本,模型占用的显存都能保持恒定,这也是近期百万级长文本API能实现低成本商业化的底层逻辑。

但这种“压缩记忆”的模式也存在天然缺陷:线性注意力通过循环乘法更新状态,每处理一个新Token,旧状态就要乘以一次遗忘门系数。随着上下文长度增加,乘法次数不断累积,数值要么不断变小直至归零,要么反向暴涨至无穷大,一旦触发NaN(非数)错误,整个训练进程就会崩溃,千万级的算力投入也会付诸东流。这也是线性注意力长期未能广泛应用的核心原因。

这个技术瓶颈直到哈佛博士生杨松霖发表门控线性注意力(GLA)论文才得到系统性解决,该论文首次提出必须为状态衰减设置下限,不允许数值无限趋近于0。但从学术成果到大规模工业落地,依然存在大量实际问题需要攻克。

当月之暗面团队基于GLA演进出自研的KDA架构,尝试将上下文长度推向100万字时,直接撞上了底层芯片的物理极限。在万卡集群的大规模预训练中,普遍使用fp16或bf16半精度浮点数,其数值动态范围极其狭窄,而线性注意力需要对超长序列进行数万次循环累乘,任何微小的数值发散都会在反复乘法中被迅速放大,最终触发NaN崩溃。

为了规避这种因数值不稳定带来的算力风险,Kimi的底层架构团队直接深入硬件算子层,在自研的FlashKDA CUDA内核中设定了gate_lower_bound = -5。这个数值经过激活函数转换后,大约对应0.67%的旧信息留存率,也就是说,哪怕模型主动决定遗忘某段信息,也会被强制保留0.67%的历史内容。

之所以选择-5这个数值,是经过海量工程试错得出的黄金平衡点:如果设置得过高,比如-3,对应的留存比例约为5%,旧信息会在矩阵中过度堆积,导致网络过载、梯度爆炸或上下文混杂幻觉;如果设置得过低,比如-8,对应留存比例仅约0.03%,模型会出现严重的“健忘症”,长文本读到后面就会忘记前面的关键信息,在长代码调试、长财报分析等需要精准召回的任务中直接失效。而-5恰好卡在中间,既为预训练的算子稳定性提供了保障,又能在推理端实现极低的显存开销,稳住长文本召回率,让百万级长文本的商业化落地真正成为可能。

同样的-5,不同的技术路径

尽管两款模型都选择了-5作为遗忘门下界,但背后的技术逻辑却存在明显差异。对于Kimi K3来说,它采用的是混合注意力架构:用线性注意力承接长上下文的记忆压缩,降低显存和推理成本,同时保留传统Softmax注意力处理复杂逻辑推理的能力,保证核心性能不打折。在这套架构中,gate_lower_bound=-5从预训练启动的第一天就已嵌入,是原生设计的一部分,这个数值也是Kimi团队在自身万卡级预训练中,通过大量试错得出的稳定解,相关细节也全部在公开技术报告中进行了披露。

而智谱GLM-5.3 Flash的配置文件中,虽然出现了完全一致的gate_lower_bound=-5,但相关研究员猜测,这个参数很可能是“中途注入”的。这种操作在工程逻辑上完全成立,甚至是很高明的策略:在预训练中后期追加门控约束,再用调低后的学习率进行一段时间的续训,不需要推倒重来重置权重,就能让一个原本就在相近区间内摸索的模型,快速对齐行业验证过的最佳实践。这种打法省下了动辄数亿的底层试错算力,体现了极强的工程落地效率。

当然,这并不意味着仅靠修改一个参数就能迭代出新模型,智谱本身在线性注意力方向已经有了数月的研发积累。更合理的逻辑是,团队原本就在相近区间内进行实验,在看到行业公开验证了-5在大参数量级下的稳定性后,直接采用了这一经过工业验证的最佳实践,省去了大量重复试错的成本。

不过,中途加入这个底层约束也存在一定风险,比如可能引发隐性分布偏移。模型经过数千万步的预训练后,已经形成了“遗忘门可以调到极低”的内在行为模式,中途突然锁死下限,相当于半路修改了底层运行规则。虽然表面上看训练损失、公开基准跑分都正常,但模型内部的记忆分布其实已经悄悄发生了偏移,这种偏移很难通过常规测试发现,但在50万字以上的超长代码、超长文档这类极端长尾场景中,可能会因为残留信息持续累积出现“慢性中毒”,产生一些逻辑错误。

事实上,在长文本底层优化这条赛道上,并非只有KDA这一条路线。国内另一家顶尖玩家DeepSeek就走出了完全独立的技术路径:他们没有采用Delta Rule谱系下的-5门控方案,而是沿着自研的MLA(混合潜在注意力)与NSA(原生稀疏注意力)持续演进,通过低秩压缩和硬件级算子优化,在另一套数学框架中实现了长序列的数值稳定。

参数撞衫背后的行业成熟度

为什么中国最顶尖的大模型团队,都集体下潜到算子层,死磕长文本的底层计算瓶颈?答案藏在大推理模型时代的算力账本里。自相关模型开启强化学习大推理时代以来,模型在后台进行深度推导时需要自主生成几十万字的“思维链(CoT)”Token。如果还固守传统Transformer平方级增长的算力成本,超长思维链带来的显存黑洞,会直接吞掉任何一家公司的商业毛利。

谁能用线性的成本守住长文本的体验底线,谁就能在推理时代拿到最高的利润空间。而当行业都在相近的模型规模、相近的训练框架下进行超参搜索时,基于Delta Rule的线性注意力,其数学收敛的物理极限区间,天然就指向e^-5这个窄小的黄金带。

从这个角度看,参数“撞衫”从来不是抄袭的佐证,而是行业集体挺进技术深水区时,必然会出现的技术趋同。当大模型公司的竞争下沉到算子优化、数值边界、训练工程细节这些看不见的底层功夫时,参数战之外,还有品味战、效率战、创新之战,这本身就是行业成熟的信号。

任何经受住万卡集群实战检验的“最佳实践”,都会在最短的时间内沦为行业的通用基建。这也解释了为什么国产大模型在长文本处理与超低成本推理上,能在极短时间内逼近甚至斩落国际顶尖闭源模型的身位。因为在极致的算力压迫下,中国最顶尖的技术团队,正在以一种惊人的敏捷度,不约而同地攀上技术高峰的极顶,向物理极限不断发起挑战。

以上内容不代表本平台立场,仅供读者参考