微信WeLM提出Hidden Decoding:大模型推理新范式

据行业观察
当前主流大模型的性能提升,长期以来主要依赖两条核心路径:一是通过模型参数扩容,随着Scaling Law的提出,模型参数从百亿级跃升至千亿级,随之而来的是算力成本的指数级增长;二是通过延长推理链路,以o1为代表的思考模型通过更长的思维链和更多的推理步骤来提升输出质量。
但这两条路径都有明显的瓶颈:要么需要投入巨额算力扩容参数,要么需要更长的推理时间增加延迟。那么,除了这两条路之外,是否存在第三条可以提升模型性能的路径?
近期,WeLM团队推出的Hidden Decoding(隐式序列缩放)技术,给出了全新的解决方案。
该技术的核心思路是把额外算力折叠进序列内部,让模型在token之间完成隐式思考,最终输出的序列长度不变,但每个token的推理过程更深。
该团队在今年3月首次在80B参数规模上验证了该技术的可行性,仅用了四个月就将方案推进到617B MoE的前沿规模,且增量续训仅使用了完整训练量的5.3%,在9项公开评测中全部超越了传统自回归基线模型。
隐式序列缩放的技术细节
Hidden Decoding的实现可以概括为三个关键步骤:
- 给定输入序列和n份词表嵌入,把第i个token的第k条「流」表征放在物理位置(i−1)n+k上,构成长度为nL的扩展序列;
- 扩展序列在标准因果注意力和连续的位置编码下,送进同一个Transformer,不新增任何主干参数;
- 训练时只在每个token的最后一条流上计算下一个token的预测损失,前n−1条流不接收任何直接监督。
简单来说,前面的流相当于为最后一条流“打草稿”,逐步精炼表征、保留更宽的候选集合,最终由最后一条流收敛到最终预测结果。
规模化落地的工程优化
将序列长度从L扩展到nL会带来显著的计算压力:非注意力计算大致呈线性增长,但稠密注意力会按序列长度的平方膨胀,以n=4为例就会带来16倍的计算增长,这在大模型场景下几乎无法落地。
团队提出了Stream-Factorized Attention来解决这个问题:让大多数层只在同一条流内部做注意力,只让少数层做跨流混合。具体来说:
- 流内注意力层:只关注同一条流中更早的位置;
- 跨流注意力层:额外跨流关注,沿用基座原本的注意力形态,滑动窗口或全注意力。
该方案没有新增注意力层,而是对基座里已有的局部注意力层和一小部分全注意力层启用跨流功能,将新增的注意力成本从n的平方量级压到了接近线性的n倍,这也是Hidden Decoding能在100B+稀疏模型上落地的核心。
此外,团队还利用了WeLM主干的既有设计KV-mirror来进一步加速:后段三分之一的层复用前段三分之一层的隐状态来构造键值缓存。由于镜像层的键值只依赖早期层的隐状态,而只有最后一条流被监督、中间流只通过它们贡献的键值起作用,团队只让最后一条流通过镜像层,前段仍处理全部n条流。在80B、32k训练设置下,这把单步时间从15秒降到12秒,带来了约两成的性能提升。
实验效果与成本分析
团队在相同基座上对比了使用和不使用Hidden Decoding的效果,仅用同一套短指令微调配方适配,未涉及强化学习。实验结果显示,Hidden Decoding在两个规模上都实现了全面的提升:80B模型平均提升约0.99个百分点,617B模型提升约1.03个百分点,较大的提升出现在SuperGPQA、MMLU-Pro等更难的推理与知识任务上。
在训练成本方面,当n=4时,有效序列在80B上花费5.1×单batch时间、在617B上花费4.4×,接近n=4的线性参考,远低于稠密注意力的16×膨胀。更关键的是,Hidden Decoding并非从零训练,而是在已有自回归基座checkpoint上做增量续训,无需重跑完整预训练。
相比循环模型,Hidden Decoding的额外计算是并行的:循环模型逐步重复主干,每步都要等上一步,额外成本无法隐藏;而Hidden Decoding把计算摊到n条stream上,一次前向并行处理。实测数据显示:
- 大batch下,解码受计算限制,额外计算会降低吞吐,这是所有增加计算的方法的共性;
- 小batch下,解码受显存带宽限制,计算大量闲置,并行stream恰好利用这些空闲算力,相对基线损失更小。
这意味着在实际在线服务场景中,Hidden Decoding的推理成本并非简单的线性增长,而是与batch size和序列长度分布强相关。
中间流的作用验证
Hidden Decoding依赖一个反直觉的选择:只训练最后一条流,前面的流零监督。主结果说明这能提升准确率,但收益到底来自“更长的序列”“更多的预测目标”,还是“中间流真的在做某种精炼”?
团队通过注意力组合消融实验比较了三种配置:27层全跨流、4层、1层。结果显示,所有变体都大幅超过自回归基线,全跨流效果最好,但只用1层或4层全注意力的变体恢复了大部分收益,少数几层跨流就足够了,这让流因子化注意力能在保住准确率的同时保持廉价。
键值缓存保留的消融实验则表明,为不同流保留独立状态优于共享状态,两种布局下平均分都小幅下降,说明独立的中间状态确有帮助。
最有趣的是流与语言模型头的探针实验:在8B基座加Hidden Decoding(n=8)的场景中,团队观察到两点:其一,同一token的各流在Transformer中间层显著分化、临近输出层又部分靠拢,且最终流对其他流分配了可观的注意力,构成从中间流到预测流的读取通路;其二,把共享的输出头施加到各流时,中间流的最优预测常与最终流不同,最大差异率约63%,且其不确定性普遍高于最终流,说明在最终预测收敛前,中间流保留了更宽的候选分布。
综合来看,消融与探针实验指向同一结论:中间流在最终流收敛到预测之前,保留并精炼着一个更宽的候选集合。这正是“把前面的流用作潜空间计算状态”的含义,也是Hidden Decoding区别于简单“加长序列”或“多目标预测”的关键。
WeLM的技术演进路线
WeLM是持续研发的通用大语言模型系列,承载着核心技术战略,从2022年首次公开亮相至今已连续迭代四代。从近期发布的技术博客可以看出其清晰的演进路径:从V3时代的训练体系搭建,到V4时代的效率与质量创新,再到600B级模型的Scaling突破与Hidden Decoding的推理范式创新。
这标志着WeLM已形成覆盖预训练、后训练和推理优化的完整技术版图。更重要的是,WeLM并非止步于论文指标与实验室评测的试验性模型,当前已进入灰度测试阶段的AI助手,其核心模型能力由WeLM提供,依托超大规模用户基数的产品生态,WeLM已进入由真实用户、真实流量与真实复杂任务构成的终极试炼场。
未来展望
博客最后透露了后续进展:在采用更高质量、更大规模的数据做后训练后,80B与617B的自回归基座已经展现出显著更高的基准成绩与更稳定的使用体验。这说明WeLM的自回归基座本身就已经很有竞争力,而Hidden Decoding是在这个扎实基座之上的进一步增益。
研究团队表示,接下来会在这套更强的基线上继续验证Hidden Decoding的增益,并将其与强化学习充分结合。
写在最后
回顾WeLM团队近期公开的技术博客,可以看到一条逐渐清晰、前后呼应的技术路线:《以适度资源构建高效稀疏MoE模型》探索了如何以更稀疏、更高效的模型获得有竞争力的能力,在同等智能下压低资源消耗;Hidden Decoding系列则从创新的推理范式入手,在同等模型参数下继续上推智能上限。
前者让智能服务得起更多用户,后者让有限资源解决更难的问题。沿着两个方向回看,这系列博客并非彼此孤立的技术尝试,而是一套围绕资源效率展开的系统性探索,也呼应了团队博客首页“极致的资源效率”的命题。
对于需要面对超大规模真实用户与复杂任务的团队而言,极致的资源效率不是智能增长的约束,或许恰恰是通往更高智能的另一条路径。

