大模型训练路线之争:蒸馏的代价与回报

大语言模型的训练赛道上,一场关于时间与效率的博弈正在上演——是否使用知识蒸馏技术,成为了不同团队选择不同发展路径的核心分歧点。
一位基础大模型研究员曾如此形容蒸馏在训练流程中的定位:“一套成熟的模型训练管线,应当将蒸馏作为冷启动环节,让模型快速达到可用的基础水准,再去攻坚后续的细节优化。”所谓冷启动,就是让能力较弱的学生模型,学习更强教师模型已经验证通过的答案与任务轨迹,快速得到一个可以继续迭代的基础版本。
对于大模型厂商而言,放弃蒸馏就意味着跳过这段加速过程,从基础能力开始自主探索。这种选择的好处是可以拥有更独立的训练体系,但也需要付出更长的模型迭代周期。
据行业观察此前报道,国内某头部科技公司的大模型项目成立之初便定下“不做蒸馏”的原则。相关负责人解释,团队的目标是进入全球第一梯队,而通过蒸馏难以实现这一长远定位。该公司创始人也曾在内部会议中明确表示,即使暂时落后于国内同行,也不会把蒸馏当作提升模型能力的捷径。
与这种选择形成鲜明对比的是,在该公司表态“不蒸馏”的前一周,英伟达CEO黄仁勋在采访中表达了完全相反的看法:“蒸馏,也就是向AI学习、向其他知识来源学习,是智能的基础。”就在这场采访结束几天后,黄仁勋还转发了一封由英伟达、Meta、微软和戴尔等公司联合支持的开放模型联名信,信中将蒸馏列为模型改进、测试和验证中广泛使用的核心方法,主张构建覆盖各行各业的开放模型生态。
到底该不该使用蒸馏?不蒸馏的代价和回报分别是什么?行业内多位大模型研究员就此展开了深入讨论。
拒绝蒸馏的时间代价
有研究员这样概括国内基础大模型团队与海外头部厂商的差距:“数据不够、算力不够,也缺少相关的管线。”他指出,国内预训练阶段与北美前沿水平仍有差距,但差距已经不像早期那样悬殊,更大的差距出现在后训练和高质量数据层面。而蒸馏技术,正是帮助基座厂商快速补齐这些短板的有效手段,可以大幅压缩模型的迭代周期。
坚持不蒸馏的团队,真的不需要面对这些问题吗?显然并非如此。以该头部科技公司的最新一代基础大模型为例,其在某专业代码竞赛的WebDev总榜中仅位列第16位,落后于排名第二的Kimi K3和第六的GLM-5.2。多位参与交流的研究员都认为:“完全不蒸馏肯定会慢很多,短期内不借助蒸馏把Coding和Agentic能力做到行业前列,似乎并不现实。”
模型能力提升的时间压力,本质上来自数据飞轮效应。模型只有先达到可用水平,才能进入真实开发环境;能力越强就越能获得用户使用,使用过程中产生的回流数据又会进入下一轮训练,进一步提升模型性能。该头部科技公司的相关人士曾透露,其Coding模型此前难以突破的原因之一,就是业务使用意愿不足、缺少足够的数据回流。
“如果冷启动第一步都做不了,后面的管线就转不起来。”一位受访研究员用马太效应形容这一过程:用户更倾向于选择能力最强的模型,更多的使用会带来更多真实任务和回流数据,进一步拉大不同模型之间的迭代差距。
Agent任务进一步放大了这种时间差。当前的Agent场景中,多轮工具调用需要模型连续规划、执行和纠错,前序步骤一旦出现偏差,错误可能沿着任务链不断累积。模型从头探索一条成功的执行轨迹,通常比直接学习已经跑通的过程要慢得多。
不过,“不蒸馏”带来的压力,在不同的能力线上并不相同。与该头部科技公司在LLM领域未能进入国内第一阵营不同,其在视频生成领域已经进入全球前列。多位行业人士将其视频生成产品的成功概括为“一场数据的胜利”。据接近该团队的人士透露,其视频训练链路不使用外部模型蒸馏,连用于数据筛选、理解等环节的视觉语言模型,也不以其他模型的输出作为蒸馏来源。
视频生成与语言模型的逻辑不同:AI生成的视频仍然容易呈现出可辨认的“AI感”,外部模型产出的内容很难直接替代高质量的真实视频数据,因此蒸馏带来的增益相对有限。在视频生成赛道,该团队凭借数据、架构和产品积累,已经在不借助外部模型蒸馏的情况下进入行业前沿;但在Coding和Agent赛道,它仍需要尽快补齐能力差距,获得更多真实使用场景和回流数据。同一条“不蒸馏”原则,在不同能力线上需要付出的时间成本并不相同。
在LLM领域,当其他大模型公司借助蒸馏完成冷启动、提前进入真实场景时,坚持不蒸馏的团队需要用更长的训练周期,验证这套自建数据体系能否转化为领先能力。这也能解释为什么该团队近期成立了一级部门“AI数据与安全”,为旗下大模型提供寻源采购、合成清洗和质量评测等服务——在模型和产品之外,必须把数据能力作为独立的组织支柱,以支撑自己的训练体系。
蒸馏的回报与代价
现代知识蒸馏的经典范式,可以追溯到图灵奖得主、深度学习先驱辛顿等人在2015年发表的《神经网络中的知识蒸馏》论文。该论文提出,让较小的“学生模型”学习大型“教师模型”的输出分布,从而以更低的成本承接其能力。例如2019年发布的DistilBERT,将BERT模型缩小40%,保留了97%的语言理解能力,同时将推理速度提升了60%。在当时,蒸馏主要用于解决模型体积过大、部署成本过高的问题。
生成式AI兴起后,更强模型生成的答案、解释和任务轨迹,开始被直接用于训练其他模型。2023年3月,斯坦福团队用OpenAI模型生成5.2万条指令数据,以不到500美元的数据成本训练出Alpaca模型;同年,微软让130亿参数的Orca模型学习GPT-4给出的解释轨迹,在Big-Bench Hard复杂零样本推理任务上达到了与ChatGPT相当的水平。
严格来说,利用“教师”模型生成数据再做监督微调,并不等同于传统意义上的知识蒸馏,但在大模型行业的语境中,这类“用强模型输出训练另一个模型”的路线也被纳入广义蒸馏的范畴。2024年发布Llama 3.1 405B时,Meta CEO扎克伯格就将蒸馏小模型列为开放旗舰模型的重要用途,同期还将合成数据生成写入了该模型的主要工作流。
到2026年,蒸馏技术已经成熟应用于模型能力合并场景。DeepSeek V4的技术报告显示,团队先以监督微调和强化学习分别训练十多个数学、Coding和Agent等领域的专家模型,再让通用模型在自己采样的轨迹上学习各个专家的输出分布,通过多教师在线策略蒸馏来合并不同领域的能力。Kimi K3也将蒸馏纳入了后训练的主流程,其技术报告显示,团队围绕通用推理、Coding和Agent任务,以及低、中、高三档思考强度,形成了9个教师模型,再通过多教师在线策略蒸馏将能力整合到同一个模型中。
“归根结底,蒸馏是一种构造数据的方法。”一位研究员如此概括蒸馏的核心价值:与从零搭建合成数据管线、反复试错,或者为复杂任务组织专家标注相比,让更强模型生成答案和操作轨迹,通常能更快把模型送到可用的起点。
这种回报在Agent训练中表现得尤为直接。韩国科学技术院的研究团队在近期提交的一项研究中显示,从GPT-5-mini的成功轨迹中提取任务流程、子任务示例和工具调用经验,可以让4B至8B参数的模型在三项工具使用基准测试中均提升任务准确率。蒸馏还可以将更昂贵的强化学习留给难题,“稍微简单一点的问题,直接蒸馏就好了,没必要再让模型用强化学习探索,会浪费很多资源。”一位研究员说道。
苹果研究团队在2025年发表的“蒸馏缩放定律”则为蒸馏的成本效益算了一笔账:当教师模型已经存在,或者需要反复训练多个学生模型时,蒸馏通常更节省算力;如果只训练一个学生模型,还要为此从头训练教师模型,那么直接训练往往更划算。
蒸馏节省了寻找答案的时间,却不能替模型公司决定应该解决什么问题。“蒸馏说白了并不复杂,一道题让更强的模型跑一遍,再把轨迹拿出来改成训练格式。”一位研究员表示,相比之下,“难度反而落在造题上”:题目可以来自网络抓取、专家提供,也可以由团队自行构造。
蒸馏的回报是时间和算力,但这种效率也有其代价。不少研究员都提到,蒸馏通常用于把模型尽快推过可用门槛;当多家模型都来到相近的起点后,继续提升模型能力未必还要依赖蒸馏。“到了边际收益递减的时候,大家就会慢慢把这个东西换掉。”
“但真正有能力把蒸馏、强化学习和正向研发同时推进的团队不是特别多。”上述研究员坦言。此外,蒸馏也会改变一家公司的资源分配。有研究员提到,蒸馏能让模型短期拿到一个“还可以的成绩”,但见效太快,也可能让团队“比较贪恋这种方式”。如果要进入最顶级的竞争,“光蒸馏是不够的,还是要回到算法和正向研发上去做突破”。
几周前,在Kimi K3发布后,劳德研究所研究者、Snorkel AI联合创始人布雷登·汉考克表示,仅靠蒸馏,不可能在如此短的时间里训练出这种强度的模型。艾伦人工智能研究所研究员内森·兰伯特也指出,如果蒸馏足以复制前沿能力,其他团队本应很容易追上GLM或Kimi,但现实并非如此。
有研究员将这个问题的答案留给了接下来的模型迭代。在他看来,不蒸馏路线最大的阻碍,在于能否承受一段时间内没有“拿得出手的产出”。
围绕蒸馏,这场长期主义和时间成本的博弈还在继续,在资源和团队技术路线的比拼之外,也考验着行业等待结果的耐心。

