拒绝蒸馏,字节剑指AI第一梯队:10万亿参数大模型浮出水面

近期海外行业媒体披露,字节跳动Seed大模型团队的全员会议上,创始人张一鸣明确表态,拒绝通过蒸馏其他模型的方式追赶前沿大语言模型技术,他强调企业应当愿意为长期目标牺牲短期利益。
最新的全球大语言模型排行榜中,国内多款产品跻身前十,包括月之暗面、阿里、智谱、深度求索等厂商的模型,占据了近半数席位。但字节的Seed 2.1 Pro仅排在第21位,表现远落后于其他国内头部AI团队。
从资源禀赋来看,字节跳动并不缺大模型研发的核心要素:年利润规模位居互联网行业头部,Seed团队汇聚了来自搜广推体系的顶尖算法人才,全国布局的智算中心拥有数万张GPU集群,抖音和TikTok更坐拥全球最大的原生内容数据池。
拥有这些优势的字节,为什么在大模型榜单上的表现并不突出?据字节内部员工透露,公司拒绝通过蒸馏手段追赶,被认为是Seed大模型落后于其他国内实验室的重要原因之一。
三次坚定的路线选择
蒸馏,通俗来说就是借用其他大模型的输出结果训练自身模型,是行业公认的快速追赶捷径。在公开报道中,字节内部至少有三次关于是否采用蒸馏路线的争论。
第一次是2025年1月,深度求索的DeepSeek-R1凭借独特的推理风格席卷全球,Seed团队内部有研究员提议跟进蒸馏方案,但被张一鸣否决。他希望Seed模型能够像人类一样自主学习思考逻辑,而非单纯模仿其他模型的输出风格。
第二次是在英伟达Blackwell芯片部署后,行业对手获得了最新的算力硬件支持,字节只能依赖H20芯片维持训练,此时内部要求蒸馏的呼声再次升高,但张一鸣再次拒绝,转而选择增资超2000亿元,在乌兰察布、怀来等地新建智算中心。
第三次则是月之暗面Kimi K3成功跻身全球顶尖模型榜单后,每次国内开源新模型发布都会带来内部压力,当团队焦虑达到顶点时,张一鸣依然坚持己见,他认为榜单排名只是虚浮的指标,真正重要的是掌握技术与商业的主权。
张一鸣的坚持并非一时冲动,据接近Seed团队的人士透露,早在2023年4月,字节就已经通过API检测等技术手段,严格禁止在训练集中混入GPT生成的数据,内部的蒸馏禁令已经执行了三年之久。
国内某大厂高管曾在行业交流中提到:“字节一开始也尝试过蒸馏路线,但张一鸣后来痛定思痛,认为头部企业不能长期依赖模仿他人。头部互联网企业,必须走出自己的技术路径。”
大模型蒸馏就像是“背老师的作业答案”,见效速度极快:只需注入几百万条高质量的指令数据,模型在基准测试中的分数就能在几周内快速逼近被蒸馏模型的水平。在大模型竞速的早期,几乎所有玩家都尝试过这一方法。但随着赛道进入深水区,这种方式的争议也逐渐显现。
2026年以来,Anthropic多次公开指责国内多家厂商的大模型存在蒸馏其模型的行为,将中国大模型的快速崛起归因于“抄捷径”。但颇具讽刺意味的是,Anthropic自身也被曝多次蒸馏OpenAI模型,甚至使用盗版书籍数据进行训练。
真正让张一鸣坚持拒绝蒸馏的,是更深层的技术逻辑:在数据见顶、算力竞争进入白热化的阶段,依靠蒸馏永远只能跟在他人身后,甚至会在下一轮智能跃迁中彻底掉队。
拒绝蒸馏的四大技术逻辑
避开合成数据的“近亲繁殖”风险
蒸馏的本质是用其他模型的输出作为“标准答案”训练自身模型,看似高效,却存在一个不可逆的致命缺陷:模型坍缩。
2024年7月,牛津、剑桥等机构的联合研究登上国际顶级学术期刊封面,首次系统证实,如果反复使用AI生成的数据训练模型,原始数据分布中的尾部信息会逐渐消失,最终导致模型能力出现不可逆的退化。这就像近亲繁殖,第一代模型看起来健康,但基因多样性会快速流失,经过多代迭代后,隐性缺陷会集中爆发。
2025年国际顶会ICLR上的研究进一步证实,训练数据中哪怕只掺入千分之一的合成数据,就足以触发模型坍缩;即使比例更低,毒性效应依然存在,而且模型参数量越大,坍缩效应在特定阈值下会被放大,并非单纯靠堆参数就能解决问题。
为什么尾部信息如此重要?真实世界的知识并非均匀分布:常见问题和标准回答只占信息分布的“头部”,而罕见的边缘场景、反常识提问、方言俚语的微妙语义、小众领域的专业知识,都藏在分布的“长尾”中。这些长尾信息决定了模型处理未知问题的上限,也是真正的智能边界。
AI生成的“标准答案”天生会抹平这些长尾信息,模型输出的永远是概率最高的回答,会自动过滤小众、反常、不确定的内容,只留下最“正确”也最平庸的结果。用这样的数据反复训练,模型会变得越来越自信,也越来越狭隘,虽然基准测试分数可能还在上涨,但“世界观”已经在悄悄坍缩。这就是蒸馏的天花板:永远只能逼近他人的能力上限,而且追赶得越久,自身的能力边界就越窄。
而字节最大的底气恰恰来自数据:抖音日均产出超8000万条短视频,头条日均推荐内容以亿计,海外TikTok覆盖150多个国家和地区,这是全球最庞大的原生人类内容池。从PB级的真实视频、文本、评论、交互数据中清洗降噪,远比直接使用几百万条GPT生成的干净指令数据困难,但只有原生真实数据,才能完整保留现实世界的分布,包括那些奇怪、鲜活、不可预测的长尾信息。智能增长的核心逻辑是用更多高质量真实数据推高天花板,合成数据只能在已有边界内做平滑,永远无法突破边界。字节选择的,是一条自己定义天花板的道路。
拿回词表里的技术主权
很多人忽略了一个最底层的细节:词表。词表是模型的“眼睛”,它决定了模型如何将一段文字切分成基础单元,每个单元对应一个向量表示。使用他人的词表,就等于接受了对方的语言偏好和认知颗粒度。
比如主流英文模型的词表是针对英语优化的,遇到中文成语、网络热梗、弹幕缩写时,常常会被拆成四五个零散的单字,这不仅会大幅降低推理效率、拉高成本,更关键的是语义的关联性被切碎,模型从输入层就没有真正理解中文的表达逻辑。
更致命的影响体现在多模态领域。字节Seed系列的核心战场从来不是纯文本大模型,而是原生多模态模型。相关产品已经实现原生音画同步的视频生成,支持60秒2K分辨率视频和多语言的唇形对齐,这种能力的前提是模型在底层实现文本、视频帧、音频信号的原子级映射:每一个语义单元,都要和对应的视觉、声学单元在同一个向量空间里对齐。
如果蒸馏了其他模型,就只能继承对方的编码地基:别人怎么切分视频Token,你就得怎么切分;别人怎么对齐音文时序,你就得怎么对齐。后天微调可以修改参数、调整效果,但无法改变底层的Token空间和语义框架。不蒸馏意味着字节可以从零定义规则:视频帧以什么粒度做Token化最合理、音频的节奏特征如何编码进语言模型、多模态信号怎么做联合注意力……所有底层决策全部握在自己手里。对于要做视频生成、多模态交互的字节来说,地基的自主权,远比短期的文本榜单排名重要得多。
硬件限制下的“重工业”内功
靠蒸馏做模型,本质是轻量级的“微创新”:站在他人现成的基座上做微调,几百张GPU跑几周就能看到效果,见效快、成本低,是很多厂商快速追赶的首选路径。但字节选择的从头训练路线,完全是另一套游戏规则。要从零训练千亿级参数的混合专家模型,比拼的从来不是单点算法的优劣,而是整套工程体系的硬实力,这是真正的AI“重工业”。
超大规模预训练中,最致命的指标是平均无故障时间。一次完整的预训练周期往往长达数月,需要调动数万张GPU并行计算,期间任何一张显卡出现内存错误、任何一条高速链路发生通信闪断、任何一个算子触发精度溢出,都可能让整个训练任务中断,甚至导致前期投入的算力成本全部打水漂。集群规模越大,故障发生的概率就越高:假设单张GPU的平均无故障时间是10万小时,那么由一万张卡组成的集群,平均每10小时就会遭遇一次硬件故障。如果没有毫秒级的故障检测、精准的断点续训和完备的容错恢复机制,大规模从头训练根本无从谈起。
对字节来说,这份挑战还要更严峻:受国际芯片出口管制限制,字节无法采购英伟达最新的旗舰芯片,只能使用性能受限的通用芯片,单卡训练效率与海外顶尖平台差距显著。他人依靠更强的单卡性能就能撑起训练效率,字节要追上差距,只能靠更大的集群规模、更高的资源利用率和更极致的工程优化来弥补。这种先天限制,反而倒逼字节将基础设施能力推到了行业极限。
公开信息显示,字节的训练集群已经布局多个国内智算中心,搭建起数万张卡规模的分布式算力网络。2026年字节AI基础设施资本开支已上调至超2000亿元,公司净利润同比出现明显下滑,核心原因正是三四季度算力采购与数据中心建设的集中投入。张一鸣本人也将一半精力倾注在Seed团队,这笔千亿级的资金投入,加上创始人级别的注意力倾斜,押注的从来不只是某一个模型的效果,而是一整套能稳定支撑超大规模训练的全栈工程体系:从底层算子优化、集群通信调度,到训练故障恢复、算力资源管理,全部自主研发。
这套能稳稳撑起“万亿参数从零训练”的训练框架与基建能力,才是字节真正的技术护城河。走蒸馏路线的厂商,永远不需要攻克万卡级稳定训练的工程难题,自然也沉淀不下这套重工业级的系统能力。当智能模型的规模持续攀升时,竞争的门槛会从算法转向工程,到那时,只有手握完整基建能力的玩家,才有资格留在牌桌上。
奖励模型的“灵魂归属”:学答案永远学不会思维
蒸馏学的是“答案”,从头训练学的是“思维”。用其他模型的输出训练,模型学到的是对方的输出分布,包括说话的语气、回答的套路,甚至对齐阶段被注入的价值观偏好。它知道什么问题该说什么话,但不知道为什么这么说;它模仿得了结果,却模仿不了背后的推理链路。
更关键的是,模型的“灵魂”会打上他人的烙印:什么是好回答、什么该拒绝、什么场景用什么风格,这些底层偏好在蒸馏过程中会被一并继承。后续再做对齐调整、优化奖励模型,也只是在他人的地基上做装修,很难从根本上改变模型的行为模式。
而字节需要的,是完全对齐自身业务逻辑的奖励模型。抖音的推荐逻辑看重完播率和互动率,电商业务关注点击到购买的转化效率,短视频内容注重节奏感和视觉冲击力,这些独特的商业逻辑,必须深度植入奖励模型,让模型在对齐阶段就和字节系产品的目标对齐。
如果蒸馏了其他头部模型,模型的“灵魂”里刻着对方的偏好逻辑,后续再怎么调整,也是在他人的地基上装修。只有从头训练,从预训练到对齐全链路自主,字节才能让模型真正对齐到自身极致的商业逻辑中,这不仅关乎效果,更关乎可控性。
字节的底牌:10万亿参数大模型
拒绝了捷径,字节的追赶路径是什么?答案正在逐渐浮出水面。据国际财经媒体报道,字节跳动正在讨论训练一个参数规模达10万亿的大模型,显著超过国内现有主流模型的参数规模,是目前国内已知参数规模最大的模型计划。该项目仍处于早期探索阶段,由Seed团队核心负责人主导,与预训练数据团队协同推进,最终是否正式发布尚未确定。
这是一个非常符合字节风格的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。智能模型的增长规律依然是当前大模型最可靠的进阶路径,在数据质量、训练效率达标的前提下,参数规模的提升会带来可预测的能力增长。当主流玩家还在2-3万亿参数区间内卷时,字节直接冲击10万亿,本质是用规模换时间,用更大的投入,跳过中间的追赶步骤,直接摸到下一个梯队的门槛。
但这同样是一场豪赌。参数规模翻倍,训练难度并非线性增长,而是指数级上升:数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大的挑战。千亿级的资本开支、利润下滑、创始人一半的精力,所有筹码都压在了这条“更慢更难”的路上。
这条路的价值不止于技术本身。当行业内多家厂商被指控蒸馏模型,当相关监管政策逐步完善,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱,无论是全球化布局还是长期技术竞争,都站在更安全的位置。
未来3年,大模型的技术范式窗口期正在急剧收窄,头部玩家今天的技术路线选择,会决定未来十年甚至更久的竞争格局。蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快,投入产出清晰可见,但它的代价是永远失去定义终点的资格。
张一鸣在会议上明确要求团队以追求智能上限为目标,期待Seed模型能力能够跻身世界第一梯队。技术主权,真正参与定义智能上限的机会,正是这条更难走的路的回报。
相关报道可查阅行业公开资料

