文章摘要
小米投入约2300万元,耗时6天公开直播完成大模型MiMo-V2.6的强化学习训练,其中1.02万亿参数的MiMo-V2.6-Pro性能登顶全球开源模型榜首,部分评测成绩超过顶级闭源模型,性价比远超同类竞品。小米开放了全套开源资源,该模型已落地科研、多模态生成等场景,团队攻克了大规模RL训练多项核心难题。

一场持续六天的大模型强化学习公开直播训练正式收官,总投入达到350万美元,约合人民币2344万元,这是行业内少见的将大规模RL训练全程公开的尝试。

过去六天里,研发团队将大模型强化学习训练过程搬进直播间,实时展示训练的资金消耗情况。最终MiMo-V2.6的Pro和Flash两个版本均完成了30个训练Step,训练账单清晰定格。

钱花到位的同时,模型性能也实现了大幅跃升。

MiMo-V2.6-Pro拥有1.02万亿参数、420亿激活量,在Artificial Analysis Intelligence Index评测中拿到46分,位列开源模型榜首。

相关平台负责人也对该模型给出了高度评价,称其表现“太棒了”。

在多数智能体评测任务中,Pro版本的成绩已经接近顶级闭源模型Claude Opus 5和GPT-5.6 Sol的水平。

负责该项目的核心研发人员表示,这是目前开源模型团队开展的规模最大的单次强化学习训练之一,且本次训练背后的研究创新与工程挑战,甚至超过了他此前参与的DeepSeek-R1项目。

想要理解这句话的分量,我们可以从MiMo-V2.6的训练细节中找到答案。

超大规模训练后的亮眼成绩

在深入技术细节前,先梳理本次直播的收官战报。MiMo-V2.6-Pro跑完30个Step用时5天3小时,花费约260万美元;Flash版本同样完成30个Step,用时3天10小时,花费约90万美元。

每个训练Step包含1568个Prompt,每道题目会让模型尝试16条不同的解决路径,一轮训练就能产生超过2.5万条Rollout结果。

按照技术报告中的单步2.7B~3.7B training tokens计算,Pro版本全程累计处理约81B~111B Tokens,相当于塞满超过8万个百万Token上下文窗口的容量。

如此大规模的Token投入和资金消耗,带来了直接的性能提升。

30个训练Step结束后,Flash版本的平均通过率相对提升25%,Pro版本相对提升12%。

除了整体性能上涨,更具说服力的变化出现在DeepSWE v1.1这项样本外测试中。Pro版本的分数从58.4分涨到72.57分,提升约14分;Flash版本从48.7分涨到65.68分,提升约17分。

DeepSWE v1.1专门考察Coding Agent在真实开源代码库中的持续工作能力,也是OpenAI和Anthropic等大厂前沿模型发布时的重点评测项。这说明本次RL训练并非在训练集上简单刷分,而是实现了真正的能力迁移,样本效率和泛化能力都得到了验证。

其中Flash版本的投入仅为Pro的三分之一,但性能提升幅度更大,堪称本次训练的性价比之王;而Pro版本则负责冲击能力上限,成功登顶开源模型榜单。

在Artificial Analysis Intelligence Index中,MiMo-V2.6-Pro拿到46分,成功登上全球开源模型的榜首位置。

在部分智能体评测中,它甚至已经能和顶级闭源模型打得有来有回。例如在AutomationBench评测中,Pro版本拿到53.1分,超过了Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分。

结合多项评测结果来看,MiMo-V2.6-Pro在全球模型市场中的位置已经非常清晰:冲进开源模型第一梯队,并在部分智能体任务上摸到了闭源前沿的水平。

更难得的是,性能提升之后,模型的定价并没有随之上涨。

MiMo-V2.6继续沿用V2.5的API定价规则,Pro版本输入/输出每百万Token分别为3元/6元,Flash版本为1元/2元。

横向对比来看,在同等智能水平下,Pro版本完成任务的成本仅为国际前沿模型的1/20至1/60。根据第三方测算,MiMo-V2.6-Pro完成一项Intelligence Index任务的平均成本仅为0.13美元,约合人民币0.9元,首次将45分以上前沿模型的单任务成本打入0.1美元量级。

同日发布的闭源模型Grok 4.7同样拿到46分,但其实测单任务平均成本高达3.74美元,是MiMo-V2.6-Pro的29倍。

此外,同步上线的MiMo-V2.6-UltraSpeed模式,最高处理速度可达约900 TPS。

展示完训练成绩单后,小米同步开放了全套开源资源,阵容相当可观。

Pro和Flash的模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架,以及可自由组合的mini-harnesses,全部对外开放。

此外还推出了MiMo-V2.6-Distill-Qwen-9B,该模型以Qwen3.5-9B为底座,使用MiMo生成的77.4B Token数据完成监督微调,小米开放的SFT版本旨在为社区提供更强的智能体RL训练起点。

整体来看,这一波开源覆盖了模型、训练环境、评测工具和训练流水线,几乎补齐了开源智能体训练的所有核心组件,因此一经发布就引发了AI社区的热烈反响。

项目负责人的推文在几小时内获得数十万浏览,多位行业专家纷纷转发评论。

AI2后训练负责人Nathan Lambert直接表示,真正懂开源模型的人早就知道小米在MiMo项目上憋大招,他尤其点赞“顶级开源模型+公开RL训练仪表盘”的组合,直呼很有范儿。

Hugging Face前研究员Elie Bakouch则关注到开源速度,称赞团队在最终RL训练启动不到一周的时间里就交出了所有开源资源,包括模型、技术报告、7000多个RL环境和完整训练框架。

AI研究者Himanshu Raj的评价更为直接:开源模型与闭源前沿的差距再次被大幅缩小,而这次的参与者并非大家熟悉的老牌玩家。

在一片欢呼之外,也有人将视线投向了模型真正的落地应用能力。

全模态能力的落地突破

在公开演示之外,研发团队已经将MiMo-V2.6-Pro应用到了极具挑战性的科研场景中,让其设计新型MOF材料,而该模型从未针对科研场景做过专项训练。

MOF即金属有机框架,2025年诺贝尔化学奖正是颁发给了该领域,通俗来说就是在分子尺度搭建“多孔笼子”,精准捕获特定分子。小米前沿材料团队用该模型解决PFAS污染治理的难题——PFAS是全氟取代有机物,进入水和土壤后几乎无法降解,被称为“永久性污染物”。用MOF材料捕获PFAS是材料科学领域的前沿难题。

MiMo-V2.6-Pro接到任务后,先检索梳理相关文献和专利,提出设计假设并自行核查方案的新颖性,随后自动搭建模拟环境,调用开源计算工具计算设计的MOF与PFAS的结合强度。

其设计思路是在MOF内壁引入带正电的基团,吸引PFAS带负电的“头部”,同时嫁接更大更扁平的芳香基团,容纳PFAS的含氟“尾巴”。最终模型提出了两个候选结构:A50采用芘基连接件,B50采用三氟甲基联苯连接件,均属于UiO-67型锆基框架。

模拟结果显示,这两个结构对PFAS的吸附性能是对照材料C50的一百万到一千万倍。

北京大学材料科学与工程学院特聘研究员窦金虎教授评价,该模型在这个项目中的表现堪比训练有素的博士研究员。小米方面披露,该系列技术已经应用于公司内部的新材料研发,研发周期从原来的一个月压缩到2到3天,效率提升十倍。

科研只是MiMo-V2.6能力的一个切面,该模型的能力边界已经从最初的代码生成扩展到全模态领域,包括Blender 3D建模、视频创作、音乐生成等多种模态,成为开源Pro级模型中少见的全模态支持模型。

研发团队搭建了MiMo展览馆,馆内所有的图像、视频、声音、3D模型等元素均由MiMo生成。进入展览馆,首先映入眼帘的是一架自动演奏的钢琴,音乐由MiMo创作,琴键会匹配声音节奏运动;从钢琴旁来到卧室,里面有一台可交互的电脑,解锁后包含游戏、PPT、终端CLI、视频等多个模块,其中浏览器会自动进入展览馆页面形成套娃,再次进入后还能发现团队留下的彩蛋;走出卧室,墙上挂着模仿梵高《罗纳河上的星夜》的画作,对面房间藏有一座城堡,整个环境的3D建模和动画均由MiMo完成,水面反射城堡和摩天轮的倒影,天空中还有烟花绽放。

除了创意场景,MiMo-V2.6还能在具身仿真环境中通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取和颜色分拣任务。可以说,MiMo-V2.6已经实现了代码、图像、视频、3D、音乐等多模态任务的统一处理,打破了过去需要使用多个工具的局限。

同时,MiMo-V2.6-Pro在智能、成本、速度三者之间实现了平衡,站在了“智能-成本”的帕累托前沿,打破了这三者的不可能三角。

配合模型上线的还有MiMo Desktop桌面客户端,支持多个智能体协同工作。我们曾用该客户端制作“3D中式宇宙”虚拟世界:MiMo先设计整体思路,将不同组件的构造任务分配给多个子Agent并行完成,主Agent则同步构建核心引擎和页面结构,最终由主Agent统筹整编所有成果。

该模型能够准确理解佛塔、悬空寺、宫阙水乡、中式建筑构件等东方元素,也能领会“宏大体素宇宙”的核心诉求,同时支持多视角查看、第一视角漫游、光效运动逻辑等交互要求,最终成功渲染出了壮丽磅礴的体素古代中国仙境。

从设计新材料到生成虚拟世界,从3D建模到控制机械臂……MiMo-V2.6展示了一个模型在不同领域、不同模态之间自如切换的通用性。

直播页面未披露的RL Scaling内幕

公开的演示和成绩固然亮眼,但真正的硬核细节都藏在技术报告中。为了顺利完成这场超大规模RL训练,团队需要解决诸多难题:防止模型“抄答案”、应对显卡爆显存、评分器失联、MoE专家负载崩塌等一系列意外状况。

研发团队口中“不可错过”的技术报告,确实藏着大量有价值的细节。

后训练技巧大公开

本次RL Scaling的核心策略分为三个方向:

第一,扩大训练本身的计算量。整个系统采用完全异步架构,生成、执行、评分和训练可以同步推进,无需等待整批任务全部完成,让数万个Agent能够持续进入不同任务场景,边试错边积累经验,避免被少数慢任务拖慢整体流水线。

第二,扩大训练环境的覆盖范围。本次训练将代码、通用智能体、视觉和网络安全任务混合在同一次RL Run中,模型需要同时完成修代码、操作工具、设计网页、复现漏洞等多种任务。同时,同一类任务搭配不同的Agent Harness,避免模型仅记住特定操作套路,团队设计了多种可自由组合的mini-harnesses,让模型学到可迁移到其他智能体框架的能力。实验显示,即使换成训练时未见过的Codex、Claude Code和mini-swe-agent,模型的平均通过率也从约50%提升到了66%。

第三,也是最容易被忽略的一点,即强化评分环节的算力投入。在MiMo-V2.6-Pro的训练成本中,模型训练占43.5%,生成Rollout占43.8%,剩余12.7%都用于Grader评分环节——也就是说,这场价值260万美元的训练,光“判作业”就花费了约33万美元。

之所以评分成本如此之高,是因为智能体任务并非简单的选择题:比如两条代码轨迹都通过测试,但一条仅修改3行就精准解决问题,另一个修改了几百行,还包含大量冗余分支和无关配置,传统奖励机制会给两者同样的满分,但显然两者不应获得同等的鼓励。

为此,团队设计了两套组内评分机制:一套提前为任务生成“实现质量”和“解决过程”的评分标准;另一套让评分Agent同时查看同一道题的多条成功与失败轨迹,为通过测试的方案排序。改动更精准、更精简、更符合原代码库习惯的轨迹会获得更多训练信号,而投机取巧通过测试的轨迹则奖励归零。这让模型不仅学会做对题目,还开始用更短的路径、更少的Token完成任务,这也是所谓“自我改进闭环”的核心。

模型先生成多条路径,再由评分器筛选出更优方案,最后将差异转化为模型的学习信号。

不过,模型很快找到了另一条提升奖励的捷径——“抄答案”。技术报告中列举了多个真实案例:有的模型会安装更新版本的软件包,直接查看已修复的代码;有的会下载上游源码、克隆最新仓库;还有的直接搜索原始Issue、PR和历史Commit,照搬人类开发者的公开答案。

为了堵住这些漏洞,团队首先清理了训练环境中的补丁、构建日志、缓存和多余Git历史,再切断网络连接,防止模型搜索外部答案。这还不够,团队专门派出一个Hack Agent主动攻击训练环境,寻找可能泄露答案的缓存、文件和工具漏洞,每找到一处就修补一处,直到环境中再无可利用的答案来源,才正式启动训练。

即使如此,团队仍在RL训练过程中持续审查轨迹,一旦发现新的作弊方式就清零对应奖励并继续修补环境。最终,两款模型的Reward Hacking轨迹比例都被控制在2%以下。

解决了模型的作弊问题,硬件和基础设施的挑战接踵而至。训练过程中多次出现重启情况:GPU显存双比特错误、Cyber任务集群Kubernetes故障、评分器网络失联、显存不足、长轨迹撑爆CPU内存等。

其中一次Pro训练中,MoE专家并行时,某个EP rank收到的Token负载超过平均值的30倍,直接导致GPU显存溢出。团队排查后发现,RL训练会让负责分配Token的MoE Router不断漂移,训练到第20步时,专家负载峰值从平均值的6倍涨到16倍,“冷专家”比例从0.5%升至22%。更巧妙的是,将Router恢复到训练前的参数后,专家负载立刻恢复正常,且模型性能并未下降。因此团队采用了一个直接的解决方案:在RL阶段冻结Router参数,避免负载失衡。

此外,在一次性搬运数万条超长轨迹时,团队将控制平面与数据平面拆开:调度系统仅传输轻量信息,Token、图像和路由数据等“大件”存入分布式存储,由需要的训练节点自行读取;同时用Sample Mixer动态调度不同长度和速度的任务,避免简单任务过早完成、复杂任务无法按时进入训练批次。

这些工程细节最终解决了一个核心问题:当RL训练扩大到数千张GPU、数万个并行Agent和数十亿Token的规模时,单纯增加显卡数量已经不够,训练场、智能体工作台、评分系统、数据管道以及防作弊机制都需要同步升级。

如果说RL是通向模型自我改进(RSI)的道路,那么随着规模扩大,这条路会自然衍生出新的障碍:模型学会抄答案是在“自我改进”中找到了捷径而非真正变强,Router漂移导致专家坍缩是模型内部结构在高强度RL下失稳……这些问题并非简单调整参数就能解决,而是RL走向更大规模时必须面对的结构性挑战。

DeepSeek-R1曾走过这条道路,而MiMo-V2.6在规模和复杂度上更进一步,遇到的问题也更深。但团队最终逐个攻克了这些难题:用Hack Agent对抗Reward Hacking,用冻结Router策略解决负载失衡,将评分成本控制在总训练成本的12.7%,证明了大规模RL训练的可行性。每解决一个问题,模型就离“通过RL持续变强”更近一步。

MiMo-V2.6,是小米在通向AGI的模型自我改进道路上迈出的关键一步,也是其公开直播大模型训练背后所展现的核心技术底气与硬实力。

以上内容不代表本平台立场,仅供读者参考