小米公开RL训练直播:每小时烧3万刀 探索强化学习扩展

一场公开的AI模型强化学习训练直播引发了行业关注,这场直播并非技术教学演示,而是实打实的算力消耗现场。粗略计算下来,每分钟的训练成本超过4000元人民币,每一秒都有10美元的算力投入。
从Pro模型启动训练算起的36小时内,两款模型的总花费已经超过108万美元,平均下来每小时的训练成本高达3万美元。换做其他团队可能会惊呼“烧钱无度”,但小米的这场训练直播,更像是一次公开的技术实力展示。
直播后台的所有数据完全对外开放:训练总花费、已完成的步数、奖励曲线走势,甚至各个节点的显卡故障情况都可以实时查看。这种开放完整训练全流程的做法,在AI行业中并不常见,引得不少行业观察者纷纷围观。
目前MiMo-V2.6系列的Flash和Pro两款模型仍处于训练初期,仅开展了一天多的训练,但已经能看到明显的能力提升。Pro模型的dynsam/avg@n指标从初始的约0.565提升至0.614,Flash则从0.514提升至0.603;在最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别拿到了62.24和60.77的分数,对比之下DeepSeek-Flash v1.1的得分达到74.2%。Flash从更低的起点快速追赶,目前仅小幅落后于Pro,不过Pro的单步训练耗时更长,最新的评分数据尚未更新。
在2024年4月开源MiMo-v2.5之后,相关团队沉寂了近半年时间。本次训练直播中,项目负责人出面解释,这段时间的核心研究方向只有一个:探索强化学习的规模化边界。
三大维度实现强化学习规模化训练
AI预训练的规模化逻辑早已被行业熟知:更多训练数据、更大参数量、更强算力,最终带来模型能力的提升。而当前前沿AI领域开始思考:强化学习能否复刻这套规模化路径?
针对这个问题,小米给出的解决方案是从三个维度拓展强化学习的训练规模:训练计算量、训练环境与执行框架、评分计算量。
训练计算量的规模化
首先是训练计算量的拓展。MiMo-V2.6系列的单次训练Step可以处理约20亿Token,训练配置为1568个Prompt,每个Prompt生成16条Rollout轨迹。这意味着针对同一任务,模型不会仅尝试一次回答,而是会生成多条不同的解题路径与行动轨迹,再从中提取强化学习的训练信号。仅1568乘以16就可以产生超过2.5万条Rollout轨迹,而对于智能体(Agent)任务来说,单条Rollout并非简单的一问一答,模型可能需要经历多轮思考、工具调用、环境反馈与行动迭代,因此单次Step的Token总量可以达到数十亿级别。
这套训练系统采用了完全异步的执行模式,打破了传统RL训练的流水线逻辑。传统的RL训练通常是按顺序执行:先生成所有样本,再统一评分,接着训练模型,最后开启下一轮。但大规模智能体RL训练无法忍受这种等待。在MiMo的系统中,不同任务可以同时处于不同阶段:有的智能体正在环境中执行任务,有的已经完成等待评分,有的正在计算奖励值,还有新的任务持续接入系统。生成、执行、评分与训练不再严格排队,而是形成了一套持续运转的异步流水线。
训练环境与执行框架的规模化
第二个规模化方向是训练环境与执行框架的拓展。MiMo-V2.6采用多任务智能体强化学习的训练模式,可以将代码、通用任务、视觉交互、对话等不同类型的任务混合到同一次训练流程中,且这些任务可以运行在不同的执行框架中。举例来说,编程智能体的执行框架允许模型打开终端、修改代码、运行测试、阅读报错信息并持续迭代;而视觉智能体则会面对完全不同的工具、环境反馈与成功判定标准。因此,MiMo的规模化目标不仅是增加任务数量,更是拓展模型能够接触的环境类型、使用的工具种类,以及解决的问题类别。这也是直播页面中专门展示Batch Composition模块的原因:该模块可以直观展示每个训练Step中,模型正在从哪些任务与环境中获取训练经验。
评分环节的算力规模化
第三个规模化方向往往容易被忽略,那就是为评分环节增加算力投入。强化学习依赖奖励信号作为训练依据,但复杂智能体任务的奖励判定远不如数学选择题那样直观。代码类任务可以通过运行测试用例来生成客观反馈:通过100个测试用例的比例就可以作为奖励依据。但对于更开放的智能体任务,仅判断最终成功或失败远远不够,负责评估模型表现的评分系统同样需要消耗大量计算资源。
除此之外,还有一个更加关键的问题:信用分配。假设一个智能体为完成任务执行了40步操作:搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务。如果系统仅告知模型“任务成功,奖励值为1”,这个学习信号其实非常粗糙。模型无法得知在40步操作中,哪些动作真正推动了任务完成,哪些步骤是冗余的,哪一次修改扭转了整体局面,又有哪些动作虽然没有导致失败,但实际并非最优选择。
MiMo在本次训练中重点提及了Agentic In-group Credit Assignment机制,目前尚未公开具体算法细节,但结合“每个Prompt生成16条Rollout轨迹”的训练配置,可以理解其核心目标:利用同组内的多条智能体轨迹及其结果,提取比单纯的最终成败更细致的强化学习信号,以此判定同一组任务尝试中,哪些行为应该获得鼓励、哪些应该被抑制,并将这些判断转化为精准的训练信号。
这三个规模化方向共同构成了一套完整的强化学习训练体系:拓展训练计算量以让模型生成更多训练经验,拓展环境与执行框架以让模型获得多样化的训练场景,增加评分环节的算力投入以从海量经验中提取精准的学习信号。当预训练的规模化路径已经发展多年之后,行业开始思考:能否将智能体与环境交互、生成经验、评价经验、迭代学习的完整RL循环,也打造成一套可以持续扩大规模的标准化流程?
有行业观察者将这套逻辑总结为:三件事的核心都是算力投入。
参考资料
[1] https://mimo.xiaomi.com/rl
[2] https://x.com/_LuoFuli/status/2100296686719610932

