文章摘要
小米旗下MiMo团队近半年专注攻坚探索强化学习的扩展极限,目前MiMo-V2.6版本正处于强化学习训练关键阶段,已从计算规模、多任务环境执行框架、评分模块三个维度做扩展优化,团队称未来几周将开源相关技术细节,当前训练过程可通过公开渠道实时观看。

相关团队近期透露,其所属的MiMo项目组已有近半年未对外公布进展,这段时间团队将全部精力投入到一项核心研究中:探索强化学习技术的扩展边界究竟能达到何种程度。

目前,该团队研发的MiMo-V2.6版本正处于强化学习训练的关键阶段。

据介绍,本次版本的训练升级主要从三个核心维度进行了扩展优化:

首先是计算规模层面,每个训练步骤能够处理约20亿Token数据,具体配置为1568个Prompt,每个Prompt对应16次Rollout操作,并且全程采用完全异步的运行模式,最大化提升训练效率。

其次是环境与执行框架体系,团队采用了多任务智能体强化学习方案,并且支持在同一次训练运行过程中混合使用多种不同的Harness/执行框架,大幅提升了训练的灵活性与适配性。

最后是评分器计算模块,团队引入了智能体式的组内信用分配机制,同时结合基于测试用例和标准化评分规则的奖励体系,让训练过程中的反馈更加精准有效。

该团队还表示,未来几周内会逐步将本次升级的相关技术细节对外开源,供行业参考使用。

值得关注的是,当前MiMo-V2.6的强化学习训练过程正在进行实时直播,相关内容可通过公开渠道查看。

以上内容不代表本平台立场,仅供读者参考