文章摘要
9月下旬小米正式开源MiMo-V2.6系列大模型,包含Pro、Flash、低延迟优化的UltraSpeed等多个版本,该系列不走扩参数路线,核心通过大规模多任务强化学习优化能力,支持多模态输入、百万级上下文窗口,可应用于生产、科研等多领域,目前在连续视频细粒度理解等方面仍存在不足。

9月下旬,小米MiMo研发团队正式开源MiMo-V2.6系列大模型产品矩阵,其中包含两款主力版本与一款针对低延迟场景的优化型号:旗舰级的MiMo-V2.6-Pro、兼顾效率与成本的MiMo-V2.6-Flash,以及可实现20倍输出提速的UltraSpeed版本。

与传统通过扩大参数规模提升模型能力的思路不同,MiMo-V2.6系列将研发重点放在强化学习阶段的计算扩展上,团队将此次迭代描述为探索递归自我改进(RSI)路径的重要尝试:在编程、通用智能体、视觉任务和网络安全等具备可验证结果的复杂场景中加大强化学习投入,让模型通过反复探索、环境反馈和结果评估,持续优化任务完成能力。不过目前该模型的自我改进仍局限在由训练系统、任务环境和评估器组成的闭环训练框架内,尚未实现脱离人工设计框架自主修改架构或启动训练的能力。

两款主力版本均采用稀疏混合专家(MoE)架构,原生支持文本、图像、视频和音频四类模态输入,最长上下文窗口可达100万Token。其中MiMo-V2.6-Pro总参数规模达1.02万亿,单次推理仅激活约420亿参数;MiMo-V2.6-Flash总参数约3090亿,激活参数压缩至150亿,在保证基础能力的同时降低推理成本。两者共享相同的视觉与音频编码器,并搭载五层多Token预测模块用于推测式解码,进一步提升生成效率。UltraSpeed版本的输入和输出单价为普通Pro版本的10倍,但可实现最高20倍的输出提速,主要面向实时交互、编程辅助或其他对响应延迟敏感的工作流。此外,该系列还包含一款基于Qwen架构蒸馏而来的90亿参数小模型,但此次发布的主力产品仍为Pro和Flash两个版本,目前相关平台共收录三款MiMo-V2.6系列模型。

基准测试表现与应用场景

从官方公布的基准测试成绩来看,MiMo-V2.6系列在多个专业评测中表现亮眼。在长程软件工程测试DeepSWE v1.1上,Pro版本拿下71.9分,较上一代V2.5-Pro的19分实现大幅提升,Flash版本也取得67.9分;在Terminal Bench 2.1评测中,两款模型分别获得89.9分和87.6分。通用智能体测试方面,Pro在AutomationBench v1.0.6上以53.1分领先多款竞品模型,Flash版本同样拿到不错的分数;在OSWorld-Verified评测中,两者分别取得82分和80.8分。

不过测试也显示该系列并非在所有项目上都占据优势:Pro在ProgramBench上仅获得26.5分,低于部分竞品;在Terminal Bench 4.0中得分同样落后,在其他多个评测中也未拿到最高分。团队还引用第三方评测结果称,MiMo-V2.6-Pro在相关综合指数评测中拿下高分,是当前得分较高的开源模型之一。

此次发布的系列模型,核心目标是将编程能力拓展到更广泛的生产任务场景中。官方展示了多个实际应用案例:在游戏开发领域,模型可根据文本、图片或视频描述,将开发任务拆解给多个智能体,分别完成3D场景构建、交互逻辑编写和视觉验证,并根据渲染结果反复调整优化,团队将这种由自然语言驱动的交互式世界构建方式命名为“Vibe World”。

在3D建模场景中,模型可直接控制专业设计工具,根据文字描述或参考图片快速生成物体与场景;在具身仿真环境中,模型能够读取多路摄像头画面,通过视觉反馈控制机械臂完成抓取、颜色匹配和物体放置等操作。此外,模型还具备前端页面生成、演示文稿制作、视频剪辑和音乐创作能力。以视频创作为例,MiMo-V2.6可提供端到端的高质量服务,实现从概念到成品的全流程自动化。

团队还公布了两个科研辅助案例:一是材料研究场景,专业人员通过模型完成了吸附特定物质的金属有机框架材料设计,模型协助完成了文献检索、假设提出、模拟计算等环节,筛选出可进入湿实验阶段的候选结构;二是形式化数学证明,在研究人员设计的探索策略和多智能体协作流程下,Pro版本参与完成了经典论文主要定理的形式化验证,最终代码量达标并通过内核验证。需要说明的是,这两个案例均非模型独立完成,仍需要专业人员参与,更多体现了模型作为科研辅助工具的潜力。

大规模强化学习训练细节

MiMo-V2.6系列最核心的提升并非参数规模,而是强化学习训练方式的革新。据团队负责人介绍,此次研发过程堪称一条艰难的强化学习扩展之路,按计算投入衡量,该系列训练很可能是迄今开源模型团队开展的最大规模单次强化学习训练之一。在算力资源仍然紧张的情况下,团队依然投入数十人的资源集中完成此次大规模RL训练。在正式发布前,团队曾公开直播了近6天的大规模RL训练过程,展示了两款模型的训练进度、得分变化和资源消耗情况。

根据最终披露的细节,Pro和Flash分别在不到6天的时间内完成了30轮强化学习步骤,每款模型处理约75万条智能体轨迹,整体训练总成本约347万美元,其中Flash版本约85万美元,Pro版本约262万美元。每一轮训练批次包含1568个提示任务,每个任务生成16条候选解法,单步处理约35亿至37亿Token,训练上下文最高支持100万Token。与传统针对单一任务开展独立强化学习不同,此次训练混合了编程、通用智能体、视觉和网络安全等多类任务,希望不同任务场景下形成的策略能够实现迁移。

在奖励机制设计上,团队没有采用传统的二元胜负奖励,而是引入组内比较机制:让评估智能体对同一任务的多条解法进行横向对比,不仅区分任务是否完成,还会根据路径长度、Token消耗、执行质量等维度进一步划分等级,为更优质的解法分配更高奖励。这套设计旨在解决长程智能体训练中的痛点:两条轨迹可能都通过测试,但在执行效率、合理性和稳定性上存在明显差异,仅靠最终结果无法体现这种区别。

为了避免奖励作弊,训练中加入了环境加固、异常检测、多验证器交叉检查等机制,同时冻结了MoE模型的路由器参数,减少大规模训练过程中专家选择策略的漂移。官方数据显示,经过30轮训练后,两款模型在训练任务和未直接参与训练的测试场景中均实现了明显的性能提升,证明强化学习带来的能力提升可以迁移到训练分布之外的场景。团队同时开放了技术报告、训练环境和强化学习代码,相比仅发布模型权重,外界可以更深入地检查其训练细节,但最终结果能否被独立复现仍有待后续验证。

技术实现的核心改进

从技术实现来看,MiMo-V2.6的性能提升并非依赖单点创新,而是多环节协同优化的结果。在模型架构层面,两款版本采用了混合注意力设计,平衡了长上下文处理的计算成本与信息整合能力,更适合代码仓库和长程智能体轨迹处理。视觉编码器也采用了类似思路,官方披露该编码器使用超过4万亿图像Token进行预训练。音频处理方面则通过合并帧序列缩短整体输入长度,实现了原生全模态处理能力。

预训练环节采用两阶段模式,先完成语言模型主干训练,再接入多模态编码器联合训练。不同版本的预训练数据规模各有侧重,团队还增加了面向智能体的中期训练阶段,让模型提前熟悉任务模式,避免强化学习初期的无效轨迹消耗。此外,中期训练阶段还优化了优化器和量化训练策略,提升训练效率和推理质量。

强化学习的规模扩张是性能提升的直接来源,每一轮训练会生成大量智能体轨迹,覆盖完整的长程任务流程。团队不仅投入算力让模型完成任务,还重点投入资源评估不同解法的优劣,确保训练的有效性。奖励机制的精细化设计进一步提升了模型的任务完成质量,避免了传统二元奖励的局限性。同时,混合多任务训练和多框架测试,让模型具备了更强的泛化能力,避免过拟合单一执行流程。

针对大规模MoE模型强化学习中容易出现的专家负载失衡问题,团队采取了冻结路由器参数的措施,保证了大规模训练的稳定性。对于开放任务场景,团队还通过蒸馏技术补全了缺乏明确评估标准的任务能力,进一步拓展了模型的应用边界。

实际测试表现与不足

为了直观了解MiMo-V2.6-Pro的实际表现,测试团队开展了多轮多模态测试,覆盖图像识别与OCR、视频时序理解、音频转写与全模态长任务等方向,重点考察模型的信息整合和推理能力。

第一项测试针对图片理解能力,团队上传了一张包含较多信息的PPT照片,要求模型完成信息提取、空间关系描述、核心结论总结和易误读细节识别。模型准确提取了关键信息,正确描述了图表与文字的空间对应关系,总结出核心观点,并准确指出了多处易被误解的细节,整体表现符合辅助处理图片材料的需求,未出现明显幻觉。

第二项测试聚焦视频理解能力,团队上传了一段机器人炒菜视频,要求识别食材厨具、操作细节、异常情况并总结完成度。模型准确识别出大部分场景元素,正确描述了基础动作,但在关键动作上出现了明显幻觉,虚构了不存在的操作,并生成了对应的时间戳;同时未按要求区分可确认事实与合理推断,也未完成完整的任务追踪。相比静态图片,模型在连续视频的物体追踪和时序理解上稳定性不足。

第三项测试考察跨模态信息对齐与核验能力,团队上传了一段带有解说的篮球比赛视频,要求核对画面、解说和比分信息的一致性。模型准确将比赛中的投篮动作、解说内容和比分变化对应起来,正确区分了可确认事实与无法确认的信息,仅存在少量细节误差,整体在多重信息印证任务中的表现优于单纯的连续动作追踪。

综合来看,MiMo-V2.6-Pro对静态图片的文字识别、图表理解,以及有明确证据支撑的跨模态核验表现稳定,能够主动区分事实、推断和无法确认的信息,但在连续视频的细粒度动作追踪上仍有明显短板,容易虚构不存在的细节,多模态能力距离稳定可靠仍有一定差距。

以上内容不代表本平台立场,仅供读者参考