小米MiMo-V2.6系列大模型发布并开源 刷新国产模型性价比纪录

近日,研发团队正式推出并开源MiMo-V2.6系列大模型,这是探索递归自我改进(RSI)路径的重要里程碑。项目以可验证的复杂任务为基础,通过规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。
核心发布与性能表现
该系列包含Pro和Flash两款原生全模态模型,依托强化学习算力的全面升级,MiMo-V2.6-Pro在AA综合智能指数中斩获46分,性能超越Kimi K3与Qwen3.8 Max,成为目前综合表现领先的开源模型,不过相较于Claude Fable 5.1和GPT-6 Astra这类顶级闭源模型,仍存在一定提升空间。
该系列模型延续了V2.5版本的API定价策略,实现了智能水平提升但成本不变,进一步拓展了“智能-成本”的帕累托最优边界。其中MiMo-V2.6-Pro创下国产大模型性价比新纪录,在智能水平相当的前提下,使用成本仅为海外同类模型的1/20到1/60。
规模化强化学习训练突破
本次强化学习训练阶段,MiMo-V2.6系列是目前国产开源模型中算力投入规模领先的项目之一。经过大规模多任务RL训练后,MiMo-V2.6-Pro在多数智能体基准测试中取得了比肩Claude Opus5和GPT-5.6 Sol的表现,而MiMo-V2.6-Flash则全面超越了上一代的V2.5-Pro版本。
整个训练过程中,研发团队攻克了RL训练中的基础研究与工程化难题,并通过直播形式公开了实验历程。整个训练仅用了不到6天时间,MiMo-V2.6-Flash与MiMo-V2.6-Pro的训练成本分别约85万美元与262万美元,各自完成了30轮训练迭代,累计生成约75万条智能体交互轨迹。训练任务的平均通过率分别相对提升25%和12%,在样本外的长程软件工程评测基准DeepSWE v1.1中,两款模型分别提升约17分(从48.8提升至65.68)和14分(从58.4提升至72.57),充分展现了RL训练较高的样本效率、持续改进能力以及跨场景泛化能力。
本次训练主要从三个维度实现了RL算力的规模化扩展:
- 更大的Batch与更高吞吐:结合大Batch与全异步架构,单次参数更新使用1568个训练样本,支持1M长度的上下文训练,单步训练Token量达到27亿到37亿。
- 更多任务与复杂环境:构建覆盖代码开发、通用任务、视觉交互、网络安全等方向的多任务训练体系,并混合多个训练框架,促进模型不同能力维度的协同提升。
- 更大的Grader算力:通过组内相对比较机制,为长周期RL任务提供更精准、多样化的奖励信号,形成模型自我改进的闭环,同时引导模型以更短路径、更少Token消耗完成任务。
随着训练规模扩大,团队还针对性优化了训练稳定性:通过冻结MoE Router模块抑制专家负载漂移,并建立覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的Reward Hacking防线,提升训练过程的稳定性与奖励信号的可靠性。
为支撑大规模混合任务的智能体强化学习,团队还设计了统一的轨迹表示与惩罚机制来细化学习信号,支持多种智能体框架的高并发交互,解耦控制面与数据面以实现海量轨迹的高效迁移,在混合批次训练中稳定各任务的样本配比,并优化训练与推理引擎的效率与一致性。目前,团队已开源上述技术成果与配套资源,帮助更多研究者复现和验证相关实验结果,共同探索规模化RL与模型自我改进的更多可能性。
多模态能力与交互场景
MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作(CUA)能力,进一步拓展了编程所能触及的边界,将自然语言驱动的编程任务拓展为面向交互世界构建的“Vibe World”。
3D开放世界游戏开发:用户只需输入图片、视频或文字描述,MiMo-V2.6就能将需求拆解为多个子任务,通过多智能体协作完成游戏3D场景搭建、交互逻辑编写与视觉验证,并根据渲染结果持续修正,最终生成符合用户意图的可运行交互世界。
Blender 3D建模:该模型能够根据用户的文字描述或参考图片,自动完成物体与场景的三维建模,生成可用于动画制作、3D打印与游戏开发的专业3D资产。
具身智能:MiMo-V2.6可以直接以多视角相机画面为输入,持续进行推理与决策,并通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置等复杂操作。
计算机操作智能体:MiMo-V2.6进一步拓展了原生能力,将多模态感知与训练得到的行动能力深度结合。它可以理解复杂的图形界面,使用常见办公与生产力工具,完成信息检索、文档编辑和数据处理等任务,并根据视觉反馈检查结果、排查问题、调整后续行动方案。
科研与内容创作赋能
在未经过针对科研任务的专项强化学习训练的前提下,MiMo-V2.6已经在多个研究领域展现出应用潜力。从材料设计到数学形式化,该模型能够将推理、编程与工具使用能力结合,赋能具体科研任务。
材料科研辅助:MiMo-V2.6-Pro可以协助研究人员完成材料设计与计算筛选。在前沿材料研究团队的交互提示下,它能够提出数种金属有机框架(MOF)材料的设计方案,目标是吸附被称为“永久性污染物”的全氟和多氟烷基物质(PFAS)。在这个过程中,模型会检索并梳理相关文献与专利,提出研究假设,并评估设计方案的新颖性。随后,它还能开展“干实验”——调用开源计算工具自动搭建模拟环境,计算设计出的MOF材料与PFAS之间的结合强度,从中筛选出最有潜力的候选材料,以供后续“湿实验”验证。
形式化数学证明:MiMo-V2.6-Pro还协助研究员在Lean 4中完成了Li–Yorke经典论文《周期三蕴含混沌》原始主定理的完整形式化。该定理揭示:对于连续的区间自映射,一个三周期轨道的存在,就足以推出所有正整数周期的轨道,以及一个不可数的混沌集。在研究员设计的探索策略引导下,MiMo-V2.6-Pro通过Subagent协作推进了定理叙述与证明的形式化。经后续修订与整合,项目最终形成了6000余行Lean源码,完整证明通过Lean内核核验,无未完成证明占位。值得一提的是,模型未接受过针对Lean的专项后训练,这一案例充分展示了其参与复杂形式化证明任务的能力。
在内容创作与审美表现方面,MiMo-V2.6系列大幅提升了模型创建精美数字产品的能力,涵盖前端网页、Figma设计稿、幻灯片、SVG、视频、音乐等多个领域。在设计评测榜单Design Arena上,MiMo-V2.6-Pro取得了与Claude Opus 5、GPT-5.6 Sol相近的水平。
前端与PPT审美表现:该模型可以将简单的指令转化为完整的前端界面和PPT演示文稿,自动生成结构化的布局并精心设计美观的组件、交互元素和丰富的动画效果。同时,它还能熟练运用Figma和图像/视频生成工具,制作符合整体风格的视觉素材,在字体、配色和图文编排上保持协调,兼顾审美表现与阅读、交互体验。
视频创作:MiMo-V2.6能够端到端完成高质量视频创作。在创意与产品宣传视频中,它可根据用户需求完成视觉设计、镜头与动效编排、配乐合成及节奏卡点;在科普视频中,它能将傅里叶分解、凸包等抽象概念转化为通俗解说与连贯动画,并调用配套的语音合成工具生成旁白,与画面精准对齐,从而将复杂知识转化为观众可轻松理解的生动内容,实现从概念拆解到成片输出的全流程自动化。
音乐创作:在MiMo-V2.6中,团队进一步强化了模型的音乐理解、审美判断与知识运用能力,探索模型在音乐创作中的应用。它已展现出创作Demo级音乐作品的能力,以及辅助专业作曲与编曲人员开展创作的潜力。例如,MiMo-V2.6-Pro可以根据要求创作一首包含约十种乐器的管弦乐作品,完成乐谱生成后,还能自主将其转换为MIDI格式。作品体现了模型对不同乐器分工与配器关系的理解,也展示了它将音乐知识用于旋律创作和整体编排的能力。
使用方式与开源生态
随着新模型发布,配套的桌面客户端及会员订阅方案同步上线,用户可以通过官方渠道下载体验。订阅会员即可使用MiMo-V2.6-Pro和Flash模型,也可以配置自己的API Key使用客户端。MiMo Desktop客户端还同步上线了MiMo-V2.6-Pro的UltraSpeed超高速模式,提供最高20倍的输出速度,满足强实时交互与对响应速度敏感的场景。需要注意的是,原邀测活动将在1周后结束,已获得邀测资格的用户切换模型名称后方可继续使用。
同时,MiMo-V2.6系列已上线开放平台,API价格维持不变。MiMo-V2.6-Pro同样在开放平台提供UltraSpeed超高速模式可选。
研发团队全面开源了MiMo-V2.6-Pro、Flash模型权重与技术报告,同步开放MiMo-V2.6-Distill-Qwen-9B及配套RL研究资源,分享经过验证的训练实践,具体开源内容包括:
- 7000+高质量RL任务环境:覆盖软件工程、漏洞复现、知识型工作、网页设计开发四类智能体任务。以MiMo-V2.6-Distill-Qwen-9B为起点展开RL训练,在11项评测中均较SFT基线取得提升:SWE-bench Verified从61.1提升至66.2,MiMo Cyber Bench从31.3提升至47.0,Terminal Bench 2.1从37.1提升至52.8,MiMo Visual Coding从64.0提升至72.4;
- 端到端RL训练框架:基于verl、uni-agent和mini-swe-agent,覆盖环境交互、轨迹采集、奖励评估与策略优化的完整训练流程。结合开放的模型与任务环境,支持社区围绕训练算法、奖励机制和Agent Harness开展研究与迭代;
- 轻量可组合的Harness:开源极简mini-harnesses,将系统提示、工具与上下文管理解耦,构建多样且可控的训练配置。通过Multi-Harness Training,能够将多样性和整洁性纳入RL训练,提升模型在不同框架、包括未见框架上的泛化能力,支持社区自由组合框架组件、拓展训练配置,持续探索新的研究方向。
研发团队希望这次开源分享能为社区持续探索强化学习算法与智能体机制提供共同基础,推动Agentic RL研究不断向前发展。

