小米发布并开源MiMo-V2.6系列大模型,太顶了

2026年9月22日,小米正式发布并开源MiMo-V2.6系列大模型,包含万亿参数旗舰Pro版和高效推理Flash版,均支持文本、图像、音频、视频四模态输入与100万token上下文。Pro版在Artificial Analysis智能指数中以46分登顶全球开源模型榜首。本文将从小米发布并开源MiMo-V2.6系列大模型的技小米发布并开术架构、训练方法论、竞品对比、应用场景等维度展开深度分析。

一、小米发布并开源MiMo-V2.6系列大模型,到底发布了什么?
2026年9月22日凌晨,小米正式发布并开源了全新一代MiMo大模型——Xiaomi MiMo-V2.6系列。这一系列包含两款原生全模态模型:面向复杂编程和Agent任务的全模态旗舰模型MiMo-V2.6-Pro,以及强调性能、效率与成本平衡的高效推理模型MiMo-V2.6-Flash。
同步上线的还有MiMo-V2.6-Pro的超高速模式V2.6-Pro-UltraSpeed,官方称其在保持模型质量的前提下,输出速度最高可达Pro版本的20倍。此外,MiMo Desktop桌面客户端正式版也一并推出,标志着小米在大模型领域的布局从云端延伸到桌面端。
值得注意的是,小米此次不仅开源了模型权重,还同步开放了技术报告、RL训练代码和超过7000个任务环境,以及MiMo-V2.6-Distill-Qwen-9B蒸馏起点模型。这种“全栈式开源”的做法,在国产大模型中并不常见。
1.1 为什么说这次发布是小米大模型战略的关键转折?
小米大模型Core团队由雷军于2023年推动成立。从2025年首次公开MiMo系列,到2026年初的V2.5版本,再到如今的V2.6,小米在大模型领域的迭代速度明显加快。但V2.6的发布与之前几代有着本质区别。
此前小米的大模型发布更多集中在“能力展示”层面——跑分好看、参数亮眼。而V2.6的发布,透露出一个更深层的战略意图:小米正在用强化学习(RL)的规模化扩展,来验证一条“让模型在真实环境中自我进化”的技术路径。小米将其定义为探索RSI(递归自我改进)路径的关键一步。这不再仅仅是一次模型迭代,而是一次关于“模型如何变得更聪明”的方法论实验。
二、MiMo-V2.6系列技术架构深度拆解
2.1 Pro与Flash:一大一小的精妙分工
MiMo-V2.6系列的两款模型采用了截然不同但互补的架构设计。
MiMo-V2.6-Pro采用稀疏混合专家(MoE)架构,总参数量达到约1.02万亿,每个token激活约420亿参数。这种“大总量、小激活”的设计,让Pro版在保持万亿级知识容量的同时,将实际推理计算量控制在一个可接受的范围内。
MiMo-V2.6-Flash则是一个更轻量的选择。它同样基于MoE架构,总参数量3090亿,每个token激活150亿参数。Flash的主干网络为48层,其中39层采用滑动窗口注意力机制,9层为全局注意力,隐藏层维度为4096,配备256个路由专家、每次激活8个,滑动窗口大小为128个token,不设共享专家。这套配置的核心思路是:用有限的算力做更多的事。
两款模型均支持100万token的上下文窗口,约相当于1500页A4纸的内容量,并原生支持文本、图像、音频、视频四种模态的输入。
2.2 混合注意力机制:效率与能力的平衡术
Flash版本的混合注意力设计值得深入分析。39层滑动窗口加9层全局注意力的组合,意味着模型在处理长文本时,大部分层只需要关注局部上下文,只有少数层负责全局信息的整合。这种设计在长文档理解和多轮对话场景中,能显著降低计算开销,同时保持对关键全局信息的捕捉能力。
对于需要在边缘设备或私有化环境中部署的团队来说,Flash的架构意味着更低的显存占用和更快的推理速度。而Pro版本则面向对智能水平有极致要求的场景,适合云端部署或高性能服务器环境。
2.3 全模态能力的实际意义
“原生全模态”这个词在2026年已经不算新鲜,但MiMo-V2.6的实现方式有其独特之处。不同于将多个独立模型拼接的方案,MiMo-V2.6从一开始就在统一架构下训练多模态输入的理解能力。这意味着模型在处理图文混合、视频理解、语音指令等跨模态任务时,不会出现“模态切换”带来的信息损失。
三、用强化学习“喂养”智能:MiMo-V2.6的训练哲学
3.1 六天,75万条轨迹,347万美元
MiMo-V2.6最引人注目的训练细节,是小米将整个RL训练过程进行了公开直播。从训练进度、成本变化到任务通过率,外界可以近乎实时地观察两个模型如何在30个RL step中逐渐提升能力。
具体数据如下:Pro与Flash的训练历时不到6天,成本分别约为262万美元和85万美元,合计约347万美元。各完成30个RL step,累计约75万条轨迹。单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达35亿至37亿。训练任务平均通过率分别相对提升25%(Flash)和12%(Pro)。
这些数字背后反映的是一个核心判断:RL的规模化扩展,可能比单纯增大预训练参数量更能提升模型的实际能力。
3.2 7000+环境:让模型在“真实世界”中学习
传统的大模型训练往往依赖静态数据集。而MiMo-V2.6的RL训练构建了一个覆盖Code、General、Visual、Cyber等多个方向的复杂任务体系,开放了超过7000个分级任务环境,涵盖软件工程、漏洞复现、知识工作和网页设计等领域。
这意味着模型不是在“背题”,而是在“做题”——面对真实或接近真实的任务场景,通过反复试错来学习。小米在技术文档中写道:“在一个智能容易被复制的时代,我们选择把算力投进真实环境,让模型在反馈中一次次试错、自己学会。”
3.3 Grader算力的扩展:一个容易被忽视的创新
小米在训练中专门扩展了“Grader算力”,通过Group内的相对比较为长程RL任务提供更精准的奖励信号。这个技术细节的重要性容易被忽略,但它实际上解决了一个RL训练中的核心难题:对于需要多步推理才能完成的任务,如何判断中间步骤的对错?
传统的二元奖励(对/错)在长程任务中信号过于稀疏。通过Group内相对比较,模型可以在同组任务之间进行横向对比,从而获得更丰富的梯度信息。这种方法让模型在DeepSWE v1.1上的表现从48.8分跃升至65.7分(Pro版),提升幅度约17分。
四、性能实测:MiMo-V2.6到底有多强?
4.1 核心基准测试横向对比
以下是MiMo-V2.6系列与同期主流模型的基准测试对比(数据来自小米官方技术文档及第三方评测):
| 基准测试 | MiMo-V2.6 Pro | MiMo-V2.6 Flash | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|---|---|
| AA智能指数 | 46 | — | 26 | 53 | 53 | 53 |
| DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | — |
| AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |
| Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |
| Agents‘ Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |
| OSWorld-Verified | 82.0 | 80.8 | 61.5 | 83.4 | 83.0 | 86.0 |
从表格中可以清晰看到,MiMo-V2.6-Pro在多项Agent基准上已经接近甚至追平Claude Opus 5和GPT-5.6 Sol这类顶级闭源模型。特别是在Terminal Bench 2.1上,Pro版以89.9分略微领先Claude Opus 5的89.1分。而在Toolathlon-Verified上,76.9分的成绩超过了GPT-5.6 Sol的74.9分。
但也要客观看待差距。在ProgramBench上,Pro版26.5分与Claude Opus 5的37.0分仍有明显距离。在MiMo Visual Coding评测中,Pro版72.3分虽然高于DeepSeek V4.1 Flash和Claude Opus 5,但与GPT-6 Astra的82.2分差距不小。
4.2 与前代相比的跨越式进步
MiMo-V2.6-Pro相比V2.5-Pro的提升幅度令人印象深刻。AA智能指数从26分跃升至46分,提升20分。DeepSWE v1.1从19.0分提升至71.9分,涨幅接近3.8倍。AutomationBench从16.0分提升至53.1分,增长超过3倍。
这种幅度的提升,在模型迭代中并不常见。它说明小米在RL训练方法论上的投入,确实带来了实质性的能力增长,而不是简单的“参数堆砌”或“数据灌入”。
4.3 国产开源模型中的定位
在国产开源模型的竞争格局中,MiMo-V2.6-Pro的46分AA指数超过了Kimi K3(44分)和GLM-5.3(45分),成为当前AA指数上排名最高的开源权重模型。在Coding Agent任务上,MiMo-V2.6-Pro在开源模型中位列第三,仅次于GLM-5.3和Qwen 3.8 Max。
但与DeepSeek V4.1 Flash(39分)和DeepSeek V4.1 Pro(36分)相比,MiMo-V2.6-Pro在AA指数上具有明显优势。这说明小米在大模型竞技中已经进入第一梯队。
五、开源策略:MIT协议+全栈开放意味着什么?
5.1 真正“无门槛”的开源
MiMo-V2.6系列延续了V2.5系列的MIT开源协议。这意味着开发者可以自由地进行商业推理部署、微调、二次训练和再分发,没有营收门槛,也没有研究条款限制。
对于一个总参数量达万亿级别的模型来说,采用MIT协议需要相当大的决心。因为这意味着任何人都可以下载权重,在自己的硬件上运行,甚至基于它构建商业产品,而无需向小米支付任何费用。
从Hugging Face上的仓库来看,小米开放的内容包括:Pro和Flash的完整模型权重、技术文档、基于verl框架的端到端RL训练代码、7000+分级任务环境、MiMo-V2.6-Distill-Qwen-9B蒸馏起点模型,以及支持多harness训练的轻量级harness组件。
5.2 API定价的“斩杀线”策略
对于不便自行部署的用户,小米提供了API调用方案。MiMo-V2.6系列沿用V2.5系列的API定价,Pro版缓存输入每百万Token仅0.025元,Flash版为0.02元。海外API定价为Pro版每百万输入Token 0.435美元、输出0.87美元;Flash版每百万输入Token 0.14美元、输出0.28美元。
作为对比,MiMo-V2.6-Pro在同等智能水平下,价格仅为海外模型的1/20至1/60。根据Artificial Analysis的测算,MiMo-V2.6-Pro每完成一个智能指数任务的成本仅为0.13美元。
这种定价策略的意图很明确:通过极低的使用成本,吸引开发者将MiMo-V2.6作为默认的模型选择。
5.3 开源全栈的行业影响
小米此次开源的不只是模型本身,而是整个训练和部署的工具链。7000+任务环境和RL训练代码的开放,意味着研究团队可以基于MiMo-V2.6的训练框架,去训练自己的模型或探索新的RL方法。
这种做法在国产大模型中尚属首次。它降低了RL研究的门槛,也可能加速整个行业在RL训练方法论上的迭代。对于学术界和中小型研究团队来说,这是一个难得的研究资源。
六、从手机到机械臂:MiMo-V2.6的应用场景
6.1 端侧部署:小米的“主场优势”
小米做端侧大模型有一个天然优势——它拥有庞大的终端设备生态。2026年7月,小米MiMo端侧模型正式通过网信部门备案,成为首批获得国家认可、可在手机端侧合规部署的生成式AI模型之一。
在硬件层面,小米18 Fold折叠屏旗舰手机已确认搭载Xiaomi MiMo端侧大模型。小米玄戒O100原型机内置MiMo端侧模型后,实测推理速度可达每秒295 Tokens。
这意味着MiMo-V2.6的能力不只停留在云端API,而是可以真正下沉到用户的手机、平板甚至IoT设备中。离线运行、隐私保护、低延迟响应——这些端侧AI的核心价值,正是小米最擅长的领域。
6.2 3D空间推理与具身智能
MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作能力。在游戏开发场景中,用户输入图片、视频或文字后,模型可以将需求拆解为多个任务,由多智能体协作完成3D场景搭建、交互逻辑编写与视觉验证。
更具前瞻性的是具身仿真应用。MiMo-V2.6可以直接以多视角相机画面为输入,通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。这意味着模型不仅能“看懂”世界,还能“操作”世界。
在Blender中,MiMo-V2.6能够根据用户的文字描述或参考图片完成物体与场景的三维建模,生成可用于动画制作、3D打印与游戏开发的3D资产。
6.3 智能体与代码开发
Coding Agent是MiMo-V2.6重点优化的方向之一。Pro版在DeepSWE v1.1上71.9分的成绩,意味着它能够处理复杂的软件工程任务,包括多文件代码生成、调试和重构。结合MiMo Desktop桌面客户端,开发者可以将MiMo-V2.6作为日常编程的AI助手使用。
在通用Agent方面,Pro版在Toolathlon-Verified上76.9分的表现,表明模型在工具调用、多步骤任务规划等场景中具备较强的实用性。
七、安全与合规:开源模型的“红线”问题
7.1 端侧合规的先行者
小米MiMo端侧模型已通过国家网信部门备案,这意味着它在数据安全、内容合规等方面满足了监管要求。小米miclaw端侧智能助手也通过了中国信通院首批手机端智能助手评测,在合规对齐方面符合《智能助手基准测试通用框架》规范要求。
7.2 安全防护体系
小米构建了覆盖输入-生成-输出全链路的安全防控体系,包括Prompt注入防御、越狱攻击防护、安全审核、红蓝对抗等核心能力。在数据保护方面,小米采用“授权优先、同等防御、端到不留痕、安全链路”四项原则,用户数据主体请求响应时效统一缩短至15日。
对于开源模型而言,安全是一个复杂的问题。模型权重一旦公开,安全对齐的效果就取决于使用者的部署方式。小米的做法是在端侧产品中内置安全防护,同时通过开源协议鼓励社区在安全框架内进行二次开发。
八、行业视角:这次发布意味着什么?
8.1 开源与闭源的差距在缩小
MiMo-V2.6-Pro的AA指数46分,与Claude Fable 5.1和GPT-6 Astra的53分相比仍有7分差距。但这个差距正在以肉眼可见的速度缩小。一年前,开源模型与闭源旗舰之间的AA指数差距普遍在15分以上,如今已经压缩到个位数。
考虑到MiMo-V2.6-Pro是MIT协议完全开源的,而Claude Fable 5.1是闭源商业模型,这7分的差距是否值得付出数十倍的成本?对于许多应用场景来说,答案可能是否定的。
8.2 RL规模化:新的技术竞争焦点
MiMo-V2.6的核心方法论——规模化扩展RL算力——正在成为行业共识。小米在RL训练阶段投入的算力规模,可能是目前国产开源模型中最多的之一。Pro与Flash合计约347万美元的训练成本,大部分花在了RL阶段而非预训练阶段。
这释放了一个信号:在大模型预训练边际收益递减的背景下,RL训练可能成为下一阶段能力提升的主要驱动力。谁能更高效地进行RL规模化扩展,谁就可能在下一次模型迭代中占据先机。
8.3 小米的独特定位
小米在大模型赛道中的定位正在变得清晰。它不像DeepSeek那样追求纯粹的模型能力前沿,也不像部分厂商那样将大模型作为云服务产品。小米的路径是:用开源模型建立技术影响力,用端侧部署打通硬件生态,用极低的API价格吸引开发者。
这三者之间形成了一个飞轮:开源带来开发者关注,开发者使用产生反馈,反馈改进模型能力,更强的模型吸引更多硬件用户。这个飞轮能否转起来,将决定小米在大模型领域的长期竞争力。
九、FAQ:关于MiMo-V2.6的常见问题
Q1:MiMo-V2.6系列包含哪些模型?
A:包含两款核心模型——全模态旗舰MiMo-V2.6-Pro(1.02万亿总参数/420亿激活)和高效推理MiMo-V2.6-Flash(3090亿总参数/150亿激活),以及Pro的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端。
Q2:MiMo-V2.6是免费的吗?
A:模型权重采用MIT协议开源,可免费下载、商用部署、微调和二次训练,无需额外授权。API调用为付费服务,但定价极低:Flash版缓存输入每百万Token仅0.02元。
Q3:MiMo-V2.6支持哪些输入类型?
A:支持文本、图像、音频、视频四种模态的原生输入,输出为文本。上下文窗口为100万Token。
Q4:MiMo-V2.6-Pro和Flash的主要区别是什么?
A:Pro追求极致智能水平,适合复杂编程、Agent任务和专业场景;Flash强调性能与成本的平衡,适合高吞吐量生产环境。Flash全面超越了前代V2.5-Pro的能力水平。
Q5:普通人能用MiMo-V2.6做什么?
A:可以通过MiMo Desktop桌面客户端体验;小米18 Fold等搭载端侧MiMo模型的手机用户可享受离线AI能力;开发者可通过API或自行部署,构建智能体、代码助手、3D建模等应用。
Q6:MiMo-V2.6和DeepSeek、Qwen相比如何?
A:在AA智能指数上,MiMo-V2.6-Pro的46分高于DeepSeek V4.1 Flash(39分)和V4.1 Pro(36分),也高于Kimi K3(44分)和GLM-5.3(45分),是当前AA指数最高的开源模型。在Coding Agent领域位列开源模型第三,仅次于GLM-5.3和Qwen 3.8 Max。
十、写在最后
小米发布并开源MiMo-V2.6系列大模型,不只是一次产品迭代,更是对“开源大模型能走多远”这个问题的有力回应。46分的AA智能指数、万亿参数的MoE架构、六天75万条轨迹的RL训练、MIT协议的完全开放——这些数字和选择叠加在一起,构成了一个清晰的信号:开源模型的竞争力正在从“能用”向“好用”甚至“领先”快速演进。
当然,挑战同样存在。万亿参数模型的部署成本依然高昂,端侧推理的实际体验有待大规模验证,与顶级闭源模型的差距需要持续缩小。小米选择了一条更难但更有想象力的路:把训练过程公开、把权重开放、把工具链交出。这种“全栈式开源”的策略能否真正建立起开发者生态,将是未来一年最值得关注的变量。

