文章摘要
2026年9月22日,小米正式发布并开源MiMo-V2.6系列大模型,包含万亿参数旗舰Pro版与高效推理Flash版,两款均支持文本、图像等四模态输入,支持100万token上下文。

2026年9月22日,小米正式发布并开源MiMo-V2.6系列大模型,包含万亿参数旗舰Pro版和高效推理Flash版,均支持文本、图像、音频、视频四模态输入与100万token上下文。Pro版在Artificial Analysis智能指数中以46分登顶全球开源模型榜首。本文将从小米发布并开源MiMo-V2.6系列大模型的技小米发布并开术架构、训练方法论、竞品对比、应用场景等维度展开深度分析。

小米发布并开源MiMo-V2.6系列大模型

一、小米发布并开源MiMo-V2.6系列大模型,到底发布了什么?

2026年9月22日凌晨,小米正式发布并开源了全新一代MiMo大模型——Xiaomi MiMo-V2.6系列。这一系列包含两款原生全模态模型:面向复杂编程和Agent任务的全模态旗舰模型MiMo-V2.6-Pro,以及强调性能、效率与成本平衡的高效推理模型MiMo-V2.6-Flash。

同步上线的还有MiMo-V2.6-Pro的超高速模式V2.6-Pro-UltraSpeed,官方称其在保持模型质量的前提下,输出速度最高可达Pro版本的20倍。此外,MiMo Desktop桌面客户端正式版也一并推出,标志着小米在大模型领域的布局从云端延伸到桌面端。

值得注意的是,小米此次不仅开源了模型权重,还同步开放了技术报告、RL训练代码和超过7000个任务环境,以及MiMo-V2.6-Distill-Qwen-9B蒸馏起点模型。这种“全栈式开源”的做法,在国产大模型中并不常见。

1.1 为什么说这次发布是小米大模型战略的关键转折?

小米大模型Core团队由雷军于2023年推动成立。从2025年首次公开MiMo系列,到2026年初的V2.5版本,再到如今的V2.6,小米在大模型领域的迭代速度明显加快。但V2.6的发布与之前几代有着本质区别。

此前小米的大模型发布更多集中在“能力展示”层面——跑分好看、参数亮眼。而V2.6的发布,透露出一个更深层的战略意图:小米正在用强化学习(RL)的规模化扩展,来验证一条“让模型在真实环境中自我进化”的技术路径。小米将其定义为探索RSI(递归自我改进)路径的关键一步。这不再仅仅是一次模型迭代,而是一次关于“模型如何变得更聪明”的方法论实验。

二、MiMo-V2.6系列技术架构深度拆解

2.1 Pro与Flash:一大一小的精妙分工

MiMo-V2.6系列的两款模型采用了截然不同但互补的架构设计。

MiMo-V2.6-Pro采用稀疏混合专家(MoE)架构,总参数量达到约1.02万亿,每个token激活约420亿参数。这种“大总量、小激活”的设计,让Pro版在保持万亿级知识容量的同时,将实际推理计算量控制在一个可接受的范围内。

MiMo-V2.6-Flash则是一个更轻量的选择。它同样基于MoE架构,总参数量3090亿,每个token激活150亿参数。Flash的主干网络为48层,其中39层采用滑动窗口注意力机制,9层为全局注意力,隐藏层维度为4096,配备256个路由专家、每次激活8个,滑动窗口大小为128个token,不设共享专家。这套配置的核心思路是:用有限的算力做更多的事。

两款模型均支持100万token的上下文窗口,约相当于1500页A4纸的内容量,并原生支持文本、图像、音频、视频四种模态的输入。

2.2 混合注意力机制:效率与能力的平衡术

Flash版本的混合注意力设计值得深入分析。39层滑动窗口加9层全局注意力的组合,意味着模型在处理长文本时,大部分层只需要关注局部上下文,只有少数层负责全局信息的整合。这种设计在长文档理解和多轮对话场景中,能显著降低计算开销,同时保持对关键全局信息的捕捉能力。

对于需要在边缘设备或私有化环境中部署的团队来说,Flash的架构意味着更低的显存占用和更快的推理速度。而Pro版本则面向对智能水平有极致要求的场景,适合云端部署或高性能服务器环境。

2.3 全模态能力的实际意义

“原生全模态”这个词在2026年已经不算新鲜,但MiMo-V2.6的实现方式有其独特之处。不同于将多个独立模型拼接的方案,MiMo-V2.6从一开始就在统一架构下训练多模态输入的理解能力。这意味着模型在处理图文混合、视频理解、语音指令等跨模态任务时,不会出现“模态切换”带来的信息损失。

三、用强化学习“喂养”智能:MiMo-V2.6的训练哲学

3.1 六天,75万条轨迹,347万美元

MiMo-V2.6最引人注目的训练细节,是小米将整个RL训练过程进行了公开直播。从训练进度、成本变化到任务通过率,外界可以近乎实时地观察两个模型如何在30个RL step中逐渐提升能力。

具体数据如下:Pro与Flash的训练历时不到6天,成本分别约为262万美元和85万美元,合计约347万美元。各完成30个RL step,累计约75万条轨迹。单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达35亿至37亿。训练任务平均通过率分别相对提升25%(Flash)和12%(Pro)。

这些数字背后反映的是一个核心判断:RL的规模化扩展,可能比单纯增大预训练参数量更能提升模型的实际能力。

3.2 7000+环境:让模型在“真实世界”中学习

传统的大模型训练往往依赖静态数据集。而MiMo-V2.6的RL训练构建了一个覆盖Code、General、Visual、Cyber等多个方向的复杂任务体系,开放了超过7000个分级任务环境,涵盖软件工程、漏洞复现、知识工作和网页设计等领域。

这意味着模型不是在“背题”,而是在“做题”——面对真实或接近真实的任务场景,通过反复试错来学习。小米在技术文档中写道:“在一个智能容易被复制的时代,我们选择把算力投进真实环境,让模型在反馈中一次次试错、自己学会。”

3.3 Grader算力的扩展:一个容易被忽视的创新

小米在训练中专门扩展了“Grader算力”,通过Group内的相对比较为长程RL任务提供更精准的奖励信号。这个技术细节的重要性容易被忽略,但它实际上解决了一个RL训练中的核心难题:对于需要多步推理才能完成的任务,如何判断中间步骤的对错?

传统的二元奖励(对/错)在长程任务中信号过于稀疏。通过Group内相对比较,模型可以在同组任务之间进行横向对比,从而获得更丰富的梯度信息。这种方法让模型在DeepSWE v1.1上的表现从48.8分跃升至65.7分(Pro版),提升幅度约17分。

四、性能实测:MiMo-V2.6到底有多强?

4.1 核心基准测试横向对比

以下是MiMo-V2.6系列与同期主流模型的基准测试对比(数据来自小米官方技术文档及第三方评测):

基准测试 MiMo-V2.6 Pro MiMo-V2.6 Flash MiMo-V2.5 Pro Claude Opus 5 GPT-5.6 Sol Fable 5
AA智能指数 46 26 53 53 53
DeepSWE v1.1 71.9 67.9 19.0 74.0 73.0 70.0
MiMo Code Bench 63.2 61.2 40.4 68.6 59.3
AutomationBench v1.0.6 53.1 52.3 16.0 50.3 45.8 46.2
Toolathlon-Verified 76.9 73.6 49.1 80.6 74.9 77.9
Agents‘ Last Exam 31.6 27.6 13.2 31.6 30.8 25.7
Terminal Bench 2.1 89.9 87.6 65.2 89.1 88.8 84.3
OSWorld-Verified 82.0 80.8 61.5 83.4 83.0 86.0

从表格中可以清晰看到,MiMo-V2.6-Pro在多项Agent基准上已经接近甚至追平Claude Opus 5和GPT-5.6 Sol这类顶级闭源模型。特别是在Terminal Bench 2.1上,Pro版以89.9分略微领先Claude Opus 5的89.1分。而在Toolathlon-Verified上,76.9分的成绩超过了GPT-5.6 Sol的74.9分。

但也要客观看待差距。在ProgramBench上,Pro版26.5分与Claude Opus 5的37.0分仍有明显距离。在MiMo Visual Coding评测中,Pro版72.3分虽然高于DeepSeek V4.1 Flash和Claude Opus 5,但与GPT-6 Astra的82.2分差距不小。

4.2 与前代相比的跨越式进步

MiMo-V2.6-Pro相比V2.5-Pro的提升幅度令人印象深刻。AA智能指数从26分跃升至46分,提升20分。DeepSWE v1.1从19.0分提升至71.9分,涨幅接近3.8倍。AutomationBench从16.0分提升至53.1分,增长超过3倍。

这种幅度的提升,在模型迭代中并不常见。它说明小米在RL训练方法论上的投入,确实带来了实质性的能力增长,而不是简单的“参数堆砌”或“数据灌入”。

4.3 国产开源模型中的定位

在国产开源模型的竞争格局中,MiMo-V2.6-Pro的46分AA指数超过了Kimi K3(44分)和GLM-5.3(45分),成为当前AA指数上排名最高的开源权重模型。在Coding Agent任务上,MiMo-V2.6-Pro在开源模型中位列第三,仅次于GLM-5.3和Qwen 3.8 Max。

但与DeepSeek V4.1 Flash(39分)和DeepSeek V4.1 Pro(36分)相比,MiMo-V2.6-Pro在AA指数上具有明显优势。这说明小米在大模型竞技中已经进入第一梯队。

五、开源策略:MIT协议+全栈开放意味着什么?

5.1 真正“无门槛”的开源

MiMo-V2.6系列延续了V2.5系列的MIT开源协议。这意味着开发者可以自由地进行商业推理部署、微调、二次训练和再分发,没有营收门槛,也没有研究条款限制。

对于一个总参数量达万亿级别的模型来说,采用MIT协议需要相当大的决心。因为这意味着任何人都可以下载权重,在自己的硬件上运行,甚至基于它构建商业产品,而无需向小米支付任何费用。

从Hugging Face上的仓库来看,小米开放的内容包括:Pro和Flash的完整模型权重、技术文档、基于verl框架的端到端RL训练代码、7000+分级任务环境、MiMo-V2.6-Distill-Qwen-9B蒸馏起点模型,以及支持多harness训练的轻量级harness组件。

5.2 API定价的“斩杀线”策略

对于不便自行部署的用户,小米提供了API调用方案。MiMo-V2.6系列沿用V2.5系列的API定价,Pro版缓存输入每百万Token仅0.025元,Flash版为0.02元。海外API定价为Pro版每百万输入Token 0.435美元、输出0.87美元;Flash版每百万输入Token 0.14美元、输出0.28美元。

作为对比,MiMo-V2.6-Pro在同等智能水平下,价格仅为海外模型的1/20至1/60。根据Artificial Analysis的测算,MiMo-V2.6-Pro每完成一个智能指数任务的成本仅为0.13美元。

这种定价策略的意图很明确:通过极低的使用成本,吸引开发者将MiMo-V2.6作为默认的模型选择。

5.3 开源全栈的行业影响

小米此次开源的不只是模型本身,而是整个训练和部署的工具链。7000+任务环境和RL训练代码的开放,意味着研究团队可以基于MiMo-V2.6的训练框架,去训练自己的模型或探索新的RL方法。

这种做法在国产大模型中尚属首次。它降低了RL研究的门槛,也可能加速整个行业在RL训练方法论上的迭代。对于学术界和中小型研究团队来说,这是一个难得的研究资源。

六、从手机到机械臂:MiMo-V2.6的应用场景

6.1 端侧部署:小米的“主场优势”

小米做端侧大模型有一个天然优势——它拥有庞大的终端设备生态。2026年7月,小米MiMo端侧模型正式通过网信部门备案,成为首批获得国家认可、可在手机端侧合规部署的生成式AI模型之一。

在硬件层面,小米18 Fold折叠屏旗舰手机已确认搭载Xiaomi MiMo端侧大模型。小米玄戒O100原型机内置MiMo端侧模型后,实测推理速度可达每秒295 Tokens。

这意味着MiMo-V2.6的能力不只停留在云端API,而是可以真正下沉到用户的手机、平板甚至IoT设备中。离线运行、隐私保护、低延迟响应——这些端侧AI的核心价值,正是小米最擅长的领域。

6.2 3D空间推理与具身智能

MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作能力。在游戏开发场景中,用户输入图片、视频或文字后,模型可以将需求拆解为多个任务,由多智能体协作完成3D场景搭建、交互逻辑编写与视觉验证。

更具前瞻性的是具身仿真应用。MiMo-V2.6可以直接以多视角相机画面为输入,通过视觉反馈闭环控制Franka Panda机械臂,完成物体抓取、颜色匹配与精准放置。这意味着模型不仅能“看懂”世界,还能“操作”世界。

在Blender中,MiMo-V2.6能够根据用户的文字描述或参考图片完成物体与场景的三维建模,生成可用于动画制作、3D打印与游戏开发的3D资产。

6.3 智能体与代码开发

Coding Agent是MiMo-V2.6重点优化的方向之一。Pro版在DeepSWE v1.1上71.9分的成绩,意味着它能够处理复杂的软件工程任务,包括多文件代码生成、调试和重构。结合MiMo Desktop桌面客户端,开发者可以将MiMo-V2.6作为日常编程的AI助手使用。

在通用Agent方面,Pro版在Toolathlon-Verified上76.9分的表现,表明模型在工具调用、多步骤任务规划等场景中具备较强的实用性。

七、安全与合规:开源模型的“红线”问题

7.1 端侧合规的先行者

小米MiMo端侧模型已通过国家网信部门备案,这意味着它在数据安全、内容合规等方面满足了监管要求。小米miclaw端侧智能助手也通过了中国信通院首批手机端智能助手评测,在合规对齐方面符合《智能助手基准测试通用框架》规范要求。

7.2 安全防护体系

小米构建了覆盖输入-生成-输出全链路的安全防控体系,包括Prompt注入防御、越狱攻击防护、安全审核、红蓝对抗等核心能力。在数据保护方面,小米采用“授权优先、同等防御、端到不留痕、安全链路”四项原则,用户数据主体请求响应时效统一缩短至15日。

对于开源模型而言,安全是一个复杂的问题。模型权重一旦公开,安全对齐的效果就取决于使用者的部署方式。小米的做法是在端侧产品中内置安全防护,同时通过开源协议鼓励社区在安全框架内进行二次开发。

八、行业视角:这次发布意味着什么?

8.1 开源与闭源的差距在缩小

MiMo-V2.6-Pro的AA指数46分,与Claude Fable 5.1和GPT-6 Astra的53分相比仍有7分差距。但这个差距正在以肉眼可见的速度缩小。一年前,开源模型与闭源旗舰之间的AA指数差距普遍在15分以上,如今已经压缩到个位数。

考虑到MiMo-V2.6-Pro是MIT协议完全开源的,而Claude Fable 5.1是闭源商业模型,这7分的差距是否值得付出数十倍的成本?对于许多应用场景来说,答案可能是否定的。

8.2 RL规模化:新的技术竞争焦点

MiMo-V2.6的核心方法论——规模化扩展RL算力——正在成为行业共识。小米在RL训练阶段投入的算力规模,可能是目前国产开源模型中最多的之一。Pro与Flash合计约347万美元的训练成本,大部分花在了RL阶段而非预训练阶段。

这释放了一个信号:在大模型预训练边际收益递减的背景下,RL训练可能成为下一阶段能力提升的主要驱动力。谁能更高效地进行RL规模化扩展,谁就可能在下一次模型迭代中占据先机。

8.3 小米的独特定位

小米在大模型赛道中的定位正在变得清晰。它不像DeepSeek那样追求纯粹的模型能力前沿,也不像部分厂商那样将大模型作为云服务产品。小米的路径是:用开源模型建立技术影响力,用端侧部署打通硬件生态,用极低的API价格吸引开发者。

这三者之间形成了一个飞轮:开源带来开发者关注,开发者使用产生反馈,反馈改进模型能力,更强的模型吸引更多硬件用户。这个飞轮能否转起来,将决定小米在大模型领域的长期竞争力。

九、FAQ:关于MiMo-V2.6的常见问题

Q1:MiMo-V2.6系列包含哪些模型?

A:包含两款核心模型——全模态旗舰MiMo-V2.6-Pro(1.02万亿总参数/420亿激活)和高效推理MiMo-V2.6-Flash(3090亿总参数/150亿激活),以及Pro的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端。

Q2:MiMo-V2.6是免费的吗?

A:模型权重采用MIT协议开源,可免费下载、商用部署、微调和二次训练,无需额外授权。API调用为付费服务,但定价极低:Flash版缓存输入每百万Token仅0.02元。

Q3:MiMo-V2.6支持哪些输入类型?

A:支持文本、图像、音频、视频四种模态的原生输入,输出为文本。上下文窗口为100万Token。

Q4:MiMo-V2.6-Pro和Flash的主要区别是什么?

A:Pro追求极致智能水平,适合复杂编程、Agent任务和专业场景;Flash强调性能与成本的平衡,适合高吞吐量生产环境。Flash全面超越了前代V2.5-Pro的能力水平。

Q5:普通人能用MiMo-V2.6做什么?

A:可以通过MiMo Desktop桌面客户端体验;小米18 Fold等搭载端侧MiMo模型的手机用户可享受离线AI能力;开发者可通过API或自行部署,构建智能体、代码助手、3D建模等应用。

Q6:MiMo-V2.6和DeepSeek、Qwen相比如何?

A:在AA智能指数上,MiMo-V2.6-Pro的46分高于DeepSeek V4.1 Flash(39分)和V4.1 Pro(36分),也高于Kimi K3(44分)和GLM-5.3(45分),是当前AA指数最高的开源模型。在Coding Agent领域位列开源模型第三,仅次于GLM-5.3和Qwen 3.8 Max。

十、写在最后

小米发布并开源MiMo-V2.6系列大模型,不只是一次产品迭代,更是对“开源大模型能走多远”这个问题的有力回应。46分的AA智能指数、万亿参数的MoE架构、六天75万条轨迹的RL训练、MIT协议的完全开放——这些数字和选择叠加在一起,构成了一个清晰的信号:开源模型的竞争力正在从“能用”向“好用”甚至“领先”快速演进。

当然,挑战同样存在。万亿参数模型的部署成本依然高昂,端侧推理的实际体验有待大规模验证,与顶级闭源模型的差距需要持续缩小。小米选择了一条更难但更有想象力的路:把训练过程公开、把权重开放、把工具链交出。这种“全栈式开源”的策略能否真正建立起开发者生态,将是未来一年最值得关注的变量。

以上内容不代表本平台立场,仅供读者参考