文章摘要
9月下旬,小米MiMo团队开源新一代MiMo V2.6系列大模型,推出三款定位不同的产品,旗舰款MiMo V2.6 Pro性能跻身全球开源大模型第一梯队。该系列依托突破性混合任务强化学习技术,性价比大幅领先同行,单任务成本远低于海外竞品,实用性获得行业认可。

大模型领域的竞争正迎来新的质变节点。9月下旬,小米旗下MiMo团队正式对外开源新一代MiMo V2.6系列模型,一口气推出三款定位不同的产品,直接重新定义了开源大模型的性能与性价比边界。

其中旗舰型号MiMo V2.6 Pro在行业通用智能评估体系中拿下46分,超越了Kimi K3和Qwen3.8 Max,跻身全球开源模型第一梯队,同时也是国产开源模型的标杆产品。横向对比全球榜单,这款模型的得分仅次于Fable 5.1、GPT-6 Astra和Opus 5等顶级闭源模型,将其他开源竞品远远甩在身后。

更引发行业讨论的是,这款模型在同期与马斯克旗下SpaceX推出的Grok 4.7拿到了相同的评分,但单任务成本仅为0.13美元,仅为后者的三十分之一。社区评价直指其“又好又便宜”的核心优势,甚至有开发者直言,这一组合直接掀翻了当前的大模型价格竞争规则。

MiMo V2.6系列并非单一模型,而是针对不同使用场景打造的完整产品线:

  • MiMo V2.6 Pro作为旗舰款,支持全模态能力,能够覆盖复杂项目研发、长周期任务处理、高价值专业工作,甚至可以应对网络安全和前沿科研等硬核场景,是开源领域极少数同时兼顾全模态特性与顶级性能的模型。
  • MiMo V2.6 Flash则主打高效实用,在保留全模态能力与高性能的同时,控制了使用成本,专为高频调用和规模化任务场景设计,其综合表现已经全面超越上一代的旗舰型号V2.5 Pro,对于日均需要运行数万次模型任务的开发者来说,是兼顾体验与成本的最优选择。
  • MiMo V2.6 Ultraspeed则面向对实时性有极高要求的生产场景,在不牺牲Pro旗舰性能的前提下,实现了最高10倍的推理速度,常态推理速度可达500 TPS,峰值甚至能突破1000 TPS,仅需3倍的成本就能获得10倍的响应速度,完美适配强交互的实时业务需求。

榜单评分只是模型能力的参考维度,真正让开发者认可的是其实际落地的表现。MiMo V2.6在多个关键场景中都展现出了远超跑分的实用能力:

在游戏开发场景中,它可以生成可交互的3D开放世界场景,从远景的建筑轮廓到近景的细节布局都能做到统一协调,镜头推拉时帧率稳定,没有明显的穿模或掉帧问题,不仅完成了场景的视觉呈现,还兼顾了场景层级、资产复用和渲染性能的整体优化。

在复杂3D建模任务中,它可以根据文本描述或参考图像在专业工具中生成高精度的3D对象和场景,比如生成的皮卡线框模型,车身、轮毂、底盘等部件的空间关系严丝合缝,还能实现动态的颜色变化,其空间推理和细节控制能力已经不输顶级闭源模型。

在多模态文档生成场景中,它可以根据输入内容生成专业的路演幻灯片、报告文档,不仅排版符合专业审美,还能清晰梳理内容逻辑,真正理解目标受众的需求,呈现出专业分析师级别的内容组织能力。

在前沿科研场景中,相关团队使用MiMo V2.6 Pro完成了一项实际的科研任务:设计能够从水中捕获永久性污染物PFAS的新型金属有机框架材料。整个流程从文献综述、假设提出到模拟验证全部实现闭环,模型设计的候选材料在模拟测试中吸附性能达到参照材料的百万到千万倍,将原本需要一个月的研发周期压缩到2-3天,人类专家的工作效率提升了约10倍,相关领域的学者评价其研究能力已经达到训练有素的博士研究人员水平。

很多人好奇,MiMo V2.6的预训练基座和参数规模都没有变化,为何能实现智能水平的大幅跃升?答案藏在其突破性的后训练技术中。团队将此次发布定位为探索递归自我改进路径的关键一步,核心是通过规模化的强化学习训练,让模型在持续的探索与反馈中自主进化智能边界。

据了解,MiMo团队在近半年的时间里专注于强化学习的规模化扩展研究,甚至将V2.6的RL训练过程全程公开直播,全球的研究者都可以通过公开渠道实时查看训练曲线的攀升过程。在不到6天的时间里,Flash和Pro两个模型各完成了30步训练,累计生成约75万条轨迹,训练成本分别约85万和262万美元,这一公开的大规模RL资源在海外AI社区引发了广泛关注,有行业人士评价这是迄今为止公开的最酷的大规模RL训练项目之一。

此次技术的核心是混合任务强化学习方法,团队将方法论浓缩为“一次大规模混合任务RL即可让模型在多个方向上同时涌现能力,无需针对每个任务单独训练”。其训练过程沿着三个核心轴同时扩展,形成了闭环的自我改进系统:

第一轴是Rollout计算,也就是训练的覆盖广度。每个训练步骤使用1568个Prompt,每个Prompt进行16次Rollout,单步训练Token可达27亿到37亿,支持1M上下文长度的训练,并且采用完全异步的执行模式。这一设计相当于用数千块GPU搭建了一张巨大的“刷题网”,让模型同时面对数万条轨迹,通过海量试错逼近最优解。选择16次Rollout的背后,是为了在成本和信号质量之间找到最佳平衡点,通过组内比较区分“偶然正确”和“真正理解”,避免单一尝试带来的反馈偏差。与传统的同步RL训练不同,MiMo V2.6将生成、评分、训练拆分为连续的流水线,每条轨迹完成后即可立即进行评分和学习,无需等待所有任务完成,解决了不同Agent任务耗时差异过大导致的资源浪费问题。

第二轴是环境与Harness,也就是训练的场景广度。传统的RL训练通常仅在单一任务上进行,而MiMo V2.6将编程、通用办公、视觉设计、网络安全等多种Agent任务混合训练,技术报告显示其训练配比为编程占68%、通用Agent占12%、视觉设计占13%、网络安全占4%、指令遵循占3%,横跨25个数据源和21种Harness框架。每个领域都有专门的质量把关机制,比如编程任务采用三重质检流程,网络安全方向使用真实漏洞作为训练环境,视觉设计则结合规则检查和横向对比进行评估,确保训练的场景与真实专业场景对齐。

第三轴是Grader计算,也就是反馈的精准度。这是最容易被忽视但至关重要的一环,MiMo V2.6没有采用简单的二元评分机制,而是将评分过程本身打造为一个智能Agent。对于简单任务采用离线Rubric按预设维度打分,对于复杂长链路任务则启动在线的Agentic Grader,在同一组的16条Rollout结果中进行横向对比,实现“组内排名+信用分配”。该评分Agent会从方案恰当性、修改精准度、改动最小化、副作用控制、工程质量五个维度进行细粒度评分,甚至可以识别出“投机取巧”的解决方案,将奖励重新分配给真正高质量的解法,引导模型用更短的路径和更少的Token完成任务。实验数据显示,加入Grader的训练可以让模型的对话轮次和Token消耗保持稳定,通过率持续攀升,而没有Grader的训练则会出现模型生成臃肿代码、过度依赖补丁的问题。

将多种类型的任务混合在一次RL训练中,最大的挑战是如何避免训练过程出现波动。MiMo团队为此搭建了一整套稳定性基建:Sample Mixer调度器负责动态平衡不同领域和数据源的训练比例,解决任务耗时和数据量差异过大的问题;底层将控制面与数据面解耦,支撑海量轨迹在多种Agent框架间的高并发流转;Router冻结机制保证了MoE架构下的训练一致性,锁死专家路由避免模型不稳定;同时设置了三层Reward Hacking防线,通过环境消毒、对抗筛查和持续审计,防止模型在训练中寻找捷径,确保训练的真实性和有效性。

当前大模型行业的竞争常常围绕“斩杀线”展开,也就是通过降价将模型推到性价比最优的价格曲线上方。但MiMo V2.6的做法更为激进:智能水平翻倍,价格却维持与上一代V2.5一致的标准,直接画出了一条全新的“智能-成本”帕累托前沿。

以旗舰型号为例,MiMo V2.6 Pro的缓存、输入、输出三项成本均为行业最低,相比Opus 5和GPT-5.6 Sol等顶级闭源模型,缓存价格低约99%,输入价格低约89%,输出价格低约95%以上。效率型号Flash与其他竞品相比,输出价格低约50%。行业分析数据显示,MiMo V2.6 Pro首次将全球顶级智能水平带入0.1美元的单任务成本区间,换算到同等智能水平,其价格仅为海外竞品的1/20到1/60,能够逃出其性价比覆盖范围的模型寥寥无几,且均为定价更高的闭源旗舰产品。

这一突破并非偶然,而是MiMo团队多年技术积累的结果。早在2025年12月发布的MiMo-V2和2026年4月的V2.5版本中,团队就已经通过MoE稀疏激活、滑动窗口注意力、多Token预测和推理系统协同等技术,在扩大模型容量和上下文能力的同时,降低了实际激活计算、KV Cache和生成延迟。V2.5-Pro的UltraSpeed版本甚至在单台标准8卡GPU节点上实现了1000 tokens/s的输出速度,首次在不依赖定制芯片的前提下实现了高性能推理。V2.5版本在Agent基准测试中,在取得相近成绩的前提下,比竞品少用42%到50%的Token,并且在2026年7月登顶全球最大的模型API聚合平台OpenRouter的调用量月榜和周榜双料第一,单周调用量突破10万亿Token,靠的就是开发者用脚投票的真实体验。

MiMo V2.6正是这一效率路线的阶段性闭环:前两代积累的高效架构降低了长轨迹训练成本,更快的推理速度扩大了RL探索的规模,更丰富的训练环境和精准的Grader系统提升了任务成功率,而进化后的能力又通过同一套高效系统以更低的成本和更快的速度交付,形成了正向循环的技术飞轮。

MiMo V2.6的发布,用全程公开的大规模RL训练、三轴协同的自我改进系统和全球领先的性能与性价比组合,证明了强化学习的规模化扩展拥有巨大的潜力,开源模型完全可以站到行业顶级水平,技术效率的优化可以真正实现帕累托最优的突破。

以上内容不代表本平台立场,仅供读者参考