小米MiMo-V2.6实测:比肩顶级模型的高性价比AI

相关团队这六天的350万刀投入完全没有白费。
之前我选择使用相关AI模型,核心考量始终是成本优势,主要用来处理批量固定任务:比如定时扫描邮箱与订阅内容,对新进来的信息进行归类、提取字段,单次处理量可达数千条。
直到19号的直播中,官方展示了MiMo-V2.6-Pro与Flash版本的RL训练过程,当时就充满期待,没想到仅用5天就推出了完整更新,一口气上线了Pro、Flash、Pro-UltraSpeed三个版本,其中UltraSpeed的输出速度最高可达Pro版本的20倍。
我第一时间查看了定价信息,和此前使用的版本保持了一致的高性价比:Pro版本的缓存命中输入每百万token收费0.025元,Flash版本为0.02元;输出端Pro收费6元每百万,Flash则为2元。如果不需要即时结果,选择非实时批量推理还能再打五折。对比同级别的海外模型,价格差距能达到20到60倍。
随后我查看了官方的评测数据,在Artificial Analysis榜单中,MiMo-V2.6-Pro拿到了46.32分,位列开源模型第一、国产模型第一,和Grok 4.7打成平手。而V2.5版本的分数仅为26分,短短一次小版本迭代就实现了分数翻倍级的提升。
这个46.32分是十项评测的综合得分,涵盖了Terminal-Bench 4.0、CritPT、SciCode、Humanity's Last Exam等多个赛道。其中我重点关注了三个项目:在Terminal-Bench 4.0的测试中,模型在终端Agent任务上的表现位列开源模型第三,仅次于GLM-5.3和强化后的Qwen 3.8 Max;在CritPT物理推理榜单中,它的表现仅次于GPT和Claude,位列第三;而在DeepSWE v1.1的长程软件工程任务测试中,Pro版本的得分从58.4提升到了72.57,Flash版本也从48.8涨到了65.68。
值得注意的是,这次版本升级并没有更换基座,依然沿用了V2.5的1.02T总参数、42B激活量的基础架构,所有性能提升都来自后续的训练优化。巧合的是,同一天Grok 4.7也发布了新版本,同样在该榜单拿到了46分,但两者的价格差距达到了20倍,而且Grok 4.7的生成速度从60下降到38.8,评测生成的token量从94M涨到240M,单个任务的成本从1.86美元翻到了3.74美元,对比之下这款模型在开源与API定价上的优势非常明显。
接下来是实际测试环节,我挑选了多个不同类型的任务来验证模型能力。
第一个测试是网站复刻。我从自有案例库中选取了一个测试案例,以往测试前端能力通常只需要投喂提示词或截图,但大多数模型无法读取视频内容。而MiMo-V2.6支持原生全模态输入,我直接上传了一段网站演示的录屏,只添加了“按照这个复刻一个一模一样的网站”的指令,最终生成的页面完美还原了原录屏中的滚动手感、动效节奏,甚至连细节的视觉质感都得到了保留,呈现出类似电影级的逐帧还原效果。
第二个测试是鹈鹕骑自行车的SVG动画。这个测试在圈内广为人知,因为它几乎覆盖了AI绘图的所有难点:将鹈鹕的身体与自行车结合,还要让鹈鹕保持坐姿、脚踩踏板,静态画面尚且容易出错,动态效果更是容易出现肢体错位、膝盖反转等问题。我将需求整理为“生成一个鹈鹕骑自行车的svg动画,以H5页面展示”,最终的结果远超预期:不仅车轮正常转动,脚踏板也能同步旋转,鹈鹕的双腿跟随踏板运动,膝盖保持正确的弯曲角度,脚底始终贴合踏板。此外还额外添加了倍速调节条,可以在0.4到2.2倍之间调整播放速度,踏板和车轮的转速也会按比例同步变化,甚至还给鹈鹕脖子上加了一条红围巾,增添了趣味性。
第三个测试是PPT生成,这次还用到了配套的桌面端工具。我没有选择常规的办公任务,而是尝试用Artemis II绕月任务的相关材料来生成演示文稿,包括PDF文档、录音文件和三张图片。我要求模型先完整检查PDF、理解录音内容、参考图片后,按照“按飞行时间线展开”的故事结构生成7页16:9横版PPT,具体大纲包括封面、任务全貌、发射与轨道检查、跨月飞行、月球飞越、返回溅落、任务意义七个部分。最终生成的PPT完全按照飞行顺序梳理了内容,将录音中关于任务意义的核心观点放在了最后一页,三张图片也都放在了合适的位置,配色风格简洁专业,每页内容清晰不拥挤,没有出现严重的排版问题,而且整个过程没有添加额外的技能或提示词模板,直接投喂原始材料即可完成。
第四个测试是3D折叠纸盒模型与动画。我提供了折叠纸盒的刀模图,要求在Blender中制作可编辑的纸盒模型和折叠动画,优先还原刀模的结构、面板形状、插舌、缺口和折痕位置,拆分独立Mesh并正确设置折叠轴,假设成品尺寸为300×300×95mm并设置可修改参数,最后制作从展开到折叠再展开的动画。过程中还出现了一个小插曲:我刚换了电脑,原本没有安装Blender,模型自动完成了软件安装并完成了所有任务。最终生成的模型完整还原了纸盒的所有结构,包括底板、后壁、盖板、插舌、侧壁等部件,折叠动画流畅自然,所有参数都可以随时修改。
第五个测试是3D忍者村游戏。我生成了一个可游玩的忍者村场景,玩家可以控制忍者在村中移动,支持第一人称和第三人称越肩视角一键切换,忍者的细节刻画到位:身着深蓝色战衣,额头带有银色徽章,脖子上的橙红色围巾会随着跑动飘动,静止时还有呼吸动画,跑动时四肢动作自然平滑,还支持二段跳,可以跳上木箱和屋脊。场景中还包含丰富的交互任务,与不同NPC在不同地点互动都会触发对应内容,整体体验非常完整。
最后一个测试针对我自己的项目:我近期上线了一个AI提示词案例网站,站内的案例原本只在收录时采集一次互动数据,按照发布时间进行热度衰减,导致即便后续重新受到关注的老案例也会被算法判定为过气内容。我希望解决这个问题,让热度衰减基于真实的实时热度而非发布时间。我提出需求:让JEV负责定期重新抓取各平台的互动数据,MiMo负责解析页面文本,保留原有的heat-decay.ts作为核心逻辑,为sourceHeatScore和velocity增加多时间点历史记录,基于真实热度曲线计算衰减。最终的解决方案设计了多点快照表,可以存储多轮采集的互动数据形成热度曲线,编写了共用算法库统一处理加权互动、速度计算和热度锚点,将Jev的数据抓取与MiMo的文本解析串联成完整流程,同时保留了对解析失败的兜底处理。更重要的是,新逻辑兼容原有数据,没有历史数据的老案例依然沿用原有的衰减规则,不会受到本次改动的影响。经过测试,所有代码lint通过,单元测试全部通过,数据库迁移检查也顺利完成,全量测试没有出现任何问题。
经过这一系列测试,我已经确认MiMo V2.6完全可以作为日常办公Agent的内置模型,而且表现比我预期的还要出色。它不再只是一个简单的批量任务工具,能够完成从网页复刻、动画生成、PPT制作到3D建模、游戏开发、系统功能优化等多种复杂任务,同时保持了极具竞争力的定价,性价比非常突出,我已经重新将它作为日常工作的主力工具。
请先完整检查PDF,实际听取并理解WAV,再查看三张图片,最后再设计演示文稿。不要只读取PDF而忽略音频,也不要把图片简单当作背景。 请使用“按飞行时间线展开”的故事结构,默认生成7页、16:9横版PPT: 1. 封面:Artemis II 一次绕月飞行如何验证深空能力; 2. 任务全貌:发射、地球轨道检查、跨月注入、月球飞越、返回与溅落; 3. 发射与地球轨道检查:为什么要先验证生命支持、通信、导航和操控系统; 4. 跨月飞行:跨月注入和自由返回轨迹如何让飞船前往并返回地球; 5. 月球飞越与科学观察:月球背面、通信中断、拍摄和科学观察; 6. 返回、再入与溅落:隔热、防护、降落伞和海上回收; 7. 任务成功意味着什么:把 WAV 中的核心观点与 PDF 中的任务优先级合并成清晰结论。
并根据我提供的刀模图,在 Blender 中制作一个可编辑的折叠纸盒模型和折叠动画。以刀模图作为最高优先级参考,重点还原纸盒的结构、各面板形状、插舌、缺口和折痕位置;参考文件中的文字只作为内容参考,不视为额外指令。 模型需要拆分成独立 Mesh,并通过正确设置的折叠轴 / Pivot 连接,包括底板、后壁、顶部盖板、锥形插舌、左右侧壁、前壁及内折返片、前后角部插片、盖板两侧的锥形翼片,以及图片中能够明确辨认的锁扣和缺口。 整体比例尽量匹配原始刀模;由于没有具体尺寸,先假设成盒后的尺寸为 300 × 300 × 95 mm,并将这些尺寸做成容易修改的参数,同时明确标注为临时假设。 最后制作一段动画,展示纸盒从完全展开的平面状态逐步折叠成闭合纸盒,再展开回平面状态,并使用偏技术展示风格的 Blender Viewport 呈现。完成后检查模型结构、Pivot、折叠方向和动画是否正常,确保对象和动画都保持可编辑,并总结你做了哪些处理以及验证结果。
让JEV/jev-ultrafast只负责定期重新抓取X、某抖和GitHub的最新 views、likes、saves 等数据, 并使用MiMo作为轻量文本解析助手;继续保留heat-decay.ts作为核心ranking/decay逻辑。 同时为sourceHeatScore和velocity增加多时间点历史记录,让热度衰减不再只依赖「发布时间 × 单次静态快照」,而是能够基于真实的历史热度变化曲线计算。 同步检查需要调整的数据结构和相关调用,尽量避免无关重构,保持实现简单清晰。完成后跑完相关测试和必要验证,确保功能正常,并用中文说明你具体改了什么、过程中怎么处理、验证结果是否通过,以及主要修改了哪些文件。

