文章摘要
九月底凌晨,Grok 4.7与小米MiMo V2.6两款重量级AI大模型几乎同期发布。作者围绕大模型性能、价格、速度的“不可能三角”测试后发现,Grok 4.7提升有限,表现未达预期;小米MiMo V2.6性能优异、定价极低、响应速度快,兼顾三项要求,且全面开源开放,是综合表现更优的选择。

九月底的一个凌晨,AI大模型领域迎来了一场罕见的正面交锋——两款重量级模型几乎同时发布。一边是推迟两周才露面的Grok 4.7,另一边则是沉寂五个月后终于登场的MiMo v2.6系列。

作为长期使用大模型的开发者,我始终认为行业存在一个难以兼顾的不可能三角:性能、价格与速度。这三者仿佛天然对立,想要高性能就难免成本高昂,追求低价又往往要牺牲响应速度,过去很少有模型能同时满足这三点需求。

此前GPT-6 Astra的强悍能力让我印象深刻,它能高效重构基建、完成复杂任务,但极高的使用成本和较慢的响应速度也让我不敢放开使用,每天的额度消耗都让人小心翼翼。而Grok 4.6曾经是我心中最接近这个三角的模型,虽然编码能力不算顶尖,但速度和价格都足够友好,我也一直将其作为日常常用的工具。正因如此,我对Grok 4.7抱有很高的期待,希望它能进一步优化这个平衡。

然而实际测试下来,Grok 4.7的表现却让我有些失望。这款基于2.1T全新预训练的模型,相比前代1.5T的Grok 4.6参数规模有所提升,但依然没有解决上下文长度的问题,仅支持500K上下文,并未达到1M的预期。官方称其加入了航天领域多年积累的工程数据进行训练,但实际效果只能说中规中矩。

在权威的Terminal-Bench 4.0编码评测集上,它的得分和DeepSeek V4.1 Flash持平,甚至没能超过GLM 5.3 Flash,更不用说GPT-6和Fable 5.1这类顶尖模型。在科研推理能力评测CritPt上,相比Grok 4.6也几乎没有进步。整体的AA指数停留在46分,和GPT-5.6 Sol相当,这一分数更多是依靠法律等知识类任务拉起来的,编码和智能体相关的表现其实并不亮眼。

更让人意外的是前端生成表现,甚至不如前代的Grok 4.6,在建筑前端设计和性能测试中,不仅设计密度不足,还存在严重的卡顿问题,流畅度远不如GLM 5.3 Flash。而且它的定价依然和Grok 4.6一致,百万输入Token收费2美元,输出Token收费6美元,这样的进步幅度显然没能达到我的预期。

原本我以为Grok 4.7会是当天的主角,直到它发布三个半小时后,MiMo v2.6系列正式登场,瞬间让这场交锋的天平发生了倾斜。

MiMo V2.6系列的惊喜表现

这次MiMo推出了三个版本:MiMo-V2.6-Pro、MiMo-V2.6-Flash,还有号称全球最快的20倍速版本MiMo-V2.6-Pro-UltraSpeed。而这款我原本没抱太多期待的模型,却给了我最大的惊喜。

首先看跑分,AA指数刚刚更新的MiMo-V2.6得分同样是46分,和Grok 4.7完全打平,位列开源模型第一、国产模型第一。从V2.5的26分提升到如今的46分,这一进步幅度相当可观。

在Terminal-Bench 4.0编码评测中,MiMo V2.6 Pro在开源模型中仅次于GLM-5.3和Qwen 3.8 Max,位列第三;而在科研推理能力的CritPt评测上,它的得分仅次于GPT和Claude,成为表现最好的模型之一,在其他各项任务中也基本处于第一梯队。

价格方面更是让人眼前一亮:MiMo V2.6 Pro的缓存输入价格仅为每百万Token 0.025元,Flash版本更是低至0.02元,直接对标DeepSeek V4.1 Flash,而且没有优惠期或闲时价格限制,就是实打实的低价。如果使用非实时的批量推理模式,价格还能再打五折。相比其他主流大模型,这个定价堪称价格屠夫,甚至让DeepSeek都显得不够有竞争力。

除了出色的性能和低廉的价格,MiMo的响应速度同样惊人,输出速度达到了130 Token/s,流畅度拉满。

我用第三方AI测试集的2000道评测题进行了内部测试,MiMo V2.6 Flash的品味分排名第一,速度和价格和DeepSeek V4.1 Flash持平,这让我直接决定将相关的主要判断API全面切换到MiMo V2.6 Flash上。现在它已经成为我日常工作流中的重要一环,无论是小型BUG修复还是常规功能优化,都能高效完成,甚至还能主动关联历史问题,提供举一反三的解决方案。

在露天足球场设计和花朵动效网页这类前端任务中,它的表现也相当不错,精细度和流畅度接近Opus 4.8到Opus 5的水平。

值得一提的是,MiMo V2.6并没有盲目堆高参数规模,而是沿用了V2.5的基座,通过后训练实现了性能的大幅提升。其中MiMo-V2.6-Pro总参数1.02T,激活参数42B;Flash版本参数更小,总参数309B,激活参数15B,两者都支持1M上下文和原生全模态,文字、图片、视频、音频都能直接输入处理。

开发团队这次还公开直播了强化学习的训练过程,用户可以实时查看训练步数、花费成本、数据量以及训练Pass Rate等指标。整个强化学习过程花费约347万美元,耗时不到6天,从训练曲线来看,数据集的质量相当高。

团队还发布了完整的技术报告,里面包含了大量的技术细节,非常值得AI从业者学习,链接如下:MiMo V2.6技术报告

此外,MiMo的桌面客户端也结束内测正式上线,支持自定义模型配置,还预设了多款国产模型,方便用户直接使用,客户端下载链接:MiMo桌面客户端

这次MiMo V2.6最让人惊喜的是全面开源,在模型上线当天就开放了所有权重,用户可以在Hugging Face上直接下载MiMo-V2.6-Pro和Flash的模型文件。不仅如此,团队还推出了专门的小模型MiMo-V2.6-Distill-Qwen-9B,基于Qwen3.5-9B打造,让没有大量算力的社区开发者也能复现这套Agentic RL训练方案。

同时他们还开放了7000多个高质量的RL任务环境、mini-harnesses工具以及完整的技术报告,这种开放的姿态在当前的大模型领域实属难得。

总的来说,MiMo V2.6系列真正做到了性能、价格与速度的平衡,完美解决了我心中的大模型不可能三角。而Grok 4.7的表现则相对平淡,没能延续前代的优势。如果你无法使用海外模型,MiMo V2.6 Pro绝对是国内目前综合表现最出色的选择之一。而这种开放的技术分享和低价的使用策略,也让我们看到了大模型普惠化的可能。

以上内容不代表本平台立场,仅供读者参考