文章摘要
小米完成MiMo-V2.6系列模型后训练,Flash与Pro两个版本总投入超347万美元,训练过程全程公开,相关资料具备较高行业参考价值。其中MiMo-V2.6-Pro登顶开源模型智能指数榜首,单任务成本约0.13美元,性价比突出,验证了同一模型基座下后训练仍有较大优化空间,项目同步开源全套技术资料,经多场景实测性能优异、使用成本低,拉高了开源模型性能上限。

早前在社交平台看到一则分享,提到有团队正在直播MiMo-V2.6的后训练过程,训练步数、评测曲线与每日成本消耗都实时展示在公开网页上。两天后再次查看时,训练仍在进行,且单两天的算力消耗就达到了200万美元,直观展现了大模型训练的高昂成本。几乎同一时间,海外强化学习领域的从业者也在转发这条动态,曾撰写RLHF相关书籍的团队成员评价,这是目前公开的大规模强化学习资料中最具参考价值的一份内容。直到发布当日清晨,这款模型终于完成训练正式对外发布。

根据行业通用的智能指数榜单,MiMo-V2.6-Pro直接登顶开源模型榜首,拿到46分的成绩。榜单中的虚线代表当前开源模型的性能斩杀线:横轴代表单任务成本,纵轴代表智能指数,越靠近左上角则代表能力更强且成本更低,这款模型落在了高性价比区域内,单任务成本约0.13美元,将开源模型的性能上限再次拉高了一个层级。

六天训练,总投入超347万美元

本次后训练的最终成本已经确认:MiMo V2.6-Flash版本消耗85万美元,Pro版本花费262万美元,两个模型均完成了30个RL训练步数,总投入较最初观测时又增加了七成。相关负责人表示,这大概率是目前开源团队开展的单次强化学习训练中,算力规模最大的项目之一,即便在算力资源紧张的阶段,团队仍调配了数十人的专属资源推进这项工作。

这笔超百万美元的投入,究竟带来了哪些核心提升?首先体现在当前大模型评测的重要标杆——DeepSWE v1.1的跑分上:MiMo V2.6-Pro的得分从58.4提升至72.6,Flash版本从48.8涨到65.7,分别上涨14分和17分,而模型基座并未更换,所有性能提升都来自后训练环节。早在去年就曾提到,同一基座跑分的大幅提升,说明后训练仍有大量未被挖掘的优化空间,小米本次的项目再次印证了这一点。更重要的是,本次项目不仅发布了模型,还同步开源了强化学习的代码、训练环境与完整技术报告,有能力的团队可以自行复现训练流程,当然前提是准备好足够的预算。

从技术报告细节来看,团队主要从三个维度提升算力使用效率:一是扩大训练批次,单次更新包含1568个样本,上下文长度拉升至1M,每步训练处理3.5到3.7亿个Token;二是构建混合任务集,将编码、通用智能体、视觉与网络安全任务整合,在多个测试框架中并行训练;三是提升打分器的算力投入,通过同组模型的相对比较,引导模型选择更高效的生成路径,减少不必要的Token消耗。

跑分数据更多是入场的参考凭证,实际应用效果仍需要结合真实业务场景验证,这也是本次测试的核心原则。

官方测试环境:MiMo Desktop

本次项目除了模型本身,还同步推出了MiMo Desktop正式版,内置了V2.6-Pro和Flash两个版本。当前行业内不少厂商都会为自家模型定制专属的测试框架与交互环境,不同的系统提示词、工具集和上下文管理策略,会让同一个模型在不同客户端中的表现出现明显差异,而官方预装的环境通常最能体现厂商希望展示的模型能力,因此本次测试全程都在官方客户端内完成,未使用第三方工具。

我们在客户端中加载了四个自研的开源技能工具:用于程序化3D网页开发的huashu-3djs、操控真实浏览器的huashu-chrome、撰写研究报告的huashu-report,以及设计工具huashu-design,随后开展了五项多轮迭代的真实任务测试,而非简单的单次prompt生成任务。

案例1:3D建模能力

第一项测试是3D建模能力。此前相关模型发布后,用Blender渲染3D模型成为验证大模型能力的常见标准,本次官方宣传中也展示了相关案例。不过除了建模软件操作,当前大模型直接通过three.js编写代码生成3D网页的能力也有显著提升,我们选择用自研的程序化3D网页工具来测试,任务要求生成太和殿的3D模型,需要先查询公认的建筑尺寸并标注来源,审美风格参考故宫纪录片正午时分的太和殿效果。

模型首先完成了资料查询,针对我们提出的“脊兽数量为十个”的要求,它查证后发现部分资料会将领头的骑凤仙人计入总数,最终调整为十个走兽,骑凤仙人单独放置在端头。第一轮生成的模型剪影和比例准确,但光影较为平整,类似乐高积木的质感。第二轮我们要求添加三层台基、丹陛以及月台上的铜龟铜鹤,最终渲染后的三角面片数量从两万提升到54646。

案例2:前端设计审美测试

第二项测试是前端设计审美,这也是近两年国产大模型提升较快的领域。我们给的任务是设计一个高端极地旅行社的官网首页,明确要求避免常见的常规旅游网站风格,打造出独特的品牌气质。调用设计工具后,模型生成了三个不同风格的版本:

第一款采用包豪斯风格,以圆、三角、方作为基础造型元素作为品牌标志,配色选用深藏青搭配朱红,将经纬度作为版面装饰元素;第二款参考极简设计理念,采用大面积留白搭配衬线中文字体,整页仅保留一句话“把一生一次,留给真正的白”;第三款主打电影氛围感,全屏展示冰山背景,搭配标语“向南,直到世界安静下来”。

个人更偏爱包豪斯风格的版本,但更值得关注的是,三个版本都没有明显的AI生成痕迹,这一点比视觉风格更重要。

案例3:真实编码场景测试

第三项测试是真实编码场景下的问题解决能力,而非单纯的算法刷题。我们从自研的仓库中选取了一个9月8号由用户提交的未修复bug,直接将仓库链接和issue编号提交给模型处理。模型仅用约5分钟就完成了代码阅读、问题定位和修复,第三轮测试中我们要求用仓库内的15份真实技能代码对比修复前后的效果,模型顺利完成了问题解决。当项目复杂度提升后,新模型和智能体能否适配真实的开发场景,是检验其agentic编程能力的核心标准。

案例4:办公场景数据处理

第四项测试是办公场景的数据处理任务,当前智能体模型在办公自动化方向的应用越来越广泛,比如表格制作、数据爬取和核对等,这类任务比编码更贴近大众日常工作。我们的任务是从本次训练的直播页面中,提取两个模型的逐step训练数据,整理成CSV格式并生成HTML数据页,最后回到原页面逐一核对数字准确性。

模型首先识别了页面的接口请求,完整读取了60行数据,在我们特意增加的核对环节中,模型主动列出了6处数据不一致的地方并逐一修正,最终生成的页面数据与官方技术报告完全匹配。这里还有一个值得关注的细节:Flash版本的训练成本仅为Pro版本的三分之一,但训练的token数量更多,性能提升幅度也更大,单从本次强化学习的投入产出比来看,小模型路线似乎更具性价比。

案例5:长程研究与幻觉控制

第五项测试涵盖三个维度:长程任务处理能力、智能体的错误自愈能力以及幻觉控制能力。我们选择的研究对象是Jev,这是某团队在9月15号发布的仅做判断不输出文本的模型,发布仅七天,训练数据中不可能包含该模型的信息,因此可以清晰检验模型是否会编造内容。

测试中出现了一个意外情况:我们预装的两个搜索服务分别出现额度耗尽和密钥失效的问题,且内置联网搜索功能未开启,三条数据获取渠道全部中断。模型在两次报错后,自动切换使用自研的浏览器操作工具,前后进行了四十余次检索,遍历了官方博客、项目文档、创始人署名文章和团队介绍页面,整个过程没有一次暂停请求协助,最终生成了一份十八页的机构研报。

在幻觉控制方面,模型在最初制定计划时就主动设定了规则:每个事实都需要标注编号,只有经过原始页面验证的内容才能标记为已验证。我们提前准备了核查表,包含18条官方事实和5类常见的编造点,最终测试结果为:5类编造点零命中,18条官方事实中命中14条,遗漏的均为细节信息,还有一条是我们的核查表标注错误,模型引用了官方团队页面的原文进行纠正。对于官方披露的数据,模型均原样引用并标注“官方自述,非独立测评”,毕竟该模型发布仅七天,尚未有第三方评测内容。

实际使用成本表现

本次五项测试共完成18轮交互,总耗时171分钟,所有操作都在官方客户端内完成,客户端自动记录了详细账单:其中输入Token的缓存命中率达到95.7%,这是一个相当亮眼的数据。当前很多模型的缓存调用成本远低于未命中缓存的情况,但实际使用中经常出现缓存命中率低的问题,导致看似低价的模型实际使用成本反而高于缓存优化更好的产品。从本次测试来看,MiMo-V2.6-Pro不仅性能出色,还兼具低成本和高缓存命中率,后续可以将常用的开源API迁移到这两个版本上。

行业观察:智能普惠的新进展

很难想象,大模型发展到当前阶段,仍能不断带来新的惊喜。上周推出的全新模型给出了全新的形态与定价策略,仅做判断的模型输入每百万Token仅需4美分,输出完全免费;本周MiMo-V2.6系列又将开源模型的性能斩杀线进一步拉高,而本次五项复杂任务的总花费仅为九美元,相当于一杯奶茶的价格。两件事结合来看,人工智能正朝着普惠的方向快速发展,模型能力持续提升的同时,使用成本不断下降,用户仅需在本地运行客户端就能使用顶级的开源模型,成本门槛已经变得非常低。

江海之所以能为百谷王者,以其善下之。

以上内容不代表本平台立场,仅供读者参考