文章摘要
文章通过生成3D世界杯虚拟乐园测试,对比了MiMo - V2.5 - Pro标准版与UltraSpeed版。UltraSpeed版输出更偏向产品化,速度快、token开销低,还具备快速迭代能力,基于三大核心技术优化。虽单价高,但适合特定场景,标志大模型进入“实时执行”新阶段。

当万亿参数大模型的推理速度从分钟级压缩到秒级,大模型的产品形态正在发生质变。我们通过一组高复杂度的前端生成测试,对比了同源模型的标准版与高速版的差异,直观感受到了这种变化带来的体验鸿沟。

我们选择的测试任务是生成一个单文件3D世界杯虚拟乐园:需要包含3D球场、48支球队展馆,支持拖拽缩放、点击交互,同时保持世界杯主题与运动风格的视觉设计。分别调用两款同源模型完成该任务,结果不仅在输出效果上有明显差异,更在等待时长上拉开了显著差距。

请生成一个 3D 世界杯虚拟乐园,3D 球场,48 支球队的 3D 展馆,运动风格,3D 网站,可以点击互动,单文件。记住,给我一个 3D 网站的 html 文件。

两款模型的输出风格各有侧重:标准版MiMo-V2.5-Pro的页面更偏向氛围营造,采用暗色星空背景,中央球场和环形展馆置于夜间宇宙场景中,视觉重心突出2026世界杯标识,自带搜索、筛选和交互提示,沉浸感较强,但部分展馆和文字标签偏小,可读性一般,更偏向概念演示。而UltraSpeed版本则更偏向产品化设计,画面明亮、布局规整,48支球队展馆清晰排列在球场外围,标签、筛选和交互框架完整,信息可读性更强,没有因为速度提升牺牲页面完整性。

交互体验上,两款模型都支持拖拽旋转、滚轮缩放和点击展馆查看详情。标准版的交互更偏向沉浸式导览,点击展馆后会放大视角并弹出完整球队信息面板;UltraSpeed的视角切换后画面更明亮,信息组织更清晰,虽然交互氛围稍弱,但更符合实际使用场景的逻辑。

速度与token开销的差距才是核心差异:标准版MiMo-V2.5-Pro耗时约15分35秒(935秒),使用58563个tokens,生成759行代码,其中思考阶段耗时731.4秒。而UltraSpeed仅耗时46.3秒,首响应仅1.08秒,思考阶段仅33.1秒,处理了19522 tokens,平均速度581 tokens/s,正式输出阶段13.2秒内生成13149 tokens,平均输出速度达到980tokens/s,峰值甚至达到1084tokens/s,总计使用35827个tokens,生成829行代码。不仅耗时大幅缩短,token开销也更低,代码规模反而更高。这种差距让标准版的等待体验像“等一杯咖啡”,而UltraSpeed则接近“眨眼间完成”,尤其适合需要反复生成、修改的Coding Agent场景。

为了模拟真实开发中的迭代场景,我们还进行了两次Debug测试:首先要求UltraSpeed在原有乐园中新增世界杯历史馆和2026对战馆,33.6秒就完成了功能,总计使用34765 tokens,输出26142 tokens,平均输出速度1029 tokens/s,但风格和原版不一致;随后我们提供原版源码并明确要求保留原有视觉风格,UltraSpeed在51.6秒内完成了修改,完整保留了原有的布局与风格,新增了历史馆和赛程中心,补充了完整的22届世界杯历史统计、赛事表格以及2026年赛制、分组、赛程等信息,总tokens达到105568,其中输入源码花费60491个tokens,输出45077 tokens,平均输出速度仍达到1134tokens/s。这种快速迭代能力让开发循环从“等待-修改-再等待”变成了实时协作。

UltraSpeed的速度提升并非偶然,而是基于三大核心技术优化:

1. FP4混合量化:仅对MoE架构中的Experts模块进行MXFP4量化,保留注意力投影等关键模块的高精度,既降低了显存和带宽压力,又避免了模型能力的大幅损失。官方测试显示,该量化方式在多个基准测试中没有明显的能力断崖,甚至在部分场景超过原版模型。

2. DFlash块级投机解码:不再采用传统的逐token自回归推理,而是通过轻量draft模型一次预测一个包含8个token的块,再由主干模型统一验证。平均每轮8个draft token中有6.3个被接受,大幅压缩了前向计算次数,尤其在代码生成、结构化输出等场景优势显著。

3. TileRT系统级优化:通过常驻内核减少计算内核反复启动的开销,重叠计算与数据搬运以压缩GPU等待时间,同时针对MXFP4 Expert计算、DFlash草稿生成、主干模型验证等不同阶段设计异构流水线,适配动态执行特征,将理论加速落地到真实GPU环境中。

UltraSpeed的底层模型是MiMo-V2.5-Pro-FP4-DFlash,拥有1.02T总参数、42B激活参数与1M上下文窗口,官方称其可在单个标准8卡通用GPU节点上实现超过1000tokens/s的生成速度,峰值可达1200tokens/s。

速度并非免费的午餐:UltraSpeed的单价为标准版的3倍,属于“时间优先”的选择,并不适合普通闲聊、低频问答这类对延迟不敏感的场景。但对于Coding Agent、长代码生成、多轮Debug、实时协作等场景,单轮迭代的时间成本远高于token成本,这种提速的价值非常显著。当每一轮修改都能在几十秒内完成,用户的操作节奏会从“等待型”转向“协作型”,模型从“我问你答”变成“我指挥,你执行;我调整,你立刻改”。

从行业发展来看,过去一年大模型的竞争主线更多聚焦在“答得准、能力强”,而UltraSpeed的出现标志着大模型开始进入“实时执行”的新阶段。当万亿参数模型的生成速度达到1000tokens/s量级,大模型不再只是回答问题的工具,而是可以成为实时协作的开发搭档,让开发者不再因为等待打断思路,让Agent的迭代更流畅。这种速度提升应该成为行业基准,推动整个大模型生态从“能做任务”转向“能快速做任务”,让大模型真正成为实时执行的基础设施。

我们期待更多模型能够跟进这种技术路线,让速度与能力的平衡不再是难题,让大模型的应用场景进一步拓展。

以上内容不代表本平台立场,仅供读者参考