文章摘要
近期,机器人领域通用家务测试基准 RoboCasa - 365 榜单更新,黎曼动力的 Riemann - 1.0 首秀登顶,新纪录达 62.6%。该模型用人类日常活动的第一视角视频等训练,自研处理流水线,还采用分阶段训练策略。真机测试表现优,其成立体现昆仑万维 AGI 布局延伸。

近期,机器人领域通用家务测试基准RoboCasa-365榜单迎来重磅更新,榜首位置被全新模型刷新。新的最优成绩达到62.6%,较此前的最高纪录提升了8.4个百分点——要知道,该榜单上绝大多数模型的准确率仍在50%以下徘徊。

而此次登顶的模型,正是此前行业内几乎无人知晓的Riemann-1.0,黎曼动力。作为一款首秀即登上顶级榜单的产品,它刚刚在近期的行业顶级展会上正式发布。

仅凭跑分还不足以验证模型的真实能力,研究团队公开的真机演示视频给出了更直观的证明:在桌面整理场景中,机器人可以轻松夹起贴在桌面上的薄勺子,先倒净碗中剩余的汤液再收纳餐具,最后还能顺手擦拭干净桌面,整套流程流畅自然。不少网友调侃,以后家长可能会用“连机器人都比你眼里有活儿”来调侃孩子了。

进一步追溯可以发现,黎曼动力正是昆仑万维专为具身智能赛道成立的全资子公司。作为一家此前在AI内容生成领域布局广泛的企业,昆仑万维此次切入机器人领域的动作,引发了行业关注。

一个首次亮相的新模型,凭什么能在难度极高的通用家务测试中登顶?答案藏在它的训练数据“食谱”中:在总计23.2万小时的训练数据里,占比最高的并非机器人采集的真实操作数据,而是人类日常活动的第一视角视频。

这一选择的背后,离不开具身智能领域持续一年多的技术路线争论。此前行业围绕VLA和世界模型形成了两大鲜明阵营:VLA路线更偏向“直觉派”,推理速度快但容易出现操作失误;世界模型路线则属于“深思派”,运行稳定但训练成本高、周期长。随着研究深入,行业逐渐意识到两种路线各有优劣,开始探索融合路径。

今年6月,英伟达西雅图机器人实验室发布的长文综述指出,World Action Model(WAM,世界动作模型)已经从VLA研究的小众分支,成长为机器人基础模型的第二大主流路线,下一代通用机器人基础模型大概率将是两者的混合体。在ICML 2026会议上,包括LeCun团队在内的多篇研究论文也验证了这一方向:通过海量无标注的开放世界视频学习潜在的动作世界模型,是提升机器人泛化能力的关键路径。

综合来看,行业正在形成一套成熟的训练范式:先用大规模开放世界视频完成预训练,让模型学习人类与物理世界的交互方式,积累基础的物理直觉;再通过少量真实机器人操作数据完成动作对齐,将抽象的物理直觉转化为可执行的机器人控制信号。这也解释了为何越来越多的机器人研究团队开始聚焦人类日常活动的视频数据。

对通用机器人而言,人类的日常活动本身就是最丰富的操作示范库。做饭、叠衣服、整理房间等第一视角视频中,蕴含着人类感知环境、规划动作、处理突发状况的完整逻辑。而且这类数据不仅来源丰富、场景多样,还在持续快速增长。目前已有不少前沿玩家布局这一方向,比如Being-H0.7使用了20万小时人类第一视角视频,Generalist AI的GEN-1更是采用了50万小时可穿戴设备采集的人类动作数据。

而Riemann-1.0的独特优势在于,它是国内较早完成这套范式全工程化落地的产品,从仿真测试到真机部署均实现了完整验证。其核心突破在于解决了行业普遍面临的难题:人类视频中没有机器人动作的精准标签,无法直接用于训练机器人控制模型。

Riemann-1.0的训练数据可以分为三类,如同一桌精心搭配的宴席:第一类是“广菜”,即20万+小时的人类第一视角日常活动视频;第二类是“精菜”,包含1.2万+小时的UMI与外骨骼手套采集的精细动作数据;第三类是“准菜”,涵盖2万+小时的机器人真机与仿真操作轨迹。三类数据总计23.2万小时,覆盖41种不同机器人本体和数千种交互场景,足够让模型学习到丰富的人类生活技能。

但海量的人类视频数据并非可以直接使用的训练原料:这类视频没有标注机器人的关节角度、夹爪力度等控制参数,相当于“未处理的食材”。为此,黎曼动力自研了一套自动化人类数据处理流水线,完成从原始视频到可训练数据的全流程转换。

这套流水线的处理流程可以分为多个步骤:首先是画面校正,将鱼眼镜头畸变、歪斜的画面统一矫正为正视图,消除拍摄设备带来的误差;接着通过视觉语言模型(VLM)将长视频切割为细粒度的动作片段,并为每个片段添加任务描述、动作指令、场景和物体信息,同时进行两轮一致性校验,修正标注错误的片段。

之后是语义质检环节,过滤掉六类无效视频:包含多个人物的画面、无意义的动作、严重遮挡的场景、未完成的任务、非第一视角拍摄以及手部脱离画面的片段。通过质检的片段将进入核心的3D手部姿态重建环节:系统追踪画面中的手部,重建完整的手部姿态,并结合相机位姿估计,将手部运动轨迹转换为世界坐标系下的三维坐标,最后对轨迹进行平滑处理。为保证重建质量,系统还会进一步过滤手部模糊、动作过快、镜头晃动剧烈的片段,与此前的语义质检形成双重筛选。最后,所有处理完成的片段将按照场景、任务、动作、技能、物体五个维度进行分类归档,保证训练数据的均衡性,避免模型出现“偏食”问题。

另外两类数据由于自带夹爪传感信息,行业已有成熟的处理流程,因此未做过多展开。

完成数据预处理后,模型的训练架构和策略同样关键。Riemann-1.0基于扩散架构,提出了全因果动作-视频联合建模框架,将视觉动态、环境状态和机器人动作序列统一纳入同一个生成式学习过程中。这意味着模型不仅能识别当前场景中的物体,还能学习动作对环境的影响,以及预测后续的世界状态变化。

为了让单个模型适配41种不同形态的机器人本体,Riemann-1.0还设计了专属的动作映射模块,在共享通用世界理解能力的同时,保留不同机器人的肢体适配特性。简单来说,该模型打造了一个通用的“世界认知大脑”,再通过不同机器人的动作适配器,将抽象的环境理解转化为具体的执行指令。

训练过程则采用了分阶段的渐进式策略,核心的调节参数是动作损失权重:从0.1逐步提升至0.5,最终达到0.9。第一阶段为“小火慢炖”,通过Latent Action Model从人类视频中提取伪动作信号,仅设置0.1的动作权重,让模型优先学习物理世界的运行规律;第二阶段为“中火调味”,引入UMI和真实机器人动作数据进行校准,将动作权重提升至0.5,实现从伪动作空间到真实控制空间的平滑过渡;第三阶段为“大火收汁”,仅使用纯机器人数据进行强化训练,将动作权重提升至0.9,让模型专注学习可直接落地的操作技能。这种训练路径类似大语言模型从预训练到对齐的过程,只是将训练载体从文本换成了物理世界的动作。

这套方案的效果究竟如何?首先通过消融实验验证了人类视频数据的价值:在RoboCasa-365基准测试中,仅使用从头训练的模型准确率仅为38.2%;加入机器人数据预训练后提升至43.4%,涨幅5.2个百分点;再加入UMI数据后提升至48.2%,再涨4.8个百分点;而最终加入人类视频数据后,准确率直接跃升至62.6%,整体涨幅达到14.4个百分点,超过前两类数据的增益总和。

这说明人类数据带来的远不止“更多训练样本”,它给模型灌进了更丰富的物体交互方式、动作语义和任务先验,直接抬高了模型在没见过的场景里的泛化上限。

另一组严格控制变量的实验则进一步验证了这一结论:在专为双灵巧手人形机器人设计的EgoVLA基准测试中,使用相同的模型和机器人数据,仅加入人类视频预训练后,长程多阶段任务的成功率从42.96%提升至71.11%,涨幅超过28个百分点;即使更换为完全陌生的视觉背景,成功率也从26.36%提升至43.33%。这表明任务链越长、场景越陌生,人类视频数据带来的性能提升越显著。

从整体测试成绩来看,Riemann-1.0在多项仿真基准测试中均表现优异:在LIBERO标准操作评测中成功率达到99.0%,在主打双臂协作的RoboTwin 2.0测试中成功率为94.3%,而在难度最高的RoboCasa-365测试中以62.6%的成绩登顶SOTA。可以看出,该模型在基础操作能力上稳居第一梯队,而其最大优势正是在RoboCasa-365这类强调家庭长流程、跨场景泛化的测试中。

不过仿真测试终究是模拟场景,真机落地才是最终考验。在真机部署前,研究团队针对真实居家场景进行了专项后训练:搭建了四类代表性的家务测试场景,包括有序积木堆叠(测试精准操控和指令理解能力)、柔性布料折叠(测试形变物体交互能力)、桌面杂物整理和厨房餐具收纳(测试杂乱环境下的长流程连续操作能力),并通过人工遥操作采集示范数据,对四类场景进行联合训练。为保证公平性,参与对比的开源基座模型也使用了相同的数据和训练步数进行后训练。

最终测试结果显示,Riemann-1.0的平均成功率达到85.00%,过程完成度(衡量长流程任务中间步骤推进稳定性的指标)达到94.43%,两项指标均在所有对比方法中排名第一,领先表现最好的开源模型15个百分点。四类任务的成功率全部超过80%,每一项的过程完成度也都在91%以上,说明该模型不仅能完成任务,还能在长流程操作中保持稳定的步骤推进,不会出现中途掉链的情况。

最后回到黎曼动力本身,作为昆仑万维旗下专注具身智能的子公司,其成立背后其实是两条逻辑线的交汇。

第一条是行业的整体趋势:当前AI的交互方式正在发生变革,此前的AI交互主要集中在文字、图片、音视频等数字内容领域,而未来AI将逐步进入物理世界,实现与实体环境的交互。作为一家在数字内容生成领域布局多年的企业,昆仑万维切入具身智能赛道只是时间问题。

第二条则是昆仑万维自身的战略布局。早在此次发布之前,该公司就已经在多模态模型领域进行了多次升级。在近期主办的《世界模型与多模态范式跃迁》论坛上,昆仑万维一口气亮相了三款模型:升级后的Matrix-3.5世界模型实现了可交互能力的跃迁,打通了数字孪生与具身智能的底层底座;升级后的Mureka v9.5实现了AI音乐创作的量产级落地;而首发的Riemann-1.0则打通了世界模型与实体机器人的交互闭环。

可以看出,前两款模型负责数字世界的内容生成,而Riemann-1.0则首次将技术延伸到了物理世界。依托世界模型的底层底座,一端连接游戏、视频等数字内容,另一端连接实体机器人,昆仑万维的AGI布局终于从数字世界延伸到了物理领域。

而选择单独成立黎曼动力的原因也很明确:机器人属于硬核技术赛道,无法快速取得短期成果,需要独立的团队、专属的资源和长期的研发投入。昆仑万维作为母公司提供算力和生态支持,而黎曼动力的核心团队则可以专注于技术研发,实现资源的最优配置。

作为一家将“实现AGI”写入企业使命的公司,昆仑万维此次通过黎曼动力正式切入实体机器人领域,标志着AGI的发展正式进入下半场:上半场聚焦数字世界的内容生成,而下半场则将拓展到物理世界的交互与落地。目前赛道方向已经明确,接下来就看各玩家的落地速度了。

以上内容不代表本平台立场,仅供读者参考