具身智能数据生产新范式:HiFi-UMI开源破解规模与精度难题

当前,具身智能的发展逻辑已经发生了清晰的转变:不再局限于展示单一动作的演示能力,而是朝着在真实场景中稳定完成复杂任务的目标演进。在不久前的WAIC2026展会现场,这种趋势尤为突出——机器人不再只是完成表演性的单步动作,而是被寄予了走进产线、仓储、酒店客房等真实场景,切实完成落地工作的期待。
不过,演示与实际落地之间仍存在着难以跨越的鸿沟。尽管在模型架构上,VLA与WAM路线的争论仍在持续,参数规模、模型容量的讨论也从未停止,但有一个具体且明确的难题始终摆在行业面前:高质量的操作数据匮乏,是制约具身智能落地的核心瓶颈。
此前,斯坦福大学教授李飞飞就曾明确指出这一痛点:与大语言模型可以从互联网获取海量公开数据不同,具身智能从训练到评估的全流程中,都面临着数据不足的问题。
目前行业内的机器人操作数据主要有三类来源,各有优劣:互联网公开视频数据体量庞大,但无法提供精准的动作细节信息;真机遥操作数据精度足够高,却需要同时占用实体机器人、操作人员和专属场地,成本高昂且扩展速度缓慢;UMI这类无本体采集方案则将采集设备脱离机器人本体,让数据采集可以进入更多真实场景,解决了规模受限的问题。
但长期以来,这类无本体数据因为保真度的先天缺陷,只能用于模型的预训练阶段。在进行具体任务的后训练时,团队仍需要补充一定比例的真机遥操作数据作为「锚点」,用来对齐机器人本体特性、执行时延、相机视角以及真实环境的差异。行业普遍的做法是不断降低这部分真机数据的占比,但只要「锚点」存在,无本体数据就无法独立完成从训练到部署的完整闭环。
那么,是否可以跳出压缩真机数据的思路,通过提升无本体数据本身的保真度,让这个「锚点」不再必要?这正是深朴智能推出HiFi-UMI的核心初衷。
近期,深朴智能正式发布了高保真无本体数据生产引擎HiFi-UMI,这套系统将便携式采集设备、轨迹重建、数据治理、模型训练和真机部署完整串联起来。根据官方披露的实验结果,仅使用HiFi-UMI的示范数据进行后训练,机器人策略就能直接部署到真实机器人平台上。在覆盖VLA与WAM两类架构的三个代表性模型中,其整体成功率达到了与同域真机遥操作数据相近的水平。同时,使用同一批HiFi-UMI语料进行大规模预训练后,模型在十个未见任务上的平均动作预测误差下降了41%。这意味着,无本体数据终于摆脱了仅作为预训练语料补充的定位,开始走向任务后训练和真实机器人执行的全流程。
无本体数据长期无法进入后训练阶段,并非行业的固有偏见,而是受到真实的技术局限性制约。首先,UMI方案确实解决了机器人操作数据的规模问题:真机遥操作需要机器人、操作员和任务环境同时在线,每次操作失败后都需要重置物体和机器人状态,硬件还可能出现磨损故障,随着采集规模扩大,设备调度、人员管理和场地维护的成本会快速攀升。而UMI类无本体采集将人类示范与机器人硬件解耦,采集者无需操控实体机器人,只需携带便携设备进入家庭、酒店等场景,就能记录人类完成擦拭、整理、折叠、搬运等操作,摆脱了机器人数量的限制,能够覆盖更多真实环境。
但数据规模足够大,并不代表可以直接驱动机器人完成精准任务。预训练和后训练对数据的要求存在本质差异:预训练阶段,模型只需学习手应该靠近哪些物体、一项任务包含哪些步骤、抓取后大致的移动方向这类通用知识;而到了后训练阶段,模型需要掌握末端执行器的精确位置、双手的相对距离与角度、夹爪闭合的准确时机、接触物体后如何继续调整动作这类细节信息。毫米级的误差或许不会影响模型理解「将遥控器放入槽位」的语义,但足以导致真实世界中的插入操作失败。因此,无本体数据能否从预训练走向后训练,核心挑战就在于数据的保真度是否足够高。
传统的UMI方案存在四大明显的保真度缺陷:
轨迹漂移:位姿依赖腕部在线视觉SLAM,操作过程中手部或物体会频繁遮挡视角,长时程任务中的轨迹误差会不断累积;
双手「各说各话」:双手相对位姿通过跨相机共视重建而非原生测量,导致协调任务的误差较大;
时间不同步:相机、夹爪编码器和位置传感器往往来自不同设备,依靠软件或无线对齐,存在毫秒级的时差,在快速移动、夹爪闭合和物体接触的瞬间,这种错位会直接影响策略学习;
视野盲区:单只手仅配备一个鱼眼相机,视野盲区大、深度线索不足,模型只能看到动作的开始和结束,无法完整捕捉中间的交互细节。
这些问题共同限制了传统UMI数据的能力边界:它可以帮助模型形成通用的操作经验,但无法独立承担对精度要求极高的任务后训练。
为了突破这些局限,深朴智能没有对传统流程进行小修小补,而是围绕轨迹精度、双手位姿、时间同步、视野覆盖四个核心维度,对采集硬件和数据处理流程进行了系统性重构。
头戴式双目惯性SLAM,求解原生相对位姿
传统UMI通常将视觉定位的基准放在手腕上,而HiFi-UMI将定位基准转移到了相对稳定的头部,采用头戴式双目相机与惯性测量单元(IMU),通过离线双目惯性SLAM重建头部轨迹。同时,左右手分别安装视觉标记结构,由头部双目相机在统一坐标系中同步定位,让两只手的相对位姿在采集过程中直接形成,无需分别重建两条轨迹再事后拼接。在手写轨迹实验中,HiFi-UMI可以重建毫米级的笔尖运动,工作空间内的末端轨迹误差约为3毫米,全程无需依赖外部动捕或定位设备。
统一GPIO硬件同步,消灭跨传感器偏差
传统方案采用毫秒级的软件同步方式,而HiFi-UMI改用统一GPIO硬件触发器,六路相机、IMU和夹爪编码器都由同一信号驱动,将跨传感器间的时间同步误差压缩到40微秒以内。机器人策略学习的是在特定视觉和状态输入下应输出的动作,如果图像、手部位姿和夹爪状态没有严格同步,训练样本中的状态与动作就会出现错位。微秒级的硬件同步能够让视觉、轨迹和夹爪状态尽可能对应同一个物理时刻。
6路视觉协同,全局定位与局部感知互补
在视觉覆盖方面,HiFi-UMI在每只手上配置上下两枚超广角鱼眼相机,再加上头部双目相机,总共形成6路视觉输入。头部视角可以提供完整的全局观察,记录环境、目标物体和任务进度;腕部视角靠近夹爪和操作区域,负责捕捉接触、抓取和物体局部变化。单腕的水平和垂直视角均约为200°,当目标物体在某一路视频中被遮挡时,其他视角仍能保留关键操作信息。系统可以借此识别操作对象、判断任务进度、确定动作边界,同时为轨迹检查、失败分析和AI辅助标注提供更多依据。
全掌手套式夹爪,让操作更贴近自然
此外,HiFi-UMI还采用了全掌手套式夹爪,兼顾小物体的精细操作和较大物体的抓取。采集者可以采用更接近自然抓取和发力的方式完成示范,减少设备结构对动作习惯的干扰。
不过,高精度的采集设备只是基础,要将人类示范转化为模型可用的数据,还需要经过完整的数据治理流程。数据采集完成后,需要依次经过轨迹重建与清洗、仿真重定向、AI辅助标注、人工复核和分析导出等步骤。其中,轨迹重建与仿真回放的通过率均约为98%,仿真回放可以提前检查动作是否超出机器人工作空间、双臂是否发生碰撞、夹爪状态是否合理,以及整段操作能否连续执行,两道关卡串联后,原始采集数据的基础有效率约为96%。最终,每段有效示范都会保留同步多视角视频、双手轨迹、夹爪状态、语言描述、子任务边界和质量记录。至此,HiFi-UMI已经从一套单纯的采集设备,升级为一套完整的数据生产引擎。
数据采得更准只是解决了生产环节的问题,真正的考验在于,机器人能否仅凭这些数据独立完成任务。也就是说,在目标任务的后训练阶段,完全不补充真机遥操作数据,训练后的策略能否在真实机器人上顺利完成任务?为了验证这一点,团队在双臂真机平台上设置了四项具有代表性的任务:
污渍擦拭:机器人需要让清洁工具持续接触桌面,并按照合理轨迹覆盖目标区域,考验的是持续接触、运动连贯性和轨迹控制能力——即便机器人能够抓住工具,也未必能维持稳定接触并覆盖完整区域;
衬衫折叠:柔性物体没有固定形态,机器人每完成一步,衣物的褶皱、边缘和位置都会发生变化,两只手还需要相互配合维持张力,完成对齐和翻折,考验的是机器人双手相对位姿和长程动作的稳定性;
遥控器插入:这是典型的约束放置任务,机器人需要准确判断槽位的位置和方向,并将遥控器调整到合适姿态,几毫米的平移误差或微小的角度偏差,都可能导致插入失败;
果蔬分类:机器人需要用右手将蔬菜放在粉色盘子里,用左手将水果放在蓝色盘子里,同时考验指令遵循、视觉理解和双臂操作能力。
整体来看,这四项任务分别覆盖了持续接触、柔性物体操作、精密放置和指令遵循四类核心场景,避免实验结果仅来自简单抓取或固定物体搬运。
实验选取了三个代表性模型,分别是StarVLA-QwenPI、OpenPI-π0.5这两款VLA模型,以及LingBot-VA这款WAM模型。三套模型采用了不同的技术路线,目的是让HiFi-UMI的验证不再局限于某一个专门定制的策略架构,将数据源效应与模型架构效应分离开来。在同一个模型内,实验仅更换后训练数据来源:一组使用真机遥操作数据,另一组仅使用HiFi-UMI示范数据。
需要注意的是,两类数据面对的场景条件并不相同。真机遥操作基线数据直接采集自最终评测环境,模型在训练中已经见过相同的桌面、背景、光照、相机视角和物体分布;而HiFi-UMI示范数据来自不同地点、不同背景和光照条件,没有任何一条HiFi-UMI轨迹是在最终评测现场采集的。因此,真机遥操作基线拥有明显的同域数据优势,HiFi-UMI策略除了学习任务动作,还需要跨越额外的环境与视觉分布差异。
即便在这种不对等的条件下,HiFi-UMI数据依然取得了优异的成绩。以StarVLA-QwenPI模型为例,使用两类数据后的整体成功率分别为51.3%和53.8%——使用HiFi-UMI进行后训练的160次真机评测中成功82次,使用遥操作数据后训练的160次评测中成功86次,仅相差2.5个百分点。OpenPI-π0.5模型基于HiFi-UMI和真机遥操数据后训练的整体成功率分别为77.5%和74.4%,使用HiFi-UMI后训练的效果反而比遥操作后训练高出3.1个百分点。在WAM模型LingBot-VA上,HiFi-UMI后训练与真机遥操作后训练的整体成功率分别为56.9%和57.5%,差距仅为0.6个百分点;其中在污渍擦拭和果蔬分类任务上,HiFi-UMI后训练的成功率分别达到62.5%和57.5%,均略高于真机遥操作后训练的结果。
这组实验结果的关键并不只是成功率的数字对比,而是证明高保真无本体数据已经可以同时提供任务语义、视觉观察、精确轨迹、双手关系和执行时序。换句话说,HiFi-UMI已经具备了独立承担目标任务后训练的能力。
不仅如此,HiFi-UMI还可以作为大规模预训练数据。团队使用4000小时的多任务HiFi-UMI数据,对StarVLA-QwenPI进行预训练,结果显示在10个未参与训练的任务上,预训练模型的平均动作预测误差下降了41%。完成预训练后,团队继续使用HiFi-UMI数据进行专项后训练,四项真机任务的平均成功率进一步提升了18.1%。
在这套训练体系中,预训练和后训练承担着不同的作用:预训练帮助模型积累跨任务的视觉-动作经验,学习抓取、移动、对齐、放置和双手协作等通用交互模式;后训练则通过高精度的专项示范,让模型适应具体物体、任务步骤、动作位置和终止条件。随着数据量增加,模型在保留集上的动作预测误差整体下降了61%,并呈现出清晰的幂律下降趋势,其中α为0.268,R²达到0.993。这一结果虽然不足以证明具身智能领域已经形成普遍适用的Scaling Law,但至少说明在当前4000小时数据范围内,模型的动作预测误差能够随着高质量UMI数据的增加而稳定下降。
单任务实验进一步展示了预训练对数据利用效率的提升。以遥控器插入后训练任务为例,使用400条示范数据时,模型成功率为37.5%;增加到800条后成功率升至65%,1600条对应70%,3200条达到85%。当数据量继续增加到6400条时,成功率没有继续提升,这说明单一任务中的后训练数据收益,在数据达到一定程度后会逐步饱和。而经过多任务预训练的模型,仅使用800条遥控器插入专项数据,就超过了未经预训练、使用3200条专项数据的版本,大幅提升了数据后训练的效率。
不仅如此,在十项未参与预训练的任务上,预训练模型的表现还呈现出清晰的分层:餐具、餐盘一类的刚性抓放任务改善最快,颗粒物转移居中,而衣物折叠改善最慢。对照预训练数据的构成不难解释这一现象:物体与容器的放置类动作占据了预训练帧数的三分之一以上,而织物折叠的占比不足百分之一。面对从未见过的餐具,模型可以复用大量刚体抓放经验;而衣物折叠只能从稀疏的可形变物体监督中进行外推。这揭示了一个有趣的发现:模型的迁移能力并不取决于「是否见过这个物体」,而是取决于「预训练是否覆盖过这类物理交互」。因此,具身数据集的建设不能只统计任务数量和物体类别,底层交互模式、状态变化和失败分支的覆盖程度,同样会决定模型能够学到什么。
整体来看,HiFi-UMI的价值覆盖了机器人学习的两个关键阶段:在预训练阶段积累可复用的视觉-动作经验;在后训练阶段帮助模型快速掌握具体操作并直接部署。如果说后训练实验证明了HiFi-UMI的「可用性」,那么大规模预训练则证明了它的「可扩展性」。
据官方透露,目前HiFi-UMI数据生产体系已处理超过2万小时、432万段操作数据,覆盖480多个场景。此次深朴智能宣布开源的HiFi-UMI-2K,是从中经过质量筛选和分布平衡的2000小时子集,包含六路同步视频、标定后的双手轨迹、夹爪状态、语言描述和子任务边界。
对行业来说,HiFi-UMI-2K的意义并不只是增加了一个操作视频数据集,而是为业界提供了一批可以用于验证无本体训练、视觉动作建模、多视角表征、双手轨迹预测、跨场景迁移和动作重定向的数据。更重要的是,它让「高保真无本体数据能否直达真机」从一家公司的内部实验,变成了一个可以被更多团队复现和检验的问题。
据行业观察,这项工作一经发布就迅速获得了业界的关注与热议。截至目前,HiFi-UMI已登顶Hugging Face Daily Papers日榜第一,开源数据集HiFi-UMI-2K一周内下载量达3.4万次。此外,相关内容在社交平台的分享也获得了约5万次的浏览量。热度的持续扩散,说明这项工作击中了具身智能当前的普遍痛点:行业一边需要更大规模的真实世界操作数据,一边又不能牺牲真机执行所需的轨迹、时序和交互精度。
过去,这两个目标往往由不同的数据路线分别承担,而HiFi-UMI试图将规模与保真度融入同一套数据生产体系中。这也向业界证明:具身智能的Scaling Law,不仅取决于模型参数和机器人数量,也取决于能否建立一条低成本、高保真、可持续扩张的数据生产链。
HiFi-UMI的研发起点,可以追溯到2025年底的一场具身智能比赛。彼时,深朴智能团队参加了由李飞飞团队与斯坦福AI实验室联合发起的首届BEHAVIOR Challenge。这项比赛的难度在具身智能领域并不多见:参赛模型需要在BEHAVIOR-1K环境中完成50项完整的家庭任务,从整理房间到清洁厨房,每一项都涉及长程移动、双臂操作和复杂环境交互,一个任务往往由数十个环节连续构成,中途任何一步失误,整段任务就会前功尽弃。主办方提供了1万条、超过1200小时的遥操作专家示范,可以说是一个为具身智能量身定制的「超级benchmark」。
面对这样的任务集,一种常见的做法是针对具体任务和场景做专门适配,把分数「调」上去,但这样得到的高分往往只在榜单上成立,换一个任务、换一个场景就要重来。深朴智能选择将泛化能力放在分数之前,创新性地提出了一套SimBot-Agent框架,用一套统一的机制处理任务理解、长程规划与技能执行,不为任何单项任务做特化。最终,深朴智能凭借这套框架拿下了全球第三名。
据团队回忆,比名次更重要的是:当框架不再依赖针对单一任务的特化,其能力的天花板究竟落在哪里也就显露出来——数据的质量和规模两个问题同时变得具体:一方面,长程任务会把示范数据的空间与时序误差逐级放大,单步动作的微小偏差尚可容忍,但一旦任务链条拉长,每一步的偏差都会成为下一步的起点,最终往往在中途就中断;另一方面,1万条示范摊到50项完整家庭任务上,每项任务平均只有约200条,而遥操作的成本结构决定了它很难再向上扩展几个量级。质量与规模,缺一不可却又难以兼得。当时看来,能同时满足两者的路径并不多,无本体采集在规模上是现成的答案,但它的保真度还远达不到长程精细操作的要求——与其在遥操作一侧继续压缩成本,不如将无本体数据的保真度提升上来。紧接着,团队正式启动了高保真UMI项目,一路迭代到今天的HiFi-UMI。
结合这一背景,就更容易理解HiFi-UMI在深朴智能整体技术路线中的位置。深朴智能成立于2024年底,围绕「模型、数据、本体、场景」构建具身智能全栈闭环:一端是具身模型的预训练与后训练,以及面向长程任务规划、跨本体适配和非标准场景泛化的Omni-Simple-World Model与Robotic Agent OS;另一端是真实机器人在酒店、康养等类家庭商业场景中的持续验证。HiFi-UMI正是这套技术体系中的数据底座:无本体设备扩大真实世界操作的采集范围,数据引擎完成重建、校验和标注,模型通过预训练积累通用经验,再通过后训练掌握具体任务,策略最终回到真实机器人上接受检验,执行中暴露的问题又回流为下一轮采集的方向,让整条链路真正形成闭环。
据了解,目前深朴智能已在酒店场景开展POC测试,尝试让真机部署产生的新问题继续回流到数据和模型系统中。
最后可以看到,限制无本体数据走向真实部署的,可能并非采集时是否需要机器人,而是数据中的空间、时间和交互信息是否足够「HiFi」。随着这一缺口逐步被补齐,具身智能的数据竞争格局也将被改写。下一阶段,行业比拼的或许不只是谁拥有更多的实体机器人,更是谁能以更低成本、更高效率生产足够准确、足够多样,并能真正转化为机器人能力的操作数据。当这条数据生产链开始规模化运转,具身智能迈向大规模真实世界部署的进程,或许才真正开始。


