光轮智能双参与EgoVerse与Newton,定义物理AI全球基础设施

2009年,李飞飞团队推出的ImageNet,彻底重塑了计算机视觉领域的发展格局。在此之前,全球视觉AI研究缺乏统一的协作基准,不同机构的数据集、评测指标各不相同,难以实现公平的模型对比与能力迭代。ImageNet搭建的标准化数据与评测基础设施,让全球研究者能够基于统一规则开展实验,直接推动了图像识别与深度学习的快速爆发。
17年后,曾师从李飞飞的佐治亚理工学院助理教授Danfei Xu,带领团队开启了具身智能领域的标准化探索——他希望为机器人学习打造一套类似ImageNet的协作基础设施,解决机器人训练的数据瓶颈问题。
当前机器人训练长期面临一个核心数据困境:依赖真机遥操作的训练方式,每新增一条演示数据都需要耗费大量硬件成本、人力投入与实验场地资源,不仅采集效率极低,所能覆盖的任务与场景也十分有限。而人类在真实环境中的行为天然包含丰富的视觉信息、动作逻辑、物体交互细节与任务策略,是机器人学习的优质参考样本。通过第一视角人类操作数据,研究者可以先记录人类完成任务的完整过程,再将这些经验迁移到不同型号、不同平台的机器人上。
不过过往的人类操作数据集大多是一次性的独立项目,不同团队使用各自的采集设备、坐标体系、动作标签与任务定义,数据发布后很难持续扩展。哪怕两个团队都采集了“将杯子放在碟子上”这类基础任务的数据,两份数据集也往往无法直接兼容,无法共同用于模型训练。针对这一痛点,Danfei Xu及其合作者没有将EgoVerse设计为静态数据集,而是打造了一套动态的协作框架。
EgoVerse是一套持续迭代的第一视角人类操作数据生态与标准体系。目前其公开版本包含1362小时的人类演示数据、约8万个任务片段、1965项独立任务、240个真实场景以及2087名数据采集者。这套数据不仅包含第一视角视频,还提供相机位姿、三维手部姿态信息与细粒度语言描述,并且已经在不同实验室、不同任务与不同机器人平台上验证了人类数据的迁移效果。
最新公开的EgoVerse联盟成员涵盖了多所顶尖学术机构与企业,包括佐治亚理工、斯坦福、苏黎世联邦理工、加州大学圣地亚哥分校等高校,以及Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等企业。其中,光轮智能是本次联盟中唯一的中国企业,这也是中国企业首次进入全球具身智能数据标准的核心协作阵营。
要形成具身智能领域的事实标准,需要让所有参与者采用统一的数据结构、任务语义与评测方法,确保生产的数据能够相互兼容,并且能够验证数据的实际价值。EgoVerse正是在推进这一目标,让全球具身人类数据能够按照统一的“语言体系”流通共享。
具身人类数据的完整采集流程涵盖研究问题定义、采集硬件开发、动作迁移技术、规模化运营、数据标注与机器人验证等多个环节,任何单一机构都无法独立完成全流程的建设。因此,EgoVerse召集了具身智能领域的头部机构与学者,开展全球协作,共同定义这一划时代的数据标准。
佐治亚理工学院与Danfei Xu团队承担了EgoVerse的组织中枢与研究框架角色。该团队长期关注机器人如何从人类数据中学习,在EgoVerse项目中,他们将研究问题从“单一批次数据能否提升单台机器人的能力”升级为更具普适性的问题:人类数据的效果能否在不同实验室复现?能否跨机器人平台生效?数据规模扩大时模型能力是否稳定增长?哪些类型的数据真正具备迁移价值?通过共享协议下的协作实验,佐治亚理工负责了“容器内物体操作”类任务的验证,斯坦福团队负责双臂精细操作任务,加州大学圣地亚哥分校与苏黎世联邦理工则参与长时序双臂任务的验证,让原本互不兼容的数据、算法与机器人平台能够在统一框架下回答同一组科研问题。
斯坦福大学Shuran Song团队则聚焦于打通“具身鸿沟”——人类拥有灵活柔软的双手,而机器人往往只有简单的夹爪;人类可以依靠触觉与经验完成任务,机器人则需要明确的观测与动作表示。该团队开发的UMI(Universal Manipulation Interface),使用便携式手持夹爪采集真实环境中的人类操作,再将这些演示转化为可部署的机器人策略。UMI的核心价值在于打破了数据采集对固定机器人与实验室的依赖,研究人员可以携带设备进入家庭、商店等真实场景开展复杂长时序任务的采集,训练得到的策略还能迁移到不同型号的机器人平台上,真正实现了将人类经验转化为机器人可执行的动作。
Meta为EgoVerse提供了专用的数据采集硬件。该公司研发的Project Aria是行业首个专为大规模基础模型设计的第一视角采集设备,能够同步记录RGB视频、手部动作、相机位姿与空间信息,设备包含前置RGB相机与用于SLAM和手部追踪的场景相机。如果没有这类具备空间感知能力的硬件,第一视角数据可能只是一段“看起来像人在工作”的视频,无法还原人类在三维空间中的真实动作逻辑,Meta的技术解决了将“人看到的画面”升级为“人在三维世界中的行动轨迹”的核心问题。
Mecka AI则推动了人类数据采集的普及化。如果数据采集只能依赖少数专用硬件,那么所能覆盖的采集者与真实场景将非常有限。Mecka AI开发了基于iPhone与轻量化头戴装置的采集方案,通过云端处理恢复头部轨迹与双手三维关键点,让第一视角数据采集不再局限于机器人实验室,能够进入家庭、工作场所等更多真实环境,大幅降低了数据采集的门槛,扩展了数据覆盖的场景范围。
Scale AI则提供了规模化的数据处理能力。数据采集完成后,还需要经过清洗、标注、质检、结构化与版本管理等流程。Scale AI自2016年起就专注于AI数据基础设施建设,早期以自动驾驶场景的大规模数据处理闻名,如今已经将数据服务扩展到机器人领域,涵盖数据采集、标注、人工反馈与模型验证等环节。该公司擅长将数据生产转化为成熟的运营与处理系统,能够将数万小时的异构原始采集数据,转化为稳定可用的训练资产。
MicroAGI则探索了分布式众包采集的新模式,通过让操作人员在真实家庭环境中自然完成任务,将人类数据生产从单一的实验项目转化为可持续运营的采集网络,进一步扩大了数据的覆盖范围与多样性。
光轮智能则为EgoVerse补上了贯穿全流程的质量控制体系。当具身数据生产迈向千万级小时规模时,仅依靠采集工具与基础后处理无法保障规模化下的数据质量,随着采集设备、人员与场景的增加,视角偏移、动作遗漏、任务中断、设备异常与标注不一致等问题会被不断放大。同时,数据规模的增长并不意味着有效学习信息的同步增加,如何在规模化生产中保障数据质量,成为具身智能发展的关键挑战。
光轮智能搭建的质量控制体系覆盖了端侧采集、云端处理与仿真验证的全流程。与绑定单一采集设备的方案不同,该公司的目标是让数据管线兼容所有主流硬件,无论原始数据来自Project Aria、iPhone、头戴相机还是其他多模态设备,都可以接入统一的云端处理管线,通过视觉惯性里程计(VIO)、三维手部与身体标注、V7级动作语义标注,将异构数据转化为统一质量标准的训练资产。
数据处理完成后,光轮智能还会通过自研的物理仿真平台SimFoundry与工业级评测平台RoboFinals,验证动作轨迹、物理关系与任务过程是否能够被合理还原,判断数据是否真正具备机器人学习价值。通过持续的闭环反馈,该公司能够快速获取质量反馈并迭代优化标准,确保数据在规模化生产中实现源头可控、跨硬件统一与价值可验证。
光轮智能将人类数据的质量控制拆解为三个连续的核心环节:
第一,用Agent驱动数据采集质量与数据分布。采集现场是具身数据质量风险的高发地带,关键动作是否入镜、手与物体的交互是否被遮挡、任务起点与终点是否完整、采集者是否偏离操作要求等问题,往往会导致整段数据作废或需要重新采集。光轮智能的Agent驱动采集体系,会围绕设备状态、任务流程、动作完整性与有效视角开展实时检查,在发现风险时推动现场纠偏或补采。不仅如此,Agent还可以根据已有数据分布,调控下一轮采集的人群、场景、任务与动作类型,避免数据规模增长后出现大量重复样本,将数据质量从事后抽检升级为生产过程控制。
第二,通过兼容多种采集硬件的云端平台,实现统一的数据标准。无论原始数据来自何种设备,都需要经过云端统一的处理与质量控制,才能进入统一的训练体系。光轮智能的处理流程包括VIO恢复相机空间运动轨迹、三维手部与全身姿态标注还原人体动作与手物交互、V7级动作标注将连续视频切分为与任务对齐的动作语义单元。其推出的EgoSuite数据解决方案,能够在大规模生产中提供三维手部、全身姿态与帧级语义标注,尤其擅长在遮挡与近距离物体交互场景下维持稳定的追踪效果,并且公开支持兼容各类商业设备、研究型眼镜、运动相机与定制采集系统,真正实现了“硬件可以多元,进入模型前的数据标准必须统一”的核心思路。
第三,用仿真与评测检验数据价值。数据处理完成后,最关键的问题是判断这些数据是否真的能够帮助机器人学习。光轮智能将SimFoundry仿真平台与RoboFinals评测平台接入数据质量闭环:SimFoundry可以将人类数据中的动作轨迹、物体关系与任务流程转化为机器人可执行、可复现的仿真任务;RoboFinals则通过标准化评测,验证这些数据能够提升哪些任务的模型性能,以及在哪些机器人平台、场景与物理条件下会失效。数据价值不再由生产方自行定义,而是通过机器人训练与评测结果共同验证,评测中发现的失败案例还会反馈给采集端,指导下一轮的数据补充、分布扩展与采集规则修正,形成持续优化的闭环。
最终,一套完整的高质量具身人类数据质量闭环得以形成:端侧Agent实时控制采集质量 → 多种采集硬件统一接入云端 → VIO、手部、全身姿态与动作语义标准化处理 → SimFoundry将人类数据转化为机器人可执行任务 → RoboFinals验证数据学习价值并定位失败模式 → 评测结果反馈下一轮数据采集。
随着具身智能从单点技术验证迈向规模化发展,行业竞争已经从单一的模型能力比拼,延伸到底层基础设施与标准体系的建设。目前已经形成两大核心基础设施主线:一条是以EgoVerse为代表的数据基础设施,定义高质量具身人类数据的采集、组织、处理、共享与持续迭代规则;另一条是以Newton为代表的物理仿真基础设施,定义机器人如何在遵循真实物理规律的仿真世界中完成训练、验证与评测。
Newton由NVIDIA、Google DeepMind和Disney Research联合发起,由NVIDIA、Google DeepMind、Disney Research、光轮智能和Toyota Research Institute(TRI)五家企业共同组成技术指导委员会(TSC),持续定义机器人仿真与物理建模的技术路线,正逐渐成为全球具身智能的重要物理仿真基础设施。
前者解决了机器人从何处获取可规模化的学习经验的问题,后者解决了这些经验如何在物理世界中复现与验证的问题,数据与仿真共同构成了物理AI迈向规模化发展的两大核心底座。
值得关注的是,光轮智能是目前唯一同时参与这两套国际标准体系建设的中国企业。在EgoVerse中,该公司带来了贯穿人类数据生产全流程的质量体系,将人类数据质量从依赖人工抽检与经验判断,升级为可定义、可比较、可验证、可持续优化的工程标准;在Newton中,光轮智能参与了物理求解、仿真资产、机器人训练与评测等核心能力建设,推动真实世界的物体、任务与物理过程转化为机器人可交互、训练与验证的仿真基础设施。
这意味着,光轮智能参与定义的不再是单一的数据格式或仿真工具,而是连接真实世界数据、物理仿真、模型训练与能力验证的底层标准体系。如果说ImageNet为视觉AI建立了统一的数据基础设施,那么EgoVerse与Newton则分别从数据与仿真两个维度,为物理AI打造了全新的全球基础设施。光轮智能同时参与两大体系的建设,标志着中国企业已经从全球标准的使用者,逐步成长为物理AI底层基础设施规则的共同定义者。


