文章摘要
近日,光轮智能在2026世界机器人大会上宣布面向全行业开源10万小时全模态人类行为数据集EgoSuite-Open100K。此前DYNA-2模型证明高质量人类行为数据是具身智能训练核心资源。此次开源打破数据壁垒,该数据集规模大、全标注、广覆盖,配合光轮智能的仿真和评测体系,构建了完整具身智能生态,未来还计划共建100亿小时训练数据。

近日,具身智能领域迎来一项突破性的开源成果,这一进展直接刷新了行业对机器人训练路径的认知。

不久前,一家专注具身智能的科技团队推出的DYNA-2模型引发了全行业的震动。这款模型的核心创新在于,预训练阶段完全没有使用机器人自身的动作数据,而是通过超过100万小时的人类第一视角日常行为视频完成训练——换算下来,相当于一个普通人不间断学习170年的日常活动量。

训练效果呈现出清晰的幂律增长趋势:从1000小时到100万小时,每增加一个数量级的训练数据,模型的智能水平就会稳步提升,且没有出现明显的性能瓶颈。这意味着物理AI领域终于拥有了属于自己的扩展定律。

这一发现彻底颠覆了行业认知:此前大家普遍认为GPU算力和算法是机器人训练的核心瓶颈,但DYNA-2的成果证明,高质量的人类行为视频数据才是具身智能训练最稀缺的资源。谁掌握了这类数据,谁就掌握了物理AI时代的核心资产。

不过一个现实的问题随之而来:行业内已经有团队验证了数据扩展的规律,但支撑到关键拐点所需的海量数据,大多被各家企业锁在自己的服务器中,无法对外共享。直到光轮智能的这次开源发布,才打破了这一数据壁垒。

在2026世界机器人大会上,光轮智能正式宣布:面向全行业开源10万小时全模态人类行为数据集EgoSuite-Open100K。该数据集与全球知名开源AI社区联合发布,首批数据已上线开源平台,无论是学术研究还是商业训练,都可以免费获取和使用。

作为目前全球规模最大的全标注开源第一人称人类数据集,这套被称为具身智能领域“最贵资产”的数据集,首次将核心训练数据摆在了所有从业者面前。

消息发布后,全球开源AI社区迅速引发热议,官方账号直接转发了本次开源公告。据了解,该社区官方账号极少为第三方项目单独站台,此前只有太阳物理模型、大型图文数据集、顶级图像生成模型等赛道标志性开源事件才能获得这样的待遇,而EgoSuite-Open100K获得的支持级别与这些标志性项目完全一致。

不仅如此,该社区旗下的机器人专项项目也发布长帖力挺,称“如此规模的数据集公开上线,对整个行业都是巨大的利好”。机器人领域的专业博主也跟进解读了数据集的多视角特性,认为这是训练灵巧操作任务不可多得的高质量素材。新加坡国立大学的助理教授也评价道,开源正在成为具身智能领域新的竞争护城河。

那么为何这次开源选择了10万小时这个节点?这一数字背后,是过去一年具身智能领域多项硬核研究的结论支撑。

早在2026年,某头部科技企业发布的EgoScale框架就通过2万余小时的第一视角人类视频训练VLA模型,首次在具身智能领域绘制出清晰的对数线性扩展曲线:人类数据的时长与模型验证损失呈显著对数线性关系,相关系数R²达到0.998,在22自由度灵巧手上的平均操作成功率提升了54%。

后续的多项研究进一步验证了这一规律:更多的人类示范数据、更广泛的真实场景覆盖,都能直接提升机器人动作模型的性能,而且这种提升可以被精确测量和预测。

包括Generalist AI通过27万小时的物理交互数据训练出GEN-0模型,以及ALOHA的研发团队证明人类示范数据可以脱离实验室环境,在真实家庭场景中大规模采集。而DYNA-2团队的核心发现则是,跨具身迁移的关键拐点落在1万到10万小时之间:当训练数据低于1万小时时,机器人只能在特定场景下完成固定任务,换一个环境或稍微调整参数就会失效;当数据量突破1万小时后,模型开始具备跨场景迁移的能力;而到了10万小时这个级别,跨具身迁移的效果已经变得明确且稳定,也就是行业常说的机器人“开窍”的临界点。

遗憾的是,目前绝大多数团队手中的训练数据都远未达到这个量级,这导致虽然大家都知道数据扩展的规律,但只有极少数企业有能力验证和落地。光轮智能这次开源的10万小时数据集,正好精准踩中了这个关键拐点。

要打造10万小时的高质量人类行为数据集,并非简单开启摄像头录制就能实现。数据采集领域一直存在规模、多样性和标注质量的“不可能三角”:一味扩大采集规模,场景覆盖就会变窄;如果想要覆盖更多场景,标注的深度和成本就会指数级上升;而如果追求精细化标注,采集规模又很难提上来。

光轮智能的解决方案是在采集阶段就提前设计好多样性标准,而非事后筛选。团队按照统一的规范执行采集流程,从场景选择到任务设定,每一个环节都严格围绕覆盖目标进行规划。最终采集到的数据集包含超过15000个独立物理场景,每个场景的布局、物体摆放和光照条件都各不相同;同时覆盖了15000余项具体任务,涵盖家居、餐旅、零售、运动、物流、办公、工业7大类环境,128种细分场景类型和18大类任务范畴。

从厨房备菜到工业装配,从库存盘点到工具维修,这套数据集覆盖了机器人未来可能落地的绝大多数真实场景,而目前公开可用的第一人称数据大多集中在家庭厨房和日常活动,独立场景数量仅为这套数据集的零头。更重要的是,这些场景正是当前公开数据集的空白地带,也是机器人落地真实工作的核心需求场景。

10万小时是数据集的“量”,而真正决定其价值的是“质”。EgoSuite-Open100K是目前全球唯一同时具备大规模、全标注、广覆盖特性的第一人称人类数据集,其标注体系分为三层:

  • 手部位姿标注:逐帧标记21个手指关节点,让模型精准掌握手指的弯曲、捏合等动作细节;
  • 身体位姿标注:记录全身的动作姿态,帮助模型理解如何协调身体完成伸手、弯腰等整体动作;
  • 事件级语义标注:明确每一步操作的具体内容和涉及的物体,让模型理解动作背后的逻辑。

三层标注叠加在一起,让模型既能学会“如何动手”,也能理解“为什么这么做”。

此外,数据集还包含两种采集视角:主体的EgoStandard采用头戴式摄像头,还原人类的第一视角视野;而EgoPro则额外增加了腕部摄像头,专门捕捉手指接触物体瞬间的细节——这类细节在头戴视角中往往会被手臂遮挡,比如手指触碰螺丝的角度、捏住袋口的力度、插入卡槽的时机等,都是训练灵巧操作的关键信息,而这类带腕部视角的公开数据极为罕见。

最难能可贵的是,这套数据集的标注质量远超同量级的其他公开数据。由于头戴视频存在抖动问题,加上双手关节复杂且经常被遮挡,位姿标注的难度极大,团队在标注流水线上投入了大量的研发资源,解决了抖动和遮挡带来的标注难题。这也是为什么这套带全模态信息的数据集,质量远高于仅公开原始第一视角视频的数据集。

当前具身智能行业面临的最大问题,不仅是数据总量不足,更是各家采集的数据无法互通共享:不同团队使用的采集设备不同、标注规范不一、数据格式和时序组织也存在差异,即使将不同来源的数据放在一起,模型也无法有效学习。

EgoSuite-Open100K的开源,首先解决了这个行业痛点,让所有从业者都能站在统一的数据基础上开展研究。光轮智能作为EgoVerse全球人类数据委员会成员,正与斯坦福、ScaleAI等顶尖高校和机构一起,通过开放生态共建人类数据的标准,让人类行为数据真正成为机器人持续学习的“言传身教百科全书”。对于研究人员来说,这是首次拥有一套公开、全标注、可复现的人类数据基准,此前不同团队的研究结论往往因为数据集规模和标注的差异无法对齐,而这套数据集将成为全球统一的评测坐标系。

有了高质量的训练数据,机器人就能真正学会人类的行为吗?答案并非如此简单。人类视频提供的是行为先验知识,而仿真平台则为机器人提供了规模化试错和优化的环境。光轮智能全栈自研的SimFoundry仿真平台,正是连接数据训练和真实落地的关键技术基石。

其工作流程分为四个步骤:首先从人类行为数据中提取任务定义、动作序列、手部位姿和事件边界,形成可复现的任务标准;随后将真实物体的材质、接触关系和任务逻辑映射到仿真环境中,在不同场景、物体状态和物理扰动下反复训练模型;系统会记录模型的任务成功率、轨迹偏差、完成时间、碰撞情况和失败类型;最后通过真实场景回放校准仿真结果,验证模型在仿真中的性能提升能否顺利迁移到真实任务中。

这样一来,人类数据解决了“机器人应该学习什么”的问题,仿真平台解决了“如何规模化巩固学习效果”的问题,而规模化评测则回答了“模型到底提升了多少”的问题。而RoboFinals就是这套规模化评测体系的核心。

机器人训练完成后必须经过严格测试才能落地,而传统的真机评测不仅需要2-3周时间,成本高达50万元以上,还存在极大的安全风险——未成熟的模型在真机上测试可能损坏设备甚至造成人员伤害。

RoboFinals依托SimFoundry物理仿真平台,将评测流程搬到虚拟环境中:一轮测试可以压缩到小时级,成本大幅降低,且不会带来真实安全风险。同时,平台支持数千个测试实例同时运行,且通过标准化任务定义和固定随机种子,确保不同团队、不同时间的测试结果可以直接横向对比,解决了当前行业评测结果“各说各话”的问题。

具身智能的产业化落地,需要同时回答三个核心问题:能否大规模量产、能否稳定完成任务、能否在复杂环境下持续工作。具身智能是一个复杂的系统工程,本体硬件、模型算法、环境条件和任务流程任何一个变量变化,都可能导致结果完全不同,因此评测的维度也需要更加全面。

RoboFinals不仅关注任务是否完成,还会评估模型在不同成功率下的稳定性、性能退化的触发条件和边界、失败的具体原因、版本迭代后的性能回归情况,以及仿真环境与真实场景的偏差程度。

回到本次开源的核心成果,EgoSuite-Open100K背后其实是光轮智能构建的完整具身智能生态:人类数据是教材,仿真平台是练习场,评测系统是考场,真实部署是落地应用,而落地中遇到的问题又会反过来推动数据的补采和优化,形成完整的Real2Sim2Real持续学习闭环。

另一个值得关注的细节是光轮智能在国际标准领域的布局。该公司不仅是EgoVerse全球人类数据委员会的成员,与斯坦福、Scale等机构共同制定人类数据采集标准,同时也是Newton仿真技术委员会的成员,与英伟达、谷歌DeepMind、迪士尼研究院、丰田研究院等企业共同制定仿真技术标准。作为这两大国际具身智能标准委员会中唯一的中国企业,光轮智能制定的EgoSuite数据集完全符合国际标准,能够与其他成员的数据无缝衔接,避免成为孤立的数据孤岛。

仿真标准决定了机器人“怎么学”,数据标准决定了机器人“向谁学”,同时掌握这两大标准话语权的中国企业,目前只有光轮智能一家。

过去几年,具身智能领域最珍贵的资产始终是这类未公开的人类行为数据,它直接决定了机器人能学到什么、学到什么程度,也决定了哪些团队能够真正进入这个赛道的第一梯队。

今天,10万小时的公开训练教材已经摆在了所有人面前,但这仅仅是开始。光轮智能同时公布了更长远的计划:未来5年,计划共建100亿小时的具身智能训练数据。为了实现这一目标,团队将重点推进三件事:统一不同设备的数据采集标准,实现数据跨设备、跨任务复用;从模型失败案例中定位数据缺口,定向补采和生成数据,形成评测驱动的数据闭环;推动数据与模型协同设计,优化仿真数据、人类数据、遥操作数据和强化学习数据的组合方式。

这意味着光轮智能不仅要打造自身的持续学习闭环,更要联合全行业伙伴共建开放的具身智能生态。正如光轮智能创始人兼CEO谢晨博士在世界机器人大会主论坛上所说:“人类文明来源于群体智慧,机器人的文明也不应由一家公司创造。”

从10万小时到100亿小时,这五个数量级的跃升,将是人类与机器人共同创造的全新文明。当通用人工智能从虚拟世界走进物理世界,它需要先看懂人类如何端起一杯水、如何在遮挡中摸到一颗螺丝、如何在出错后自主纠正。这些动作人类已经练习了数百万年,早已刻进肌肉记忆和本能之中,而机器要掌握同样的能力,只能通过一小时一小时地观看、一帧一帧地学习。

所谓100亿小时的目标,本质上就是将人类数百万年积累的身体经验,翻译成机器能够理解的语言。这个过程没有捷径可走,而10万小时,正是这本“机器人教科书”的第一页。

以上内容不代表本平台立场,仅供读者参考