AICon深圳站启幕 智元IPO/OpenAI漏洞/卡帕西Opus 5全解析

近期,国内机器人企业联合海外科研机构推出了一款全新的L5级多模态具身物理智能数据集ACE-Data-0,这套数据集依托自研的环境式采集引擎,基于全球首创的具身模型信息密度定律打造,旨在为通用物理智能的落地提供高质量的数据支撑。
当前的具身智能训练数据存在诸多局限:普通视觉视频只能记录表面的动作,无法准确呈现接触时机、力度变化、物体运动轨迹以及动作间的逻辑关联;而实验室采集的动作捕捉数据又缺乏自然的场景遮挡、第一人称视角、音频和触觉信息,且大多只能支撑数秒的单步动作,难以覆盖家庭场景中长达数十分钟的长时序任务。
不同于传统的具身数据,ACE-Data-0突破了L1到L4级数据的局限,达到了L5级标准。它不仅记录了接触压力、自然的操作犹豫与恢复过程,还纳入了真实家庭场景中的开放行为变量,通过桌面尺度和房间尺度两套互补的采集系统,将日常家居环境转化为标准化的具身数据采集场景,让真实的生活交互直接成为机器人学习物理世界的训练素材。
具体来说,ACE-Data-0包含1700万帧视频、200个任务类别、50名参与者、2个真实家庭场景以及7.5万个交互片段,覆盖了原子级人-物交互、长时序家庭场景活动链以及人与场景交互三大类内容。同时,数据集同步采集了第一人称视频、多视角第三人称视频、全身与手部运动数据、物体六自由度轨迹、多通道音频和触觉信号,并将所有模态统一对齐到同一时间线和空间坐标系,完整保留了人类感知、行动、接触与环境变化的连续过程。
为了兼顾精细手部操作和房间尺度的长程活动,采集引擎设计了两套互补配置。桌面尺度系统面向精细化的手-物交互,在操作区域周围布置多视角摄像机、光学动作捕捉设备和触觉装置,重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触细节;房间尺度系统则覆盖厨房、餐厅、客厅、卧室等完整家居空间,通过广基线摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动以及不同场景位置的连续交互。
两套系统共享统一的采集、同步、标定、质检和标注流程,前者聚焦“手与物体如何精细交互”,后者解答“人如何在完整环境中规划并完成任务”。采集过程中,参与者佩戴第一人称设备,系统同步记录多路视频、运动传感器数据、全身运动和手部关节状态,多视角外部摄像机则补足第一人称视角中容易被遮挡的身体和环境信息,让每个活动时刻都能从多个视角同步观察,并与可度量的人体、手部和物体状态对应。
多模态数据的核心挑战不在于设备数量,而在于不同设备的数据能否准确对应。不同采集设备往往拥有独立时钟和不同采样频率,哪怕几毫秒的偏差,也会出现画面中手尚未接触物体但触觉信号已经触发的问题;如果没有统一的空间基准,也无法准确建立各设备间的几何关联。
ACE-Data-0通过时间同步和空间标定,将视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并将外部摄像机、第一人称设备、人体、双手和物体配准到共享世界坐标系,让每次采集的数据流不再是零散的信息组合,而是对同一物理过程的完整记录。研究者可以直接通过某一视频帧找到对应的人体姿态、物体位置、接触压力和声音变化,也可以对比第一人称和第三人称视角下的同一事件。
此外,数据集还提供了相机参数、同步时间线、人体与手部状态、物体网格与六自由度位姿、边界框、运动轨迹、手-物接触信息,以及与物理时间线对齐的自然语言描述,大量标注直接来自标定后的采集系统,而非依赖模型事后估计,让数据在遮挡、快速运动和长时序任务中拥有更稳定的一致性。
ACE-Data-0覆盖了三类互补任务。第一类是原子级人-物交互,单次时长约3分钟,包含倒水、清洗、擦拭、切割、折叠、整理等单项操作,最短序列也以分钟为单位,而非传统数据中常见的数秒片段;第二类是由多个原子动作组成的长时序家庭场景活动链,可持续20到30分钟,比如从打开冰箱、取出食材,到清洗、切配、烹饪、装盘再到收拾的完整流程;第三类是人-场景交互,时长约5分钟,包含移动、坐下、锻炼、开关家具、取放物品和姿态转换等内容。
与严格规定每一步动作的脚本式采集不同,ACE-Data-0采用目标级指令,参与者只需要知晓最终任务目标,不需要遵循固定流程,可以自由选择物品、操作顺序和移动路径,也可以在过程中犹豫、调整计划、返回上一步或处理突发状况。比如整理房间时,有人会先收拾桌面,有人会先整理沙发;准备食物时,不同参与者也会选择不同的工具和操作顺序。这些在标准化采集中可能被视为噪声的差异,恰恰是机器人进入真实家庭场景时必须理解的现实。
长时序任务的难点也不止于视频时长更长,之前的操作会改变后续可执行的动作,物体可能离开视野后再次出现,子任务可能中断、重排或在其他位置继续,模型需要持续记住任务目标、物体状态和已完成的步骤,而不能将活动视为一串独立的动作。ACE-Data-0保留了这些自然变化,让数据不再只是理想化的动作模板,而是记录了人类真实完成任务时的规划、调整和恢复过程。
基于ACE-Data-0,研发团队构建了从底层信号到具身交互理解的三级评测基准。第一级是底层信号推断,考察模型能否从视觉观测中预测接触与触觉信息;第二级是场景组成要素恢复,评估模型在遮挡、复杂姿态和持续运动下恢复人体与手部运动状态的能力;第三级是具身交互理解,要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整的手-物交互过程。
研发团队对30多种代表性方法进行了评测,结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时序任务中仍存在明显的能力缺口。这套基准不仅判断任务最终是否成功,更试图拆解模型失效的具体环节:一次失败可能源于未感知到接触,也可能来自物体状态估计错误、任务上下文丢失、动作顺序理解偏差或手部运动恢复不准确,分层评测可以帮助研究者明确模型已经掌握的能力和存在的短板。
ACE-Data-0的价值不止于提供评测基准。由于所有模态都处于统一的时空框架中,它可以服务于模仿学习、机器人策略学习、世界模型、视觉-语言-动作模型以及人类示范向不同机器人本体的迁移。
研发团队表示,具身数据建设不能只追求数据量和轨迹数,更需要保留真实世界中的物理联系、任务结构、接触反馈与状态演化。“ACE-Data-0”中的“0”代表这套具身数据体系的起点,未来团队将继续围绕具身数据引擎、通用具身基础模型、世界模型和视觉-语言-动作模型推进研发,并与研究机构、开发者及产业伙伴共同探索从人类自然行为到机器人通用能力的可拓展路径。
从“看见动作”到“理解行动”,从孤立视频到连续物理过程,ACE-Data-0正在为具身智能搭建更贴近真实世界的数据入口,让每一次真实生活中的感知、接触与行动,都成为机器人理解物理世界的训练信号。


