人类经验数据:具身智能的新规模化增长轴

近期前沿AI模型的突破性进展,正在打破数字世界与物理世界的边界。9月初,头部AI实验室推出的新一代大模型,在通用自主决策基准测试中拿下99.9%的得分,96%的关卡表现超过人类平均水平;仅仅一天后,该模型被接入真实双臂机器人,在抓取积木放入碗具的任务中实现了20次尝试19次成功的亮眼表现。这一系列结果释放出明确信号:最先进的大模型正在从单纯的文本交互,转向感知环境、规划行动并完成物理任务的具身智能赛道。
当AI不再只是回答问题,而是需要在真实物理空间中完成操作,训练数据的形态也随之发生根本性改变。过去大模型依托互联网文本数据实现能力跃升,而具身智能长期受限于真机数据采集成本高、积累速度慢,且高度绑定特定机器人硬件本体的痛点。今年以来,行业逐渐找到了新的规模化训练路径:基于人类第一视角的经验数据。
今年八月,某机器人公司将人类第一视角经验数据的训练规模推进到100万小时级别,其推出的模型在未见过的机器人任务中展现出更强的泛化能力;另一家机器人基础模型厂商也采用了同类数据,将真实人类活动中的视觉、动作与交互过程纳入训练。据行业观察,一场围绕第一视角人类经验数据的浪潮正在兴起,越来越多机器人公司转向采集人员佩戴摄像头产生的第一视角视频,甚至有投资人预计领先企业未来几年将采购数亿小时的这类数据。
在这一轮第一视角数据的浪潮中,一家专注于物理AI数据服务的公司逐渐成为行业核心供应商。这家2024年成立于旧金山湾区的团队,核心成员来自Waymo、Meta、Google、QCraft、小鹏汽车、博世等自动驾驶与AI领域的头部企业,具备从数据采集、清洗、算法到模型训练的完整工程能力,已经将数据服务覆盖到六大洲,并在今年进入中国市场。
截至目前,该公司搭建了覆盖全球的采集网络,累计积累超过150万小时带手部追踪和语言标注的高质量训练数据,历史累计向客户交付的数据总量超过200万小时。它不仅是头部机器人模型的独家数据合作伙伴,也为多家机器人企业、大模型厂商提供第一视角数据服务。
这家公司能在具身智能数据赛道站稳脚跟,靠的并非只是庞大的原始数据储备,而是一套完整的自动化数据加工流水线。依托团队在自动驾驶领域积累的数据闭环技术,他们将这套能力迁移到物理AI领域,搭建了从数据采集、质量控制、语义理解到模型训练交付的全链路基础设施。相关企业的技术报告中曾指出,人类执行真实任务时产生的带传感记录的视频,规模几乎没有上限,同时包含了机器人操作策略所需学习的世界动态和手物交互信息。换句话说,机器人要获得类似互联网数据规模的训练资源,未必需要等待机器人自身工作数亿小时,而是可以先学习已经在人类世界中运行了无数年的经验库。
当数据规模跨过百万小时大关,单纯依靠堆量的边际效益已经开始递减,具身智能的数据竞争底层逻辑正在改变。该公司的核心思路不再是追求每月新增的采集时长,而是解决人类数据与机器数据之间的跨本体差异,将其转化为可通过流程和算法解决的工程问题。根据他们的观察,未来具身智能的数据能力将沿着两个核心方向演进:
其一为经验规模。机器人需要接触足够丰富的人类活动、环境、物体和任务,才能形成对物理世界的通用理解。因此数据规模依然是重要基础,行业正从百万小时向千万甚至更大规模迈进,让人类日常经验成为训练通用机器人模型的核心支撑。但单纯的规模扩张也会带来新问题:如果新增数据只是重复已有场景,数量增长并不会带来同等程度的能力提升。
针对这一问题,该公司提出了主动规划的采集模式,通过内部的Agent平台对现有数据池进行反向诊断,像雷达一样锁定数据分布的盲区。一旦发现稀缺环境、罕见物体或是复杂的受力动作,就会调度全球的采集人员和专业设备进行定向补采,比如补充厨房长尾物体的采集、柔性物体操作数据,或是复杂受力状态的任务录制。同时这套流水线自带智能清洗功能,可以自动识别并剔除无效片段、摆拍素材和视角偏移的低质数据。
其二为经验密度。一小时的人类操作视频,不同的加工方式能带来完全不同的训练价值。基础的数据只能告诉模型手移动到了某个位置,而更高价值的数据则包含手部姿态、身体协同、物体状态变化、人与环境的接触关系以及动作时间节奏等多维度信息。这些信息越丰富,模型能学习到的物理规律就越多。
因此,在数据采集完成后,如何进一步理解、拆解和加工原始人类经验,将其转化为机器人真正可以学习的训练信号,决定了数据价值的上限。该公司自研的核心AI引擎MaxVLM,正是针对具身场景强化的视频理解大模型,负责从原始视频中提取高阶语义信息。据透露,MaxVLM在具身场景下的语言标注和视频理解能力,可以对标公开的顶级视频理解模型,但推理成本仅为其十分之一,这种成本控制力是支撑百万小时数据量产的关键。
在一段演示中,这套系统并不会为视频打上笼统的文字标签,而是构建起严密的多层级数据结构:从环境场景、主任务,到细分的子任务流程,再到精细化的微操指令,完整保留了人类操作过程中的空间、动作与时序信息,让视频变成可以直接用于学习物理交互规律的训练数据。
为了还原真实的手部运动轨迹,该团队沿用了自动驾驶领域的SLAM算法:先持续估计摄像头自身在三维空间中的位置与姿态变化,再将每一帧中的手部位置统一映射到同一个世界坐标系中。这样可以剥离头部晃动和相机位移带来的干扰,即使视频中存在手部遮挡或镜头晃动,也能保持稳定的空间坐标追踪,得到接近真实动作的双手运动轨迹。
当这套自动化基础设施完全贯通,数据飞轮便开始循环运转:更智能的主动采集带来更强的模型理解能力,进而提升自动质检与标注精度,降低数据的边际生产成本,最终实现更大规模的人类经验数据产出。当多数同行还在讨论采集的总时长时,该公司已经率先引入了工业领域的核心概念——Yield(良率)。
在半导体制造领域,合格芯片的产出占比是衡量产能和工艺壁垒的核心标准;而在机器人数据赛道,数据良率指的是从真实物理世界采集的原始数据中,能够转化为模型可用的有效训练数据的比例。该公司依托自建的数据工厂,将数据集的良率提升到了98%,这意味着每采集100小时的原始视频,就能得到98小时可直接用于训练的高质量数据。
目前积累的150万小时精品数据只是序章,该公司已经定下了新的目标:在未来积累超过1000万小时的高质量可直接训练数据。他们希望将这些从未被结构化记录的人类日常经验,打造成物理AI可以持续消费的通用基础设施,未来还将通过视频理解和智能检索体系,将原始视频转化为可搜索、可组合的数据资产,并结合仿真数据进一步拓宽训练数据的边界,最终成为能够持续理解真实世界、发现数据缺口并生产机器人所需物理经验的核心引擎。

