文章摘要
当前具身智能行业存在巨大数据缺口,现有产业布局多聚焦机器人手部操作数据采集,普遍忽视机器人本体与环境交互的腿部移动数据,形成结构性数据鸿沟。这类数据仅能由机器人真机在真实场景采集,受多重约束难以补足,本末科技推出多款适配不同场景的轮足采集载体,指出能抵达复杂场景的机器人载体才是当前具身智能最稀缺的资源。

前几天在小区业主群里看到一则兼职招聘,标题是居家靠谱的AI数据采集副业,这类岗位其实已经不算新鲜了。早在今年5月就有行业报道过一批居家数据采集人员,他们佩戴采集手套、头戴相机,在家中完成择菜、叠衣服、开抽屉等动作并录制视频,卖给训练机器人的企业。据相关数据服务商透露,其百人规模的采集团队中宝妈占比接近六成,居家岗位月薪在3000到4000元之间,社交平台上流传的单日薪酬多在百元上下,时薪约25元。

具身智能行业对数据的渴求可见一斑,但仔细观察会发现一个被忽略的细节:这类兼职采集到的几乎全是机器人末端执行器也就是手部的动作数据,完全忽视了机器人本体与环境交互的运动数据。

目前全球具身智能领域的数据缺口已经有明确的测算:截至2026年初,全球高质量的真实物理交互数据总量仅约50万小时,还不到大语言模型训练语料的两万分之一。而行业普遍认为,训练出真正可用的通用具身模型,至少需要千万小时量级的优质数据。

巨大的缺口吸引了资本和行业巨头纷纷布局:今年3月,国内具身数据领域的头部企业完成合计10亿元融资,估值突破10亿美元成为全球首个具身数据独角兽,目前估值已超20亿美元;另有企业搭建了国内规模最大的实体数据采集训练场,单日可产出上千小时数据;还有企业将数据业务拆分独立运营,成立仅十天就拿到数亿元的早期融资;更有平台宣布将发动数十万人,在两年内积累千万小时的真实场景数据。

业内曾用“机器人本体还没赚到钱,卖铲子的先成了独角兽”来总结今年上半年的具身赛道现状。

目前主流的数据生产工具路线基本可以分为四类:

  • 真机遥操作:操作人员通过主臂实时复刻远端从臂动作,搭配毫秒级力反馈,数据质量最高但成本也最为昂贵

  • 动捕穿戴:将传感器穿戴在操作人员身上,降低了采集成本,但由于人与机器人的构型存在差异,需要进行数据重定向处理

  • 人类行为视频:采集规模最大、成本最低,但无法获取位姿、力矩、触觉等精确的标注信息

  • 仿真合成:数据生成速度快、成本仅为真实数据的百分之一,但存在仿真与真实环境的域差异问题

这四类采集路线的核心对象高度一致,都是机器人的末端执行器,也就是手部。这不难理解,抓取、装配、分拣、开门等动作最容易拆解为任务、标注和商业化验证,数据工厂搭建的仓储、家庭、酒店、零售等场景,本质上都是为手部操作设计的舞台。

但所有这些都有一个最基础的前提:机器人要完成任何一项真实工作,首先得抵达工作现场。

腿式机器人数据集的稀缺现状

如果只关注国内市场,很容易将这种数据偏向性理解为阶段性的资源分配问题,认为资金会先流向最容易变现的方向,后续自然会补上缺口。但将视野拓展到全球,会发现这其实是一道结构性的数据鸿沟。

2023年,谷歌DeepMind联合21家机构发布了Open X-Embodiment数据集,将60个既有数据集整合为统一格式,包含超过100万条真实机器人轨迹、22种机器人本体以及527项技能。这一数据集是过去三年具身领域被引用最多的基础设施之一,几乎所有主流的VLA模型都在它或其衍生集上进行过预训练。但该数据集仅聚焦于机器人操作任务,虽然包含四足平台,但技能清单仍以抓取、推送、开关动作、擦拭、装配等手部操作类动作为主。

与之形成鲜明对比的是今年2月苏黎世联邦理工学院机器人系统实验室联合牛津大学发布的GrandTour数据集。研究团队使用一台ANYmal-D四足机器人,搭载7.1公斤重、功耗120瓦的多模态传感器套件,在阿尔卑斯山地、森林、拆迁建筑和城市街区等场景开展采集工作,同步记录了十台相机、三台激光雷达、多组不同等级的IMU以及12个关节编码器的数据,还通过RTK-GNSS与徕卡全站仪获取了毫米级精度的真值轨迹。

该论文称这是迄今为止规模最大的公开腿式机器人数据集,但其总时长仅为49段任务,每段3到7分钟,累计略超过5小时,总行走距离超过10公里。论文中也提到,适用于腿式机器人的公开数据集依然稀少,研究者往往只能自行采集小规模、缺乏代表性的实验数据,或是退回到仿真环境中开发状态估计、建图与感知-动作方法,但这些方法未必能泛化到真实复杂场景中。

机器人本体与环境交互的运动数据虽然稀缺,却有着不可替代的重要价值

具身数据可以分为两个核心维度:其一为感知与操作维度,通过相机、激光雷达、触觉传感器记录环境状态与手部对物体的操作,这一维度已经被数据工厂、遥操作系统和居家采集人员的手套密集覆盖;其二为本体与环境的交互维度,包括机器人在何种地面以何种姿态移动、关节输出的力矩大小、机身承受的冲击与振动、轮子在何种坡度开始打滑、越障时重心如何转移等。

以GrandTour数据集的传感器记录为例,关节位置、速度、接触力甚至运动策略的隐藏状态都被逐帧保存下来。这些数据并非运动控制的中间产物,本身就编码了大量关键信息,可以作为模型训练的核心素材。一个没有见过这类数据的模型,或许可以学会拿起杯子,但无法掌握踩上松动钢板时的应对策略。

那么,该如何获取机器人本体与环境交互的运动数据呢?一个核心结论是:这类数据只能由机器人自己在真实环境中跑动采集。

举个简单的例子,居家采集人员可以佩戴手套演示如何拧开瓶盖,但无法模拟一台30公斤的机器人以2米每秒的速度冲上磨损严重的金属坡道时各关节的受力情况。人类的腿部与机器人腿部在构型、质量分布、驱动方式上存在巨大差异,动作捕捉重定向在操作数据上尚且勉强可用,但在整机动力学层面基本失效。

这类数据也无法通过后期标注补齐,标注的前提是原始记录已经存在,而力矩曲线和接触事件只会在机器人真正接触地面的那一刻产生。

因此,当前行业在这类数据上遇到的困难,本质上并非人力不足,而是可用的采集载体不足

三重结构性约束,无法通过增加人力解决

既然这类数据如此重要且有价值,为何迟迟无法补足?正如本末科技总结的那样,这源于三重叠加的结构性约束。

第一重约束是仿真固有限制。仿真环境可以近乎完美地复刻物体的几何外观,渲染效果也足够真实,但物理属性的复现始终是难以跨越的鸿沟,机器人学界称之为“现实鸿沟”。2017年OpenAI提出的域随机化、后续ETH团队发展的执行器网络辨识、以及近年流行的关节空间动力学拟合,都是为了绕开这一难题的尝试。方法的多样性恰恰说明了问题的顽固程度:地面摩擦系数、材料形变、接触冲击、轮胎打滑等参数在仿真中通常以固定值给出,但在真实世界中,这些参数会随温度、湿度、磨损和污染持续变化。今年5月的一项针对四足轮腿机器人的研究,甚至将复杂地形高程与物理摩擦视为“无法观测的外部状态”,通过历史本体感受信号进行隐式估计。而GrandTour数据集发布后,最快被应用的方向之一就是改进sim-to-real迁移与真实环境的real-to-sim重建,这也说明连算法本身都默认,这些物理参数只能从真机数据中学习,而非从仿真环境中读取。

第二重约束是载体约束。台阶、斜坡、泥泞地、带有跨线和油污的工业地面、灾后废墟等场景,正是最需要交互数据的工况,但也是大多数轮式底盘无法进入的区域。载体无法抵达,对应工况下的交互数据就永远无法产生。这是一条硬约束,无论增加多少人力、投入多少预算都无法绕过,因为这些场景缺少的不是记录能力,而是抵达能力。

第三重约束是机型约束。大量专用机器人都是为单一场景定制的,更换环境就需要重新改造硬件。对于需要跨场景采集的团队来说,每进入一个新场景都要重新经历选型、改装、调试、验证的流程,时间与资金成本极高,采集半径被牢牢锁定。

将这三重约束叠加,可以得到一个令人深思的结论:载体的物理上限,就是训练数据的上限。一台只能在平整地面工作的机器人,无论运行多久,都无法产出台阶与泥泞地上的运动数据,对应的模型也就无法掌握在这些地形上的移动策略。

一家做电机的公司,站在了这个问题的前沿

该如何破解这些约束呢?本末科技给出了一套独特的解决方案,其切入的方向也与主流赛道不同。

本末科技成立于2020年,创始人毕业于香港科技大学,师从业内知名专家。公司最初的技术选择相当激进:舍弃机器人关节中的减速器,采用直驱方案让电机直接输出扭矩,以此换取更低的噪音、更长的使用寿命和更低的故障率。

这一技术路线走通后,本末科技在消费级机器人动力模组市场占据了稳固的领先地位,是全球首家且唯一出货量超过500万套的企业。2026年6月,本末科技通过港交所主板上市聆讯,正冲刺港股上市。

如今的本末科技虽然主要依靠销售电机盈利,机器人整机业务仍处于起步阶段,但机器人整机业务正是其切入数据问题的关键业务线。从2021年开始,本末科技陆续推出了刑天、TITA、D1三代轮足机器人产品。

轮足路线的核心优势在于融合了轮式的高速移动能力与足式的地形适应能力:在平整地面使用轮子快速行进,遇到台阶、沟壑等复杂地形则切换为腿部模式。本末科技的招股书中提到,轮足形态是具身智能机器人必不可少的下肢配置,具备比人形机器人更强的通用性,这一判断与当前主流的人形机器人叙事有着明显差异。

过去两年,具身智能领域的注意力几乎全部集中在上半身,包括灵巧手、双臂协同与抓取策略。而本末科技将研发重心放在下半身,其核心理由是通用机器人的通用性最终受限于抵达能力,而非操作能力。这一判断是否成立仍需时间验证,但却与本文此前的所有推演指向了同一方向。

从电机制造到整机研发,本末科技走的是“部件-整机”双向验证的路线:零部件降低整机的研发门槛,而整机在真实场景中采集到的负载、续航、动态响应数据,又反过来驱动零部件的迭代优化。这一闭环原本是为产品商业化服务的,但却意外产生了一个极具价值的副产品:一批可以在非结构化地面持续运行,并完整记录自身运行状态的采集载体。而这正是此前三重约束中最缺失的部分。

刑天:科研开发数据采集载体

刑天机器人面向科研开发场景,全身由6个直驱关节驱动,核心性能指标包括站立载重4公斤、最高跳跃8厘米、最高行进速度2米每秒,横滚角控制范围±37度,16位编码器带来0.01度的稳态误差。

其真正对科研有价值的部分在于开放的软硬件设计:直驱关节省去了减速器,力矩传递路径更短,关节层级的电流、力矩、位置数据更接近真实物理量,省去了一层需要辨识和补偿的传动环节;配合开放的控制接口,实验室可以直接获取关节级的原始信号。刑天推出后已经进入多所高校与科研机构的研究场景,支持视觉导航、运动控制等多项科研测试。

对照GrandTour数据集的建设思路,这类平台的核心意义在于:一个实验室要构建可用的腿式数据集,前提是拥有一台愿意开放关节编码器、接触力、状态估计中间结果乃至控制策略隐藏状态的机器人。本体的原始信号质量,决定了研究的深度。

TITA:巡检数据采集载体

TITA机器人面向工业巡检场景,搭载8个准直驱关节模组,峰值扭矩120 N.m,拥有8个自由度,动态最大负载10公斤,最高跳跃20厘米,行进速度可达3到5米每秒。机身搭载NVIDIA Jetson Orin NX 16GB计算平台,配合超声波、SPAD ToF与双目相机实现自主避障;机身采用比铝合金硬3.35倍的镁合金工艺,可在-10~45°C的环境中持续工作,支持电池热插拔和POGO Pin快拆快装。这些参数都表明,TITA是为长时间、在园区与矿山等工业环境中反复跑动设计的产品。

巡检本身就是一种天然的数据采集行为。类似企业的200多台巡检机器人每周执行数千次巡检任务,产出的不仅是设备温度和气体浓度读数,还有同一段路面在不同天气、不同磨损状态下被反复通过的运动记录。这是实验室场地难以复现的时间维度数据,也是巡检机器人相较于数据工厂的独特优势:数据是作业的副产品,边际成本几乎为零

值得一提的是,两台TITA机器人可以拼接为TITATIT机器人,实现更强大的作业能力,这也是全球首款商业化推出的可拼接轮足机器人。

D1:高复杂地形多模块数据采集载体

D1是本末科技在2025年末推出的模块化整机产品,核心是全栈自研的P10系列一体化关节模组,将电机、传感器、驱动器与控制器集成为“感驱控一体化”单元。配合被称为“通用小脑”的协同算法,可以在3秒内完成多模块拼接,在双轮足、四轮足、纯足式甚至人马式等多种构型之间快速切换。

根据本末科技公布的数据,四轮匍匐模式下最大负载可达100公斤,站立模式下仍能保持80公斤负载,双轮足模式空载实测可连续运行超过5小时。

模块化设计在数据采集语境下有着额外的价值:针对三重约束中的机型约束,更换场景无需更换整套硬件。如果机器人可以在几秒内重组构型,同一套关节模组就可以在双轮足形态下钻进狭窄管廊,在四轮足形态下驮载更重的传感器爬过碎石坡。载体的适应半径扩大后,数据采集的边界也随之拓展

更有价值的一点在于,不同构型在同一段地形上跑动产生的数据,可以构成极具价值的对照组:相同的地面环境、相同的传感器配置、不同的运动学结构,这正是现有腿式数据集最缺乏的变量控制条件。

载体是一种基础设施

需要明确的是,本末科技并非一家数据公司,它不搭建数据工厂、不销售现成数据集,也没有将数据资产单独定价,其核心业务仍然是电机和机器人整机。但正因如此,它在具身数据领域的位置格外值得关注。

当整个行业都在比拼“谁能采集到更多小时的数据”时,一个更前置的问题常常被忽略:这些数据究竟从何而来?数据工厂可以规模化生产厨房场景中的抓取轨迹,却无法采集到湿滑钢梯上的力矩曲线;招募一万名居家采集人员可以大幅提升家务动作的数据覆盖度,却无法让任何一条数据出现在矿井或灾后废墟中。

这并非说手部数据不重要,恰恰相反,手部数据是当下最紧缺、也最先实现商业化的部分;但“通用具身模型”的“通用”二字,必然要包含移动能力,能否抵达工作现场正在成为制约模型落地的核心瓶颈。

回到小区业主群里的那则招聘广告,它招募的是人的时间,交换的是人的手部在家庭场景中的动作示范。这门生意会继续扩大,也确实能解决一部分真实问题。但具身智能领域另一个真实存在的数据边界,并不由招募到的人员数量决定,而是由多少台机器人能够抵达多远的场景决定。

在具身智能的数据采集元年,最稀缺的资源或许正是能够真正抵达工作现场的机器人载体

以上内容不代表本平台立场,仅供读者参考