具身智能新突破:触觉数据赋能3万小时交互,NeoteAI发布三大技术报告

在具身智能的落地过程中,机器人经常会遇到一类让人哭笑不得的“翻车”场景:视觉系统明明已经确认了空间位置,可一旦进入物理交互就会出问题——比如插头反复摩擦却插不进去,抓取塑料瓶时力道失控捏瘪瓶身,好不容易叠好的毛巾松手瞬间就散落一地。这类问题的核心症结,恰恰在于机器人缺少了接触瞬间的触觉反馈:摄像头可以确认物体的位置,但无法感知是否产生接触、是否顶到了边缘、夹力是否过载,或是是否发生了滑移。这层关键感知的缺失,正是阻碍机器人跨越落地“最后一厘米”的关键痛点。
近日,一家专注具身智能的企业联合高校研究院,正式发布了三份技术报告,将触觉从原本的“辅助感知模态”升级为具身智能的“核心基建”。整套方案包含一套大规模触觉数据底座,搭配两条各有侧重的技术路线,并且开源了相关数据与模型,为行业提供了可复用的触觉智能解决方案。
统一触觉数据标准,搭建大规模交互语料库
长期以来,触觉数据的规模化应用都面临一个核心障碍:不同厂商的触觉传感器输出的数据格式各不相同,有的输出凝胶形变图,有的输出电容矩阵,还有的输出六维力向量,这些不同格式的数据就像缺乏统一语法的方言,很难在同一个模型中实现融合复用。
为此,该团队搭建了NeoData数据集来打破这一壁垒,这套数据集的规模堪称行业领先:
- 包含超过3万小时的视觉-触觉交互视频素材
- 涵盖约140万条操作片段,累计33亿个时间步的数据
- 对应80亿帧RGB视觉画面与100亿帧触觉图像
- 测试覆盖了6种不同型号的机器人本体
- 包含450项真实长程任务,从居家料理、收纳整理到工业装配、线材梳理都有涉及,全部数据由90位专业操作员采集完成
- 目前已开源其中5千小时的视觉-触觉交互视频内容
除了大规模的数据集,团队还提出了NeoForce统一表征模型。无论底层使用的是哪种类型的触觉传感器,该模型都可以学习到具备跨设备迁移能力的时序结构化触觉表征,能够回答“哪里被按了”“按了多大的力”“有没有发生横向拉扯”这类关键问题,相当于打造了一套通用的“触觉普通话”,彻底解决了跨设备数据融合的难题。
触觉预判赋能轻量化视觉语言动作模型
在搭建好触觉数据底座之后,团队接下来的重点是如何将触觉真正融入到现有的视觉语言动作模型技术路线中。在过往的多模态融合实践中,直接将触觉图像与RGB视觉信号进行简单拼接往往会遇到两个核心问题:一方面,触觉信号仅在物理接触的瞬间才会产生高频响应,大部分时间都处于“静默”状态,很容易被海量的视觉Token所淹没;另一方面,即便模型成功提取了当前的触觉特征,本质上也只是对已经发生的动作的滞后反馈,这种“后视镜”式的感知机制,会让机器人在动态交互中始终慢半拍。
针对这些问题,团队提出了全新的方案:不再依赖滞后的当前触觉数据,而是直接预测未来50步内的触觉演变趋势。该模型会将当前的触觉信号编码为紧凑的潜在Token,结合当前的视觉上下文信息,提前预判滑移、受力变化等交互趋势,从而指导动作模块提前做出调整。
在实际任务测试中,该模型展现出了远超纯视觉方案的表现:在插插头任务中,模型的成功率达到了85%,而同类纯视觉方案的成功率仅为60%;在拔钥匙的精细任务中,模型成功率更是达到了99%,而纯视觉方案的成功率只有35%。
除此之外,该模型还突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人可以从失败的操作数据中自主进化。模型结合触觉信息,利用部署后产生的真实交互数据以及人机循环标注数据,训练了一个任务进度评估模型,不仅可以准确识别当前任务所处的阶段,还能识别出“操作退步”和“紧急救场”这类复杂的行为模式。通过结合离线强化学习,机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率,分别从原本的50%、35%、20%大幅跃升至95%、80%、75%,真正实现了从失败经验中汲取教训的持续进化。
在世界模型中重构“触觉想象”
如果说前文的预判模型是给机器人加装了一台“触觉预判雷达”,那么这款世界模型方案则是对机器人的“认知中枢”进行了全面重构:它将触觉信息融入世界模型,让机器人在真正动手执行任务之前,先在自己的“想象”中完整推演一遍操作视角和手感。
现有的主流世界模型大多仅局限于未来视觉图像的生成,在驱动真实机器人时会面临严峻的物理对齐挑战:比如模型生成的画面里显示杯子已经被抓住,但实际上机器人的手指可能并没有夹稳;画面里显示插头已经对齐了插座,但下一秒可能就会卡住。这类问题的核心原因,就是现有世界模型完全缺失了触感信息。
该模型的核心目标,是同时预测未来的视频、触觉和动作这三个相互耦合的序列。该模型采用了混合专家架构,内置了视频、触觉、动作三个异步专家网络:视频专家从预训练模型热启动,快速适配视觉生成任务;触觉和动作专家则采用了更窄的网络结构,在保证性能的同时降低了整体参数量,最终模型总参数量为72亿,仅相当于全宽方案的一半。
在仿真与真机测试中,该模型展现出了显著的优势:在仿真环境中,模型的平均成功率达到了84.5%,而同期世界模型的最强基线仅为36%;在真机8项任务的测试中,模型平均成功率为46.3%,对比同类方案的成功率仅为21.9%。通过消融实验进一步验证,无论是去掉“未来触觉预测”模块还是“当前触觉条件”输入,模型的性能都会出现显著下降,这也确立了触觉在世界模型顶层设计中的不可或缺性,让触觉与视觉模态真正实现了平起平坐。
触觉:具身智能的下一个规模化方向?
纵观这三份技术报告,可以清晰看到该团队释放的行业信号:数据底座模块验证了触觉模态具备和视觉一样的规模化发展潜力;预判模型证明了触觉可以自然地接入现有视觉语言动作模型架构,无需对整体框架进行颠覆性改造;世界模型方案则确立了触觉在世界模型顶层设计中的核心地位,让视触融合的认知范式成为可能。
这意味着,机器人的认知范式正在从单一的“视觉驱动”向“视触融合”方向演进。机器人不再仅仅通过“观察”来理解世界,而是开始像人类婴儿一样,通过主动的触觉探索来验证假设并规划下一步动作。“看得见杯子不等于拿得稳,认得出插座不等于插得进”——这类物理世界的基础常识,终于被写入了机器人的底层逻辑之中。
尽管距离实现“随手一摸即知轻重”的通用具身智能还有很长的路要走,真实场景下的数据采集成本、跨机器人本体的泛化能力以及推理实时性,都是亟待攻克的工程难题,但该团队的这组工作已经实质性地推动触觉从“小众研究方向”跃升为“具身智能核心基建”。
具身智能的下一篇章,或许不再仅仅是“让机器人看懂世界”,而是真正“让机器人摸透世界”。


