UniTac:机器人触觉从“接触后知”到“接触先知”

如今的具身智能机器人,在完成轮廓清晰、位置明确的刚性物体操作时已经表现出色,但一旦涉及柔性、易损物品或是密集接触类任务,往往会力不从心。比如想要完整捏起一颗葡萄,或是稳稳抓住一只纸杯不使其变形,仅靠视觉定位远远不够——人类交互时不可或缺的触觉感知,正是当前机器人的短板所在。
近年来,越来越多的研发团队开始将触觉作为构建机器人大脑的重要模态,从统一多传感器触觉表征的方案,到将触觉融入通用策略与视觉语言动作模型的研究,再到探索仅凭视觉和本体感觉预判触觉的技术,以及视觉触觉仿真工具,相关技术路线不断丰富。但这些方案仍存在明显边界:不同传感器的异构数据难以互通,触觉理解、生成与动作应用也往往分散在不同模型中,无法形成统一的落地能力。
近期,一支联合研发团队发布了最新科研成果UniTac,该工作已被ECCV 2026收录。这套统一的跨传感器触觉理解与生成架构,进一步接入视觉语言动作模型,为机器人补上了关键的“触觉想象力”——让机器人能够在真正接触物体前,提前预判触感并规划安全的操作动作。
举个简单的场景,当面对一只软质纸杯时,搭载UniTac的机器人会先预测纸杯受力后的形变情况,再决定从何处接触、施加多大的力度;而未融合该技术的模型,则很容易因为无法预判接触后果,直接将纸杯捏扁。类似地,在抓取毛巾这类柔性物体时,仅靠视觉的机器人会尝试套用统一的抓取策略,而无法根据毛巾的材质、粗糙度调整动作,很容易出现抓取失败的情况。
如果将近年机器人基础模型的发展看作是AI不断锚定真实世界的过程,那么这一过程可以分为三个层级:第一层是视觉语言模型的锚定,将抽象的语言概念与现实视觉对象对应,让机器人知道眼前的物体是什么;第二层是视觉语言动作模型的锚定,将视觉语义与语言指令对应到动作轨迹,让机器人知道该规划怎样的操作路径;但当动作真正落地到物理世界时,还存在第三层缺失的锚定——机器人需要知道该如何完成这次接触。
对于机器人来说,“抓取”只是一个抽象的动作标签,但现实中的每一次接触都存在差异:抓起一块毛巾,需要判断哪里更容易捏住,毛巾的材质、大小、形状、表面粗糙程度都会影响抓取结果。完全依赖视觉的机器人,很容易对外观相似的物体采用完全相同的操作策略,而如果等到接触发生后再根据触觉反馈修正,可能纸杯已经被压扁,薯片也已经被捏碎。因此,如果机器人能够在接触前就预判未来的触觉状态,第一次接触就能变得更加安全可控。
要让触觉真正融入机器人基础模型,首先需要解决的是最棘手的数据统一问题。触觉图像虽然外观上类似RGB图像,但生成原理完全不同。以主流的视觉式触觉传感器为例,它们本质上是通过相机记录凝胶受压后的形变,因此一张触觉图像中同时混合了两类信息:一类来自被接触的物体,包括硬度、粗糙度、纹理和接触形变;另一类来自传感器本身,包括光照条件、凝胶状态、Marker布局和相机参数等。
这意味着,同一个物体更换不同的触觉传感器,采集到的数据可能完全不同。如果模型无法区分哪些变化来自物体本身、哪些来自传感器配置,就很难实现跨设备的泛化能力。此外,过往的触觉模型大多基于单一传感器或小规模数据集训练,比如部分公开数据集仅包含数百段触觉视频,但整个行业公开的触觉数据实际上已经超过40万段视频、160万帧数据,真正的问题并非没有数据,而是这些数据长期分散在不同传感器、不同数据集和不同任务中,无法被统一利用。
为解决这些痛点,UniTac将触觉理解和触觉生成整合进同一个多模态框架,实现不同传感器数据的统一吸收。具体来说,研究团队将触觉拆分为两个核心部分:一是物体的物理属性,包括硬度、粗糙度、纹理等接触时体现的特征;二是传感器的配置参数,包括光照、凝胶状态等传感器自身的属性。UniTac的整体架构正是围绕这两个部分展开。
在理解端,模型同时学习物体属性描述和传感器识别两个任务:前者让模型能够理解被接触物体的表面属性,后者则让模型能够辨认触觉信号来自哪类设备。增加传感器识别任务并非多余的步骤,它能够迫使模型主动区分数据中的物体属性变化和传感器自身的变化,从而实现更精准的触觉理解。面对不同传感器采集的触觉视频,UniTac能够围绕硬度、粗糙度和纹理生成与接触材料匹配的描述,还能完成属性比较、物体匹配和极值选择等推理任务。
在生成端,UniTac采用两步训练流程:首先训练触觉解码器,学习重建真实的触觉信号;再通过专用投影器,将多模态大语言模型的语义输出对齐到触觉latent空间,并加入对应的传感器token。值得注意的是,UniTac摒弃了普通生成模型常用的“无条件分支”,因为研究发现触觉并不存在真正的无条件状态——任何一段触觉信号都由具体的传感器产生。因此,模型会先给定目标传感器未接触物体时的空载状态,再生成接触发生后由物体属性带来的信号变化。
实验结果表明,UniTac并非在单一指标上实现领先,而是在触觉理解和触觉生成两端都展现出全面优势。在触觉理解任务中,UniTac-7B在公开测试数据集上以66.51分的成绩,领先传统触觉理解模型以及统一模型;在属性-物体匹配任务中,该模型取得了64.61分的成绩,证明它不仅能够识别软硬、粗糙度等物理属性,还能进一步判断触觉信号对应的物体类别。
在触觉生成任务中,UniTac同样表现优异。针对四类主流触觉传感器,UniTac的平均结构相似性指数达到0.836,平均峰值信噪比达到19.93,两项指标均取得最佳结果。正是这种稳定的跨传感器生成能力,让UniTac能够为视觉语言动作模型提供可靠的触觉先验,帮助机器人在接触前就预判接触后果,从而规划更安全的操作动作。
该成果由多家国内外高校和具身智能企业联合研发,团队围绕触觉技术的研发路线已经十分清晰:从早期的真实世界视触觉数据采集项目,到统一多传感器的触觉表征方案,再到将视觉与触觉对齐到三维空间的技术,团队始终在推进一个核心目标——让机器人从“看见物体”,走向“理解物体该如何被接触”。
最新的UniTac将这一路线进一步推向基础模型层级,将触觉理解、生成和跨传感器迁移整合进统一架构,并将预判的触觉状态接入机器人基础模型。这一思路延续了团队一贯的场景驱动理念:与单纯追求机器人“能不能干活”不同,团队更关注能否把活干好、干得更稳定高效,而非针对每个场景单独微调模型,而是从真实任务的痛点出发,持续补齐感知、控制与系统能力。
当行业大多集中攻关通用视觉语言动作模型时,该团队选择补上机器人进入物理世界时绕不开的接触层。UniTac的核心意义,正是将不同场景中的接触问题,沉淀为一种可以跨传感器复用、能够参与动作决策的基础能力。
随着视觉、触觉、力觉与动作模型的进一步融合,机器人有望在家庭护理、精细装配、服务操作和康养陪护等场景中,完成更安全、更柔顺的接触操作。
参考链接:https://arxiv.org/abs/2606.31451

