文章摘要
2026年欧洲计算机视觉大会上,研究者吴佳俊聚焦具身智能落地核心痛点,指出现有机器人缺乏应对多变未知现实环境的灵活理解能力,其团队从可验证原子技能体系、无演示交互推理、提取视频模型知识三个方向展开探索,还搭建了完善的评估基准,探索推动具身智能从对世界的理解落地为实际行动。

在2026年的欧洲计算机视觉大会现场,瑞典马尔默的会展中心里,一位专注于具身智能的研究者正奔波于多场专题workshop之间。他一天之内要在三到四个不同的分论坛间赶场发表演讲,而他的演讲主题,正是直击具身智能落地的核心痛点。

当他站在本次分论坛的讲台时,没有选择单纯讲解像素识别技术,而是提出了一个比“让机器人完成动作”更具挑战的问题:当机器人踏入充满未知与突发状况的物理世界,该如何灵活调整行动,完成真实场景中的任务?

人类面对厨房场景时,无需从头计算每一步动作,仅凭对世界的固有认知就能快速调整行动:看到盘子就知道可以拿起,看到洗洁精就明白接下来需要清洗,甚至当临时改变任务或者遇到陌生物体时,也能凭借对世界的理解补全后续步骤。但机器人却缺乏这种灵活的世界理解能力,它们面对的不是预设好的动作序列,而是不断变化、充满例外的现实环境:物体位置会偏移,人类行为会改变,任务会被打断,训练时从未见过的物品随时可能出现。

真正的难点,从来不是让机器人完成单个动作,而是让它理解“为什么要这么做”,以及如何将零散的局部技能拼接成完整的任务流。就在二十天前,这位研究者刚在另一项顶级会议上获得相关奖项,当时的演讲聚焦于如何让机器从像素世界中理解背后的几何、材质与物理属性,将这些深层结构称为“物理代码”。而在本次分论坛上,他将研究向前推进了一步:当机器已经拥有了对世界的结构化表示,该如何利用这些表示完成真实的物理行动?

这两个问题之间,恰好隔着具身智能最棘手的一段距离:从“知道世界是什么”,到“知道在这个世界里应该做什么”。而这位研究者给出的答案,并不是再造一个无所不知的巨型模型,而是从三个方向展开了探索。

拆分复杂任务:可验证的原子技能体系

要让机器人适应多变的现实场景,首先需要打破复杂任务的边界。研究者团队提出了一套基于组合式抽象的推理范式:从原始的图像、视频与语言观测出发,通过基础模型完成感知与语言理解,最终提炼出可验证、可组合的原子技能,用于规划机器人的行动序列。

这套体系的核心包含三个部分:首先是一组可验证的状态,比如“物体是否干净”“是否已涂抹洗洁精”“物体A是否在物体B上方”等,这些状态由神经网络完成验证;其次是一组原子动作,比如“抓取”“冲洗”“摆放”等,每个动作都有明确的前置条件与后置效果;最后是状态与动作之间的依赖关系,通过符号化的类型定义组合性规则,由神经网络处理感知与控制环节。

举个简单的例子,当机器人需要完成清洗餐具的任务时,系统会先识别出当前的状态,再匹配对应的原子技能:只有先抓取餐具,才能进行冲洗操作;当餐具表面有洗洁精时,冲洗后就能让物体变干净。这种基于规则的组合性设计,让机器人能够推演动作的合理顺序,自主规划完整的行动流程。

与传统手工编码的规划系统不同,这套方法的所有抽象与规则都由神经网络自动发现,而非人工预设。基础模型会生成关于属性、前置条件与后置条件的假设,再通过验证器与演示数据比对,不断优化这套规则体系。即使只有极其有限的演示数据,系统也能泛化到全新的物体、场景与任务目标。

无演示场景:让物体自己说出交互方式

在很多实际场景中,我们无法为所有陌生物体采集演示数据。如何让机器人在没有人类遥操作的情况下,仅凭对单个物体的观察,推理出与之交互的合理方式?

研究者团队提出了神经运动学的解决方案,通过编码器-解码器框架,从静态网格模型中学习物体的固有运动学空间。训练过程中,模型会学习物体的形变分布,在测试阶段则能基于单个物体的网格,预测出所有合理的交互方式,比如水龙头的开关角度、柜子的开合路径等。

即使面对手机扫描得到的粗糙三维模型,这套系统依然能实现零样本泛化,预测出与物体适配的交互方案。无论是办公室里的笔记本电脑、浴室里的水龙头,还是客厅里的沙发,模型都能基于物体的固有结构,推理出符合物理规律的交互方式,为机器人提供免费的交互演示参考。

借取视频模型的知识:生成四维交互场景

另一种高效的解决方案,则是借助现有的视频扩散模型与视频语言模型的知识。这类模型在海量数据的训练中,已经掌握了大量物体交互的常识,我们可以通过蒸馏的方式将这些知识提取出来,转化为机器人可复用的交互轨迹。

具体来说,我们可以将静态的三维网格场景转换为四维表示,为其添加时间维度构建动态场景。再通过视频扩散模型生成符合语言提示的动态交互序列,比如“机器人手臂抓取砖块”“篮球撞击篮板”“猫咪跳上坐垫”等。这种方式无需人工采集遥操作数据,就能为机器人生成大量免费的交互演示,让系统能够直接学习到物体的合理运动规律。

这种方法的优势在于,即使是对物理规律的模拟存在瑕疵的视频模型,也能为机器人提供有价值的交互参考——比如模型可能无法完美模拟重力,但依然能准确描述猫咪跳上坐垫的大致动作流程。这些不完全精确的知识,依然可以成为机器人学习的有效素材。

评估标尺:检验具身智能的真实能力

要验证这些具身智能系统的有效性,需要一套完善的评估基准。研究者团队先后提出了多个评估框架:从被动的动作排序基准,到允许智能体自主移动的具身空间智能基准,再到针对家庭日常活动的大规模仿真挑战赛。

其中,家庭日常活动基准的构建耗时多年,团队基于相关调查数据,筛选出大众最常完成的家庭任务,比如聚会后打扫房间、清理淋浴间等,并将这些任务转化为仿真环境中的挑战项目。这套基准覆盖了三维推理、数量判断、布局理解与目标导向行动等多个维度,能够全面检验系统的真实能力,目前已经连续举办了两届挑战赛,吸引了二十多支参赛队伍参与。

问答与总结

在问答环节中,研究者针对几个核心问题进行了回应:关于隐式表示的应用、奖励模型的更新,以及表示的统一性问题。他提到,虽然基于隐空间的方法有着独特优势,但目前基于视频扩散模型的交互模型表现更为亮眼;而对于奖励模型过时的问题,需要分场景讨论,基于大模型的奖励模型过时的概率相对更低,同时可以通过人在环路的方式持续更新数据。他也强调,不同任务的核心结构是统一的,差异更多在于如何表示与获取这些表示。

总的来说,具身智能的核心在于构建结构化的世界表示,并将这种理解转化为真实的物理行动。无论是拆分原子技能、无演示交互推理,还是借取视频模型的知识,都是朝着这个目标迈出的重要一步。随着大模型与机器人技术的结合愈发紧密,如何让机器人真正适应复杂的现实世界,依然是需要持续探索的方向。

以上内容不代表本平台立场,仅供读者参考