文章摘要
2026年9月欧洲计算机视觉会议(ECCV)专题分会上,斯坦福大学计算机科学助理教授吴佳俊做跨模态感知物理底座主题演讲,提出以统一物理属性为视、听、触觉建立共同坐标系,解决数据稀缺场景下多模态融合痛点,介绍了团队多项相关研究,指出物理驱动建模是未来AI研究的重要方向。

2026年9月,欧洲计算机视觉会议(ECCV)在瑞典马尔默召开。在9月9日的“物理环境中的具身多模态推理”专题分场上,斯坦福大学计算机科学助理教授吴佳俊带来了一场横跨视觉、声音与触觉的学术演讲。这是他两个月内的第三场重磅分享,前两场分别聚焦IJCAI 2026的物理智能范式,以及机器人操作规划方向,而本次演讲则将视角拉回感知层,探讨如何为多模态感官建立统一的物理底座。

吴佳俊在演讲中提出,视觉、听觉、触觉本质上是同一组物理属性在不同感官通道上的投影——比如一个塑料物体,看起来是塑料质感,摸起来触感匹配,敲击时发出的声音也符合塑料的声学特征。他要解决的核心问题是:当我们进入全新领域,面对从未见过的物体,几乎没有声音和触觉数据时,如何高效融合多模态信息?

不同于直接将视觉、音频、触觉数据拼接输入Transformer的常规做法,也不同于先估计状态再跑物理仿真的经典路径,吴佳俊给出的方案是:用几何、材质、刚度这类统一的物理属性,为三种感官建立共同的坐标系。当前多模态融合的真正痛点不在于模型架构,而在于缺乏普适的物理指导原则,尤其是在数据稀缺的场景下。

从视频扩散模型中提取物理属性:PhysDreamer

吴佳俊团队在ECCV 2024的工作PhysDreamer,探索了如何从预训练视频扩散模型中蒸馏出物体的物理属性。该研究针对动作条件下的三维物体动力学预测问题,从静态3D场景出发,推理并还原物体的物理属性,使其具备可动、可交互的特性。

以动态花朵为例,要实现基于动作的动力学预测,关键在于准确估计物体的杨氏模量等物理参数。但这类底层物理属性的标注数据极度稀缺,花瓣的杨氏模量具体数值几乎无法通过常规方式获取。团队的解决方案是:利用预训练视频扩散模型的视觉先验,通过可微分的3D表示管线和物质点法仿真,将渲染出的视频与参考视频做损失对比,反向传播更新物理属性的估计值。

尽管最初的实验基于当时还不够成熟的视频扩散模型,但该工作证明了从基础模型中提取物理属性的可行性。随着模型能力的提升和蒸馏方法的优化,这类方法的效果还会进一步增强,不仅可以用于花朵这类可变形物体,还能推广到更多场景。

通用物理现象建模:WonderPlay

后续的WonderPlay研究,进一步将建模对象从单一可变形物体扩展到更丰富的物理场景,比如刚体、流体、颗粒、软体等多种形态的交互。该研究的目标是从单张输入图像出发,重建出可动、可仿真的3D场景,支持用户通过施加动作实现交互。

传统的物理仿真方法需要完整的状态估计,而从单张图像中获取完整的几何和物理状态本身难度极大,且流体与刚体的交互极其复杂,难以通过精准仿真实现。同时,当前的视频生成模型虽然具备强大的视觉先验,能够从缺失信息的输入中补全场景,但无法接受细粒度的动作作为输入,而这类细粒度动作恰恰是机器人操作中必不可少的。

WonderPlay的核心思路是结合物理仿真器和视频生成模型的优势:先用3D重建得到粗略的场景状态,通过物理仿真得到初步的交互结果,再将深度图、光流等作为条件输入视频生成模型,优化输出的视觉真实性,最后再用生成的视频反向优化底层的物理表示。该系统支持多种物理交互,用户可以从同一张图像出发,施加不同的3D动作观察场景响应,生成的结果可以直接作为机器人操作的模仿目标。

听觉感知的可微分渲染管线

吴佳俊团队在听觉方向的研究同样基于统一物理属性的逻辑:物体发出的声音源于振动,而振动模态由几何和刚度决定,声音信号可以表示为不同振动模态的线性组合。基于这一原理,团队搭建了针对听觉的可微分渲染管线,类似于视觉领域的NeRF和3D高斯渲染技术。

通过该管线,可以从声音信号中反推物体的物理属性。例如,针对陶瓷马克杯的敲击声,团队将其分解为冲击力和冲激响应的卷积,通过优化估计冲击力和冲激响应,还原物体的振动特性。

后续的RealImpact研究进一步在消声室中录制单个物体的声场,通过机器人龙门架上的麦克风阵列从不同位置采集声音数据,建立了包含物体声学特征的基准数据集。该研究还发现,通过建模声场的传播,可以通过声音信号推断房间内是否存在人体,因为人体会对声波传播产生细微扰动。

低成本柔性触觉传感器:DexSkin

在触觉感知领域,团队开发了一款名为DexSkin的柔性电子皮肤,针对现有触觉传感器的痛点进行优化。传统的GelSight传感器分辨率高但耐用性差,使用数百次后凝胶会出现漂移,且成本较高;而磁传感器成本较低但难以适配复杂的几何形状,无法满足灵巧操作的定制化需求。

DexSkin由刚性内核、柔软套筒和多层电子皮肤组成,电极层非常柔软,成本低廉且可以定制成任意形状,适配不同的物体和执行器几何。将其安装在夹爪上后,可以获取物体几何和受力的精细信息,支持笔重定向、夹取娇嫩蓝莓等灵巧操作任务,显著提升任务成功率和物体存活率。

问答环节核心讨论

在问答环节,针对细粒度动作控制的问题,吴佳俊表示,物理仿真器本身可以接受高度细粒度的动作输入,动作由用户指定,后续也可以探索对动作本身进行优化的可行性。

关于物理仿真器的参数设置,他提到当前的方案是根据仿真器的需求选择对应的物理属性,未来可以结合基础模型自动选择合适的仿真器和关键物理量。而针对视频模型的物理不一致性问题,他认为随着模型能力的提升,这类问题会逐渐减少。

针对触觉传感器的应用场景,吴佳俊表示,传感器本身的薄型设计可以适配大多数执行器,但面对堆叠密集的物体时,需要配合柔软的自适应执行器才能实现精准操作,这也是未来的研究方向之一。

结语:物理驱动与跨学科融合

吴佳俊在最后总结道,当前的基础模型在视觉、语言领域进展迅猛,但在物理驱动的多模态感知领域,团队的优势在于对物理原理的理解和跨学科的研究能力,比如在物理世界中开发新材料,这是当前纯数字空间的基础模型难以实现的。

基于物理因果性的建模思路,可以让多模态表示更具可解释性和可控性,同时结合仿真器生成的合成数据,可以进一步提升模型的泛化能力,这也是未来人工智能研究的重要方向之一。

以上内容不代表本平台立场,仅供读者参考