文章摘要
2026年SIGGRAPH揭晓时间检验奖,香港大学Taku Komura团队2016年论文《A Deep Learning Framework for Character Motion Synthesis and Editing》入选。该研究推动AI“学会动”,后续团队不断拓展成果。其人类交互先验模型降低数据采集成本,还推进多模态世界模型。Taku未来聚焦让机器人获通用行为智能,认可中国研究优势。

2026年7月举办的国际计算机图形学顶会SIGGRAPH,正式揭晓了本届时间检验奖获奖名单。该奖项专门用于表彰十年前发表、至今仍对行业产生持续深远影响的学术论文。本届获奖作品中,香港大学计算机科学系教授Taku Komura与其团队在2016年刊发的《A Deep Learning Framework for Character Motion Synthesis and Editing》成功入选。

这项研究是业界首次尝试通过深度学习技术,从大规模人类动作捕捉数据中自动学习人体运动的内在结构,再基于高层指令生成自然流畅的人形角色动作。在当时AI技术的突破大多集中在图像领域的背景下,该工作系统性地将表示学习应用到复杂3D动作生成领域,推动AI从“学会看”向“学会动”迈出了关键一步。

十年后的今天,这项研究的价值早已超越角色动作生成本身:机器如何从人类的运动与交互行为中学习,进而理解物理世界并在其中完成自主行动,已经成为物理AI领域的核心研究问题。而Taku Komura围绕这一问题,已经深耕了二十余年。

Taku Komura曾在爱丁堡大学任教多年,长期聚焦动作生成、物理模拟与交互技术研究。2020年他正式加入香港大学,现任该校计算机科学系教授。他曾担任SIGGRAPH Asia 2025大会主席,还被AI 2000评为该领域全球最具影响力学者前15名。

2016年的SIGGRAPH获奖论文,核心思路是用卷积自编码器从海量动作捕捉数据中学习低维运动空间,再将行走路径等高层控制条件映射到该空间中,让模型能够生成和编辑动作,同时最大程度保留人类运动的自然性。这项工作的关键并非逐帧记忆训练动作,而是学习可复用的运动表示——用当下的术语来说,就是构建了一套Human Motion Prior,即明确哪些姿态和时间变化属于自然人体运动,以及如何在满足目标约束的前提下保持在合理的运动空间内。该论文至今仍保持持续增长的引用量,成为后续数据驱动动作生成研究的基础工作之一。

在此之后,Taku与其团队不断拓展研究边界,将动作场景从孤立的人体运动拓展到更复杂的真实环境中。2019年推出的Neural State Machine,能够让数字角色根据场景几何信息完成坐下、搬运、开门与避障等动作;2020年的Local Motion Phases则聚焦解决多接触、动作快速切换和全身协调等技术难题。

2022年,其团队提出的DeepPhase技术斩获SIGGRAPH最佳论文奖。该技术通过周期性自编码器从未经人工整理的原始动作数据中学习多维相位空间,精准捕捉不同身体部位随时间变化的运动结构。这一技术让系统在检索、对齐和合成复杂动作时,无需依赖人为定义的单一动作阶段,生成的结果不仅单帧姿态自然,整体时间组织逻辑也更加连贯。

围绕这条研究主线,团队打造的AI4Animation开源项目目前已在GitHub获得超过8000颗星标,是动作生成领域最具影响力的开源项目之一。该项目由团队持续维护,汇集了Taku团队在人形运动、四足运动与场景交互等方向的长期研究积累。

从2016年的标志性论文到此次获得时间检验奖,Taku的研究主线可以概括为一套完整的人类交互先验模型:先让模型学会表示真实世界中的自然人类运动,再逐步学习人与场景、物体和任务的交互逻辑,最终将真实接触、受力情况与环境变化纳入模型体系。

这条研究路线对物理AI的价值,正在被机器人行业逐步验证。传统的真机遥操作数据采集方式存在成本高、场景覆盖窄、动作不够自然等问题,难以支撑通用机器人能力的训练。而人类日常操作行为,才是机器学会在真实世界做事的更可行的知识来源。

但原生的人类操作数据并不能直接投入使用:要采集足够多的有效数据,需要硬件成本低到能够大规模铺开,但低成本传感器往往存在噪声大、信息缺失的问题。Taku团队多年积累的人类交互先验模型恰好解决了这一痛点——它能够识别符合自然人体运动的姿态和时间变化,将残缺的采集信号进行补全,并约束到真实的人体运动范畴内。

依托这套先验模型,团队现在仅需使用消费级设备(比如iPhone手机)即可完成数据采集与重建,得到人手、物体与场景在统一世界坐标系下的3D结果。这一方式将采集成本降低至过去的几十分之一,在第一人称手部重建的公开评测中,误差更是降低了60%。

这套数据管线的价值远不止降低采集成本,更指向具身智能领域的关键判断:下一个行业突破口将出现在消费级场景而非受控实验室环境。家庭整理、厨房操作、日常物品交互等场景拥有海量且离散的数据,边际成本极低,但由于动作精细、接触关系复杂,此前始终缺乏可规模化的高质量数据来源。Taku团队的技术路线,能够将消费级设备拍摄的真实生活操作场景,转化为符合物理规律的高质量训练数据,这意味着具身智能与世界模型的规模化落地,将从工厂产线延伸到千家万户的真实生活场景中。

采集到高质量数据只是第一步。行为克隆技术能够让机器模仿示范动作,但要让机器在真实世界中自主行动,还需要它理解动作带来的结果以及背后的物理规律。Taku与其团队正在推进的,正是基于人类原生数据训练的多模态世界模型。

当前主流的具身数据范式,包括第一视角视频、UMI数据集和机器人遥操作数据等,大多仅包含视觉和动作两类信息。但看起来相似的动作,背后的接触过程和操作结果可能存在巨大差异,仅依赖视觉和轨迹信息,模型很难区分这些核心差异。

Taku团队的解决思路,是以人类原生操作数据为基础,补齐缺失的关键信号。他们将采集设备设计为可穿戴形式:第一视角相机记录实时画面,通过重建的3D状态区分相机运动与真实环境变化;眼动设备记录人类视线的关注对象;肌电传感器则记录发力情况与接触状态,补充人类动力学特征。在采集过程中,使用者仅需正常完成日常操作,即可获得时序对齐的多模态信息。

这一方案也改变了世界模型的预测目标:不再仅预测下一帧像素,而是预测物理状态的变化,包括物体的3D形态、接触位置与受力大小。对机器人而言,真正有价值的判断是“这样推会不会倒”“这个力够不够拧开瓶盖”,这些关键特征才是机器眼中的世界状态,而非一堆抽象的像素信息。

以人为中心的数据采集并非终点。人类能够示范的经验总有边界,机器人迟早需要面对没有人类示范过的任务。Taku希望机器人在掌握人类经验之后,能够通过自主行动与探索积累对世界的感知与行为经验,逐步具备自我探索和自主学习的能力。当前以人类为中心的研究范式,正是在为这一长远目标打下基础。

物理AI的核心挑战,是让机器人适应未知环境、从有限的交互中学习新技能。这类问题无法仅依靠公开数据集或单次实验解决,需要长期采集数据、在真机上反复测试,并根据真实任务持续调整,因此这类研究需要与产业界进行深度合作。

正是出于这一原因,在爱丁堡大学任教多年后,Taku选择来到中国香港继续推进研究。他十分认可在中国开展这项工作的优势:国内相关领域学术活力强劲,产业落地场景丰富,为物理AI研究提供了充足的实践条件。

在这样的环境中,Taku接下来的研究目标将聚焦物理AI更根本的方向:让机器人形成对物理世界的内部表示,在真实交互中理解自身身体、动作与物理规律,最终获得能够跨机器人、跨任务和跨环境迁移的通用行为智能。而多模态的人类原生操作数据,正是他推进这一目标的核心入口。

时间从不为任何人停留,但总会奖励那些真正深耕领域、理解技术本质的研究者。

以上内容不代表本平台立场,仅供读者参考