文章摘要
这是对2024年初回国入职清华大学交叉信息研究院的助理教授徐梦迪的具身智能领域深度访谈。徐梦迪核心研究机器人上下文学习(ICL),旨在让机器人通过少量交互演示快速适应新任务。她提出当前具身智能已从侧重预训练转向重视自适应,领域既有实质进步也存在泡沫,看好规模化发展,认为未来3-5年或迎来明确范式转变,访谈还谈及她的学术路径与对年轻研究者的建议。

这是一场关于具身智能前沿方向的深度访谈,嘉宾是清华大学交叉信息研究院助理教授徐梦迪。从衡水中学的竞赛生到清华车辆工程本科,再到约翰·霍普金斯大学、卡内基梅隆大学深造,之后在斯坦福跟随吴佳俊、李飞飞教授开展博士后研究,2024年初徐梦迪选择回国加入清华叉院,她的核心研究命题是机器人的上下文学习(ICL)——让机器人在全新环境中通过一两次交互快速掌握新任务,并且学习效率持续提升。

就在访谈录制后不久,Generalist发布了GEN-1.5模型,仅通过3-12秒的动作示范作为“物理提示”,无需微调参数就能当场尝试完成新任务,在10项任务中平均成功率达到59%,ICL也因此成为全球具身智能领域的焦点话题,这正是徐梦迪长期聚焦的研究方向。

本次访谈覆盖了多个核心议题:预训练的边界、真正的泛化能力、Scaling Law的信号与陷阱、稳定的数据闭环、叠衣服演示的认知误区、行业的泡沫与真实进步、年轻PI的真实工作与研究选择。

徐梦迪本科就读于清华车辆工程系,很多人会觉得这个专业和具身智能跨度很大,但她坦言本科阶段的学习为后来的研究打下了全面基础,从机械设计、汽车电子到算法课程,覆盖了机器人研究需要的核心知识领域。真正转向机器人研究的契机是大二跟随阎绍泽教授开展生物机器人研究,研究蜜蜂翅膀的超弹性恢复特性,大三暑研时她前往CMU的Howie Choset教授课题组,参与设计了爬管子的蛇形机器人,从此工作重心从机械设计转向机器人算法。

作为衡水中学的物理竞赛生,徐梦迪的高中生涯节奏紧凑且目标明确。高一结束后她选择了物理竞赛方向,每天的作息从早操到食堂就餐都有严格安排,竞赛班的同学目标高度一致,从解出一道习题到冲击省一金牌,大家并肩作战,战友情谊远大于竞争压力,很多同学后来都在国内外成为了顶尖研究者。

在CMU攻读机械工程博士期间,徐梦迪获得了系里的最佳博士论文奖,当年该奖项仅授予两人。她的博士论文题为《Building Adaptable Generalist Robots》,核心观点是机器人不能仅依赖预训练知识,必须具备适应动态变化环境的能力。当时她非常推崇斯坦福教授Chelsea Finn的MAML工作,该工作让机器人能够学习从未见过的任务,这也成为她后来研究方向的重要启发。

博士后期间在斯坦福,徐梦迪参与了三项核心研究:一是BEHAVIOR Challenge这个大型仿真机器人基准测试平台,负责生成双臂操作数据集;二是围绕机器人的可引导性展开研究,让机器人能够遵循更多样的人类指令;三是Creative Tool Use基准测试,探索机器人像人类一样创造性使用工具的能力。她和李飞飞、吴佳俊两位导师合作,两位导师的风格互补,李飞飞更注重宏观视野,经常引导思考领域的本质问题,而吴佳俊则更注重实操,帮助打磨研究品牌。

2023年徐梦迪开始考虑职业方向,在工业界和学术界之间权衡。她曾在Google实习过较长时间,工业界有充足的算力资源支持研究,但自由度有限;而学术界能够让她自主分配时间到真正重要的研究问题上。通过吴翼老师的推荐,她获得了清华叉院的面试机会,最终选择回国的原因有两点:一是叉院的学生和师资都非常顶尖,姚班毕业生中有很多AI和机器人领域的顶尖研究者;二是机器人研究需要软硬件结合,叉院能够提供完整的平台让她把机器人系统真正落地。在和姚期智先生的面试中,姚先生建议她要更加专注,把有限的时间投入到真正重要的研究问题上,这让她受益匪浅。

徐梦迪当前的核心研究是让机器人具备ICL能力,摆脱对预训练数据的完全依赖,通过上下文交互和少量演示就能快速适应新任务。她认为当前的具身智能研究已经从单纯依赖预训练数据和模型规模,转向重视自适应能力,这一共识正在形成。她解释说,人类的泛化能力来自两个方面:一是长期演化形成的深厚先验知识,二是快速学习新技能的能力,当前的具身智能研究已经从强化先验能力,转向如何让机器人具备快速学习的能力。

回国一年多来,徐梦迪接触了大量具身智能领域的研究者和创业者,她认为国内的具身智能领域既有实实在在的进步,也存在一定的泡沫。进步体现在从材料、传感器、本体硬件到数据和模型,国内都有企业在攻关,资源投入充足;而泡沫则来自于领域尚未收敛,研究焦点不断变化,从数据到世界模型再回到数据,就像PID参数没调好会出现超调和震荡。她个人更看好世界模型的路线,因为世界模型是任务无关的,能够学习世界变化的规律,相比依赖任务的VLA路线更具可扩展性。

当前很多公司的研究显示,预训练数据从10万小时增加到100万小时后,在未见过的测试集上效果有所提升,但机器人领域的loss和成功率并不直接挂钩,比如拿杯子的任务中,前17步都很顺利,但最后一步出现误差就会导致任务失败,时序上的不平衡让loss和成功率的关联度不高。她期待未来的Scaling Law能够证明,随着数据增多和模型变大,未见过的任务成功率能够持续提升,这才是真正有意义的进展。

徐梦迪认为具身智能一定会迎来类似GPT的拐点,她相信规模化的力量。当前的具身模型还处于类似GPT-1的阶段,需要针对目标领域进行微调才能完成任务,而她的目标是实现类似GPT-3的能力,通过ICL和提示词的方式,无需微调就能让机器人完成新任务。她推荐BEHAVIOR作为开源基准测试平台,虽然存在仿真到现实的差距,但仿真本身也是重要的研究环境。她也认可英伟达Jim Fan的观点,具身智能的发展会对应语言模型的阶段,但机器人领域有两个独特的挑战:一是安全性要求更高,部署前需要进行严格的压力测试;二是机器人的上下文信息更加多样,因为它有实体躯体,观测到的环境信息更丰富。

徐梦迪近期的研究都围绕ICL展开,她举了一个简单的例子,很多机器人演示都是叠衣服成方块,但现实中不同人的收纳习惯不同,有人喜欢卷起来放胶囊衣橱,有人喜欢按颜色摆放,甚至有人直接挂起来。ICL的核心就是让模型能够被终端用户自定义,用户通过演示就能让机器人适应自己的习惯。她的团队正在开展桌面任务的研究,通过人类的修正指示和演示来改变机器人的行为,最终目标是实现全身的灵巧操作。她认为当前最大的挑战是构建稳定的数据闭环,一方面需要基础模型足够好以快速学习新任务,另一方面需要让机器人进入真实场景让用户使用,从而激发基础模型的能力,这两者之间存在鸡生蛋的问题,能否跑通数据闭环是最关键的风险点。

徐梦迪认为数据采集需要融合多种方案,不同的数据类型适用于不同的阶段。远程操作数据最接近机器人本体,适合在微调阶段使用;仿真数据能够提升模型对视觉变化的鲁棒性,适合在预训练阶段使用;UMI数据介于两者之间,采集成本更低;而人类数据成本最低,能够快速覆盖不同场景,虽然人类和机器人的形态有差异,但可以通过形态迁移的方式学习,人类数据中蕴含的场景变化和任务信息是非常宝贵的。

徐梦迪给年轻研究者的建议有两点,一是多看多交流,充分吸收领域内的知识,才能找到自己真正感兴趣的方向;二是要动手实践,只有实际操作才能了解领域真正的难点,比如真机部署需要积累大量经验。她在面试博士生时经常会问“你最感兴趣的一篇文章是什么”,通过这个问题考察学生对领域的了解和研究品味。她目前也在带领本科生开展研究,组会采用教程的形式,先从科学史的角度讲解领域发展,再让学生分享自己的项目,为学生提供学习前沿研究的平台。

快问快答环节中,徐梦迪透露自己今年30.5岁,MBTI是INTJ,星座是摩羯座,她当前花时间最多的研究方向是让机器人能够从现实场景中不断持续提升自己。她表示自己从CMU之后就一直沿着泛化方向开展研究,当时受到GPT-3的上下文学习能力启发,开始思考如何让机器人也具备类似的能力。

徐梦迪坦言自己共情能力很强,能够敏锐观察到团队成员的情绪变化,在非工作时刻更注重团队凝聚力,希望实验室的成员不仅仅是同事,更是能够长远信任的朋友。她和团队经常团建,比如一起唱歌,共同建设实验室就像创业,和博士生们的信任磨合得很好,大家都有共同把事情做好的愿望。她日常使用ChatGPT和Gemini,不仅用它们来总结内容和做调研,还会和它们讨论对事件的看法,甚至让AI帮忙给实验室起名字,给出的建议都很不错。她也注意到近期机器人领域的论文数量翻倍增长,很多论文都有AI生成的成分,虽然这些论文能够通过审稿,但整体质量不如人工撰写的,论证往往存在漏洞,她对这类论文的兴趣会大打折扣。

徐梦迪认为当前具身智能的发展大概相当于马拉松的10公里,也就是四分之一的路程,通用的智能机器人还没有实现落地,还有很长的路要走,但她整体比较乐观,认为未来3到5年将会看到规模化带来的明确范式转变。

以上内容不代表本平台立场,仅供读者参考