物理AI迎来GPT时刻:机器人真正有用的三大关键

让机器人在现实世界里真正发挥作用,到底需要什么?
今年5月,行业观察者分享了英伟达相关负责人的演讲内容,将机器人技术路线类比大语言模型的发展路径,并提出时间表:物理图灵测试有望在2-3年内实现,机器人技术抵达终局的时间点为2040年。
同年8月,国内人形机器人企业宇树科技登陆科创板,成为A股首家上市的人形机器人公司;大洋彼岸的Physical Intelligence则在2025年11月完成最新一轮融资,估值达到56亿美元。资本市场的热捧背后,不同团队对“让机器人真正有用”的核心条件却有着不同的理解。
而Physical Intelligence联合创始人Chelsea Finn在YC Startup School的演讲,则直接给出了答案:可靠性、记忆,以及一个无需微调的通用模型,是让机器人在现实世界中真正发挥作用的三大核心要素。她在演讲最后也提出,物理AI已经站在通用AI时间线的右侧,走到了属于自己的GPT时刻。
嘉宾背景
Chelsea Finn是Physical Intelligence联合创始人,同时担任斯坦福大学助理教授。2017年她在伯克利读博期间提出了MAML(模型无关的元学习),通过训练一组通用初始参数,让模型面对新任务时仅需少量样本、几步梯度更新就能完成适配,将“与其为每个任务训练一个专家模型,不如让一个模型具备适应所有任务的能力”从理念变成了可优化的技术目标。
演讲全文
“各位好!今天我要谈的是Physical Intelligence最近的一些技术进展。两年前我创办了这家公司,我们真正关心的核心问题是:如何让任意一台机器人,在现实世界中完成任意一项任务?”
“去年我也曾在这个场合分享过我们的进展,当时我们已经能让机器人完成从烘干机取出衣物并折叠这类复杂任务,还实现了机器人首次在从未进入过的陌生房间里完成有用工作。在过去的一年里,机器人的能力又有了大幅提升:它能清洗油腻的锅具、削胡萝卜、制作烤芝士三明治、切西葫芦,还能完成开锁等操作。”
“不过今天我不想谈论机器人能完成多少炫技动作,而是想回到最本质的问题:让机器人在现实世界真正发挥作用,到底需要哪些条件?这里面有两个核心方向:一是如何开发具备通用性的机器人模型,二是如何将模型落地到现实场景,让它真正产生实际价值、对人有用。我们先从第二个方向说起。”
物理AI的容错空间与此前所有AI都不同
“要回答如何将模型落地到现实,我们可以先回顾一下此前的AI是如何进入实际应用的。”
“最早真正普及的机器学习应用是商品推荐和广告排序,五年后深度学习技术进入了同样的应用场景。这一步至关重要,因为深度学习可以开箱即用地处理输入输出都很复杂的问题,并且相对容易迁移到其他应用中。2022年推出的ChatGPT则是通用模型大规模落地的标志性事件,仅用五天就达到了100万用户;之后像Claude Code这样的代码代理工具也真正变得可用。”
“沿着这条时间线看,通用模型正越来越多地被用于解决现实问题。但有一个共同点值得注意:在所有真正有用、能够盈利的机器学习应用中,最终做决策的都是用户本人,模型基本只负责提供建议。这意味着系统犯错是可以接受的——用户通常能识别出错误,或者即便出错也知道该如何补救。所以哪怕这类系统并不完美,对用户依然有很大价值,外界要求它们做到百分百完美的压力也相对较小。”
“但物理AI和这些应用完全不同。真正在物理世界运转的物理AI,必须做出直接影响物理世界的决策,它的价值只有在完全自主运行时才能得到最大体现。因此,相较于目前已部署的所有机器学习系统,物理AI必须做到极少犯错。”
“有没有先例可以参考?一年前,Alphabet旗下的自动驾驶公司Waymo单周自动驾驶载客量突破了25万次,这说明基于机器学习、能够在物理世界可信地自主运行的系统,确实是可以实现的。”
要素一:把迭代权交给系统
“要让通用机器人在现实中派上用场,我们需要思考如何让它能够长时间自主运行,而不是依赖人类拿着模型的预测去做决策。”
“举个例子,假设我们要让机器人制作一杯浓缩咖啡。这个任务本身就充满挑战:操作冲煮手柄需要精准且有力的控制,才能正确锁进冲煮头;还要平稳端住装有液体的杯子,避免洒出;同时还需要准确的时间感——而时间感在其他机器学习领域通常根本不是问题。我们的目标不只是完成一次任务,而是要让它的可靠性达到90%以上。”
“机器学习的常规流程是收集数据集、训练模型、评估性能,但遗憾的是,这套方法很少能在第一次尝试就达到可靠的效果。”
“实践中稍好的做法是在已有模型上迭代:收集更多数据、提高标注质量、细化标注细节、补充边缘场景数据、调整数据配比。这确实能提升可靠性,但完全依靠人工手工调校,最终会让人感到疲惫,可靠性也很难维持在极高水平。”
“更好的思路是让AI系统自己在需要提升可靠性的场景中迭代——由它主动寻找缺失的数据和需要更多监督的环节。既然整个过程是自动化的,迭代轮次就能大幅增加,这可能才是让物理AI达到99%以上可靠性的路径。”
“这套思路本身很像强化学习:不断尝试任务、从失败中学习、持续改进自身能力。但问题是,如何为机器人开发一套可扩展的强化学习方案?”
“语言模型领域有PPO、GRPO这类主流的强化学习策略优化算法,它们已经扩展到大语言模型场景,支撑起了相当复杂的推理任务。但迁移到机器人领域会遇到麻烦:这类算法通常需要几百万甚至几千万次尝试来训练,依靠堆叠算力就能完成,每一次尝试不过是在数据中心里运行一次语言模型。”
“我们可以粗略换算一下量级:就算不需要几千万次,只要100万条1分钟长的机器人任务轨迹,就相当于700个机器人日的工作量,才能把一个任务做到高可靠水平。这并非完全不可能,但实现难度相当大。”
“难点在于两者的成本性质不同:我们不是单纯通过算力优化单个用例,而是要在现实世界中运行真实的机器人,使用真实硬件尝试真实任务。因此我们需要迭代效率高得多的算法,而语言模型的强化学习中存在两笔巨大的浪费。”
第一笔浪费:大量时间被耗在死路上。
“比如我们要让机器人折叠纸箱并码放整齐,在某次轨迹中,机器人意外抓起了两个紧贴在一起的箱子。如果放任它继续,它只会一直尝试折叠这个合并的箱子,而不会先将两个箱子分开。‘同时折叠两个箱子’并不是能教会模型完成任务的有效数据,机器人等于在错误的路径上白白消耗时间。”
“与其让它继续耗下去,不如由人工介入直接示范正确的恢复方法。画面中,操作员正在通过遥操作演示‘要恢复操作,得先把两个箱子分开’。夹爪伸进去之后,我们观察机器人能否自行接续任务;如果没有成功,就再介入一次把它拉回正轨。这样一来,机器人产生的每一份数据都能得到更高效的利用。所以,尽早告诉机器人如何从错误中恢复,别让时间浪费在死路上;再不济,也要尽早结束这一轮尝试。”
第二笔浪费:同一个prompt被反复采样。
“PPO、GRPO这类算法本质上是在评估不同输出结果的优劣,因此哪怕只是一个prompt,它们也会进行10次、50次rollout,也就是完整运行模型生成一次回答,来评估每次尝试的价值,再提升优质结果的概率、降低劣质结果的概率。”
“但这笔成本可以被摊薄:与其为单个prompt收集大量尝试,不如将成本分摊到不同的prompt上,训练出更通用的价值估计模型,再用它来改进自主系统。”
“具体做法是在大量机器人经验的视频上训练一个通用价值函数,用来判断当前局面离成功还有多远。它能学到,叠衣服时不小心抖开衬衫是负向进展,而正在推进的动作则会被识别为正向信号;同一个价值函数也能判断完全不同场景中的有利与不利,比如从冰箱里取东西。这种通用价值模型本质上是在预测达成目标所需的时间,能显著减少从经验中学习改进所需的尝试次数。”
“有了这两处改进,我们就凑齐了一套通用的改进算法:先在多样化数据上训练基础模型;用它收集经验,必要时由人工介入避免死路轨迹;再训练一个通用的好坏估计器,也就是价值函数;最后用它来改进模型。”
13小时不停机:可靠性的真实工作流实测
“靠这套改进方法,我们可以对基础模型进行微调,以达到更高的性能水平。”
“我们先以拿铁制作为例,这是一个人机协作任务:机器人负责制作浓缩咖啡,人类负责打奶泡。模型直接控制机器人关节,输入为机器人摄像头拍摄的画面。它能完成插入冲煮手柄、等待合适的萃取时长、将打好的奶泡倒入杯子等一系列颇具挑战的动作。而最后一步最难:它需要将几乎装满的拿铁稳稳端起,平移到杯垫上而不洒出。从机器人的第一视角,我们能直观感受到这类任务的难度。”
“回到可靠性测试,我们将这个策略连续运行了13个小时,而不是仅测试一次。我们要评估的不是它能不能做出一杯拿铁,而是它能否可靠到在现实世界中派上用场的程度。结果证明,机器人足够可靠,能够连续工作很长时间而不频繁出错。”
“这套算法当然不止能制作拿铁。我们在附近的Dandelion Chocolate工厂测试了一条人工工作流,让机器人完成折纸箱、贴标签、码放的任务,用前面提到的强化学习算法训练机器人按照工厂的真实流程操作,最终得到的策略在这三项任务上的表现都可靠得多。”
“我们还将这套方法应用到叠衣服任务中,这次测试的不是模型在单一环境中完成单一任务的能力,而是跨环境适配能力:使用机器人从未见过的衣物,在从未进入过的房间里操作。它成功完成了任务,并且能够连续自主工作很长时间。”
“视频不一定能说明全部问题,因此我们也进行了定量测量。我们既关心可靠性,也关心速度,比如每小时能折叠多少个纸箱,因此这里衡量的是吞吐量,它综合了成功率和速度两方面指标。结果显示,从预训练到类似监督微调的阶段,再到强化学习后训练阶段,成功率和吞吐量都有显著提升,其中仅强化学习阶段就带来了约2倍的吞吐量提升。至于浓缩咖啡任务,仅看成功率我们就达到了90%以上。”
“这表明,我们能够为复杂的机器人操作任务开发一套可扩展的高可靠性方案。这个案例中,我们通过经验积累和人工干预获得了2倍的吞吐量提升,但最重要的是,我们找到了在有意义的实际工作流中实现长期自主性的方法,这正是让机器人在现实世界中发挥作用的关键。”
“当然,这套算法我们只运行了几轮改进迭代,跑更多轮应该还能看到更大的提升和更高的可靠性。而且即便有了这些改进,机器人仍然会犯错,也依然比人类慢,改进的空间还很大。”
要素二:没有记忆,就做不了长任务
“要实现长时间自主运行,还差最后一个核心要素:记忆。”
“你可能会感到意外,目前最先进的机器人基础模型大多没有记忆或上下文感知能力,它们仅基于当前的传感器观测、摄像头读数来预测动作。对于短时运动技能和重复性任务来说,确实不需要记忆——我之前展示的那些视频也都没有上下文依赖。但如果要完成包含多个步骤、有先后顺序的长任务,记忆就至关重要,因为你需要追踪自己已经完成到了哪一步。”
“既然记忆这么关键,为什么现有的模型大多没有呢?其中一个技术层面的原因是:如果机械地将上下文直接输入模型,计算成本会高得难以承受。假设我们只输入10秒的视频,按照机器人中常见的50赫兹控制频率采样,四路摄像头的画面全部输入,每张图按约256个token计算,相当于向模型中输入50万个token。要实时做到这一点,目前相当困难。就算将采样率降到每秒一帧,也需要输入1万个token,成本依然很高,而且最终只能获得10秒的记忆。”
“我们对这个上下文问题的解决方案是让系统在多个时间尺度上都具备记忆能力。第一层是短期视频记忆,时长约10秒,但计算方式比直接将整个视频塞进模型要高效得多。对于更长的记忆,比如跨越几分钟甚至几小时的任务,我们不需要保存过去的完整视频,而是将这段历史转化为文本摘要:把发生过的事情在文本空间中进行总结,将这份覆盖过去10到15分钟的压缩文字摘要一同输入模型。”
“借助这种多时间尺度的记忆机制,机器人能够自主执行持续10到15分钟的任务,全程无需人工干预。比如‘清理厨房’这个任务:用海绵擦拭台面,用纸巾擦干台面并扔掉纸巾,将芥末酱放进冰箱,把碗碟收进橱柜,清洗水槽里的脏碗——机器人不再重复同一个动作,而是必须记住每一步的进展情况。”
要素三:把所有能力收进一个通用模型
“以上就是实现长时间自主运行的几个核心要素。接下来我想更进一步,将这些要素全部整合进一个通用模型,让它能完成我之前展示的所有任务,还能拓展更多能力。要思考这样一个通用模型该如何开发,将其放回通用AI的发展背景中理解会更有帮助。”
“回顾过去十五年,我认为第一个重大节点是2012年:一个从零开始训练的深度学习系统首次在ImageNet图像分类基准测试中登顶。在此之前,榜单上的所有方法都是为图像分类量身定制的,而这是第一次,一个更通用、并非专门为图像识别设计的算法超过了所有专用系统。”
“两年后的2014年,‘使用在ImageNet上预训练的模型再进行微调’成为了常规做法,使用BERT或ImageNet预训练模型确实能带来更好的性能。”
“再往后,大概从GPT-2开始,我们从‘预训练+微调’的模式转向了‘开箱即用’的通用模型。还有一个值得单独提及的节点:2021年,我们首次在这类模型中看到了组合泛化的迹象,最典型的例子就是DALL·E。”
“那物理AI领域的发展处于什么位置呢?”
“即使在三年前的2023年,对机器人研究者来说,专门收集一套定制化数据集并从头开始训练模型仍然是非常普遍的做法,这类似于为每个项目单独收集一份ImageNet数据集再进行训练——如果每个项目都要从零开始,你很难取得太多进展。”
“几年前我们还处在这条时间线的最左端,直到不久前才走到2014年的位置:我们已经有了一些不错的预训练模型,但还没有真正进入右侧的通用化区间。”
“那么如何到达右侧的通用化区间?具体来说,如何开发一个开箱即用、且展现出组合泛化能力的通用模型?这里有两个核心目标:”
目标一:开箱即用,类比过来就是从BERT走到GPT。
“目前来说,如果你想让模型在某个任务上获得最佳表现,总是需要进行微调——文章最开头的演示,比如开锁任务,使用的都是经过微调的模型,我们在人类到机器人迁移的其他工作中也需要微调,前文所有带强化学习后训练的视频,比如制作浓缩咖啡,同样是在单个任务上微调得到的。但如果每完成一项任务都需要微调一次,那你得到的就不是一个通用模型。”
目标二:组合泛化,灵感来自2021年的DALL·E。
“这个节点之所以重要,是因为模型能将‘牛油果’和‘椅子’这两个概念结合起来,说明它至少对这两个物体有了概念层面的理解——知道‘椅子’是什么,‘牛油果’是什么,从而能将两者结合创造出新的内容。其次,这意味着一定的数据效率:你的数据集不需要覆盖所有可能的概念组合,比如你不需要真的有一张牛油果椅子的照片。即便在2021年它并不完美,这些迹象也足够令人兴奋。”
“有了这两个目标,开发这类模型有一套久经检验的方法:第一,获取足够大且多样化的数据集;第二,训练容量足够的模型。”
“数据方面,我们尽量利用所有可用资源:非常多样化的机器人演示数据,包括质量较低的演示数据;策略执行数据,也就是机器人按当前策略实际运行留下的记录;所有用于强化学习的训练数据;人类视频;以及来自网络的数据。”
“模型方面,仅仅容量足够大还不够,还要能适配异构数据。我们发现,‘将模型预测动作所需的全部上下文通过prompt输入’,是处理这类异构数据的关键突破口。”
“具体来说,我们训练基础模型的输入包括:前文提到的记忆、要执行的任务指令、子任务指令,以及元数据,也就是标记数据质量和片段时长。此外,我们还可以选择性地提供子目标图像作为提示,意思是‘几秒钟之后,你应该到达一个看起来像这张图的状态’。”
“而要真正部署模型,这些输入需要有人提供,因此我们另外训练了两个模块:一个高层策略,用来生成子任务指令,比如‘清理厨房’的下一步是什么;一个世界模型,用来生成子目标图像。”
“就这样,我们利用所有多样化的数据训练出了一个单一模型,我们称之为π0.7:它能折叠有领衬衫,能完成螺丝插入并拧进机械臂这类非常精细的装配步骤,还能更换垃圾桶的垃圾袋——所有这些任务都由同一个模型完成。”
两个目标的验收,与物理AI的GPT时刻
“开箱即用只是第一步。真正关键的问题是:这个预训练模型,跟之前那些专门为制作咖啡、折箱子训练的专家模型相比,性能差距有多大?”
“我们比较了单一的π0.7模型与经过微调的π*0.6模型在吞吐量和成功率上的表现,结果显示在所有测试项目中,预训练的π0.7都追平或超过了针对下游任务通过强化学习后训练开发的微调专家模型,这一点同样适用于经过监督微调的专家模型。也就是说,我们确实拥有了一个单一模型,能在开箱状态下以极高的性能水平执行多种不同任务——目标一达成。”
“再来看第二个目标,组合泛化。我们做了两个测试:”
测试一:机器人能否与空气炸锅这类罕见的电器交互。
“我们让它打开空气炸锅,放入一根红薯再关上。选择空气炸锅是因为我们从未刻意采集过任何包含它的训练数据。事后分析发现,数据集里确实存在三段与空气炸锅相关的数据,但我们认为即便拿掉这三段数据,它大概率也能完成任务。总体来说,机器人能够与训练集中几乎从未出现过的电器交互,将‘开/关’这类交互技能与特定物体结合。”
测试二:换一台完全不同的机器人,任务还能否组合性泛化?
“我们使用画面右侧的双臂UR5e工业机器人,想知道在开箱即用、不提供任何折叠衣物数据的情况下,它能否成功完成叠衣任务。结果它确实做到了。两台机器人不仅尺寸存在差异,连杆长度和关节构型也不一样。画面左上角能看到模型生成的子目标图像,那是它在尝试生成能推动任务前进的画面,这些图像再作为输入送回模型;最后它还会做几个小修正,让衣物更平整一些。”
“定量测试也验证了这一点:随着我们开发出π0.7这类更先进的模型,在这台它从未见过的平台上叠毛巾、叠衬衫的表现大幅提升,甚至接近人类遥操作的水平。”
“所以结论是,无论是‘语言-物体’的交互,还是‘任务-机器人’的交互,我们都能观察到该模型展现出显著的组合泛化迹象——目标二达成。”
“最后一个实验可能是最有意思的:前文提到的多样化数据和详细的条件控制,这两个要素到底有多重要?”
“先看数据多样性:如果将最多样化的那部分数据从训练集中移除,模型在保留任务上的表现会急剧下降;而如果只是随机移除20%的数据,也就是多样性不如最多样子集的数据,表现只会小幅下降。这说明真正多样化的数据在帮助模型泛化到新任务上起到了关键作用。”
“再看元数据提示:我们做了一组消融实验,也就是移除某个组件观察性能变化,用来判断它的重要性,对比‘有提示’与‘无提示’的效果。最有趣的是曲线的走向:随着加入越来越多的数据,尤其是低质量数据,没有元数据提示时,性能反而会下降——这不算意外,毕竟你是在数据配比中加入了低质量数据。而有元数据提示时,加入同样这批数据,性能反而会上升。”
“顺带一提,我展示的所有视频和实验,评估的都是开箱状态下的模型,没有经过任何后期训练。”
“我们已经讨论了长时间自主运行,也展示了如何在通用模型中实现这种能力。那么回到最初的问题,机器人技术现在到底发展到哪一步了?”
“回到通用AI的时间线,我认为物理AI现在已经稳稳站在这条线的右侧,大致处于类似GPT和DALL·E的时代,而且我们只用了几年就走到了这里。”
“更重要的是,这些模型已经部署到了真实场景中。两家YC公司Ultra,做电商打包业务,和Weave,做家用叠衣业务,使用PI模型进行后训练,在实际部署中完成了折叠衣物、仓库打包等任务。而这类模型能够适配的机器人本体也非常多样:除了标准的双臂平台,还有无人机、四旋翼飞行器、手术机器人,乃至拖拉机。未来,我相信会有越来越多的机器人不再停留在演示和研究阶段,而是真正部署到物理世界中。”
现场问答
问:我们离机器人的ChatGPT时刻还有多远?它会是什么样子?
“我先回答后半段。我不太确定它会复刻语言模型的ChatGPT时刻,也就是五天内突破一百万新用户。物理模型的分发渠道会慢得多,因为你真的需要实体机器人在场。Waymo的铺开速度已经相当了不起,但将系统部署到物理设备上仍然需要时间。”
“所以,我不确定我们会迎来一个用户量能与ChatGPT相提并论的时刻;但就模型能力而言,我认为我们确实已经进入了‘这些模型在现实世界有用’的阶段,未来几年内达到ChatGPT当时的能力水平是非常有可能的。”
问:一个小团队什么时候该从‘把专用模型做大’转向‘通用策略’?这个转换是什么样子?有哪些信号说明时机到了?
“我认为一上来就使用通用策略再进行微调就已经非常有效。现在有不少很强的开源通用策略可用,比如π0和π0.5,我们已经看到很多人从这些模型中获得了实际成果。”
“唯一我不会建议这么做的场景,是你处在约束极强的环境中。我和一些做手术机器人的团队聊过,他们在地下室的手术室工作,没有网络连接,GPU性能也很差,这种时候使用大模型确实很困难;不过即便如此,你依然可以在工作站上进行本地推理。”
“所以直接拿π0.5或者你顺手的模型来微调,就是正确的路径。”
问:鉴于机器人技术在工业界发展如此之快,如今读博的真正优势和劣势是什么?尤其对于之后想进入工业界的人来说。
“我原本没打算读博,而是想一毕业就进入工业界。我的父母都是工程师,也都在工业界工作,我父亲甚至说过他不会雇佣博士,所以我当时觉得读博可能会找不到工作,不过他的领域是土木工程。”
“但我也认为读博是一个非常难得的机会,我个人非常喜欢我的博士阶段。首先,读博是学习‘如何应对不确定性、如何挑选好课题’的绝佳机会。在研究中没人会把问题直接递到你手上,你必须自己选择课题;而且你也不知道这个问题在未来半年、两年甚至十年内能否取得进展。应对不确定性的能力在今天格外有用,因为在AI前沿和创业环境中,没有人知道让模型变得更强的最佳路径是什么。”
“其次,读博也是做出色研究的机会,你有很大的自由去做真正令你兴奋的事。”
“与此同时,工业界的机会同样难得。我刚才展示的所有成果背后不只有研究:机器人需要在一整套软件栈上可靠运行,硬件方面也有很多工作要做,还有机器学习基础设施、数据基础设施。其中很多工作并不需要博士学位;研究岗通常也有参与机会,何况如今很多研究本身就是工程。”
“所以这完全看个人。哪怕在今天,我想我还是会读博——为了学会应对不确定性、学会做研究,也因为我真的喜欢留在前沿思考有挑战的课题。但两条路上都有很好的机会。”
问:大语言模型从互联网学习,但机器人并没有一个互联网规模的物理经验数据集。机器人领域的对应物是什么?我们怎么得到它?
“先说语言模型:网络上的数据是语言数据,并非全部高质量,但其中一部分非常有信息量,而且这些数据反映了你希望模型去做的事——你希望它预测文本、补全文本、回答问题,而互联网上正好有大量被回答的问题和被补全的文本。机器学习有个通则是‘训练要匹配测试’,也就是你训练模型用的数据,需要能反映你之后要它完成的任务。”
“所以我认为机器人领域的对应物,是机器人在真实世界环境中运转的数据。我们的做法是采集机器人经验,采集它完成各种任务的数据。初始数据可以通过遥操作采集,但长期来看,其中也会包含大量自主经验,也就是部署出去的机器人自己尝试任务留下的记录。这和语言模型的现状一致:现在有大量时间花在生成数据上,做法就是让模型运行起来,让它‘思考’一遍事情的过程。”
“我认为还有其他信息源对训练很有帮助,比如人类做事的视频、YouTube视频、带标注的网络图片,它们能告诉你‘这是一个厨房,水槽右边有个冰箱’。这些数据对开发能控制机器人执行任务、能推理长任务该如何进行的前沿多模态模型非常有帮助。”
“但机器人自身的经验是无可替代的。你不能光靠看:我看费德勒打网球,不代表我就能打得和他一样好;同理,机器人也不能光看人类做某件事就自己弄明白怎么做,它们必须在自己的本体上积累经验才能有效学习。我认为我们会需要非常大的数据集,这不是说人类视频没有帮助,看费德勒打球是有用的,但在机器人平台上真实积累的经验,才是构建机器人领域对应数据集的关键。”
问:通用机器人模型有没有可能像大语言模型那样通过开源被普及?还是说,具身数据和硬件的成本会让最好的模型继续集中在少数资源雄厚的实验室手中?
“我认为具身数据和硬件成本很可能让这件事变得不一样,因为获取数据更困难,即便你想蒸馏模型,也不像在互联网上获取数据那样随手可得。”
“但我们也确实看到过相当大的数据集被开源,相当强的模型被开源。在语言模型领域,先不说那些真正做到前沿水准的开源模型,就连那些重心放在闭源上的公司也在大量开源模型,比如Gemma、OpenAI的开源模型。这些公司愿意支持开源,是因为开源能帮助他们建立起自身业务周围的生态。”
“所以我对此持乐观态度,我认为无论如何都会有一个强大的开源社区,但我不确定它是否会完全按照语言模型的路径发展。”
问:模型是直接输出原始电机指令,还是输出一个目标手部位置、再让控制器求解关节角度?为什么说这是合适的学习层级?
“我展示的所有模型,输出的都是目标关节位置——也就是每个关节应该到达的角度,然后由一个控制器,比如PD控制器,让关节达到目标位置。模型同时也被训练去预测目标夹爪位置,也就是夹爪应该处于三维空间中的哪个位置,你也可以用这个结果反解出关节角度。当然,你也可以更底层,直接输出电机力矩、电压或力度。”
“不同选项各有利弊。我们发现,控制关节和控制夹爪在三维空间中的位置这两种方式都表现良好。直接输出电压这类做法的好处是,你还能控制输出的软硬程度;而如果控制器是固定的,模型就无法支配这个维度。”
“不过我们现在使用的目标关节位置+PD控制器的方案看起来是有效的,它不像是性能瓶颈所在。我通常倾向于把精力放在那些确实是瓶颈的地方。”
问:机器人是否需要某种‘想象力’,也就是在真正变得有用之前,能够预想接下来该发生什么的能力?
“我刚才展示的π0.7就有类似的能力:它能想象未来的画面应该是什么样子,再试着去达成目标。在叠衬衫的例子中,使用这种‘想象’能力相比不使用,我们看到了量化上的性能提升。”
“我们原本考虑就这项能力单独写一整份技术报告,但‘不带想象力’的模型本身就足够强。我们觉得应该让‘不靠想象力也能做到这一步’在整个故事中占据更重的分量,因为真正撑起那些强结果的是模型本身的能力,而不是这项‘想象’能力。”
“所以这更像是一个设计选择,很难说‘想象’会不会成为关键组件。不过我认为,‘预测未来’相对于‘预测未来动作’是一个高度相关的训练目标,应该有助于从所有可用数据中学习。经验上它目前确实有帮助,只是可能没有你预期的那么大;而即便没有这种想象力,机器人也已经能做出相当惊人的事情。”
问:现在机器人似乎能完成很多令人惊叹的任务,但动作非常慢。要提升速度需要什么?
“我对提速这件事非常期待。强化学习确实带来了速度提升,在RL Tokens项目中我们展示过比人类遥操作更快的速度。”
“我认为瓶颈之一在于:遥操作是教机器人做事最简单的方式,而人类遥操作的动作本身就偏慢。说到底,要么你想办法让演示本身变快,要么你想办法让策略跑得比它学习的演示更快。我们已经看到了后者的证据——在RL Tokens项目中,策略的速度超过了人类遥操作。”
问:最近你见过的最让你意外的机器人任务是什么?接下来你最想看到它做什么?
“最让我意外的不是某个单一任务。我们在训练π0.7时,让它组装风车:拿起预先裁好的纸片,拿起一根小针,把针插进纸上的孔里。我们特意控制了训练策略,所有数据里都是右手拿针、左手拿纸,然后完成插入动作。”
“机器人一开始也是这么做的,然后它出了个错:纸落到了右边,针落到了左边。而它接下来做的是:拿起纸,用左边的夹爪拿起针,再用右手把针插进纸里——它从未见过用左夹爪插针的数据,不管是在后训练还是预训练数据中都不存在。这说明机器人本质上学到了左右手之间的某种等变性,能将行为从一只手迁移到另一只手,这是我此前在这类模型中从未见过的涌现能力。”
“至于接下来想看到什么,我不太会去想某个具体任务,更多的是想能力本身,以及如何从这些模型中获得下一个能力提升。在‘让机器人长时间可靠地做事’这个方向上,还有很长的路要走。最近我们在做的一件事是让机器人用刀切菜,一旦能安全地使用刀具,这里面能做的事情就非常多了。”
问:有软件工程背景的人,怎么转换到机器人赛道?
“首先,机器人赛道本身就有大量软件工程工作,你可以试着以软件工程师的身份加入一家机器人公司。”
“另一条路我确实见过有人走通。有位现在在Physical Intelligence工作的同事叫Jenny,她之前做算法交易,后来在Harvey做法律相关的工作。她对机器人非常感兴趣,就买了一台便宜的机器人,在自己卧室里摆弄,试着微调一个开源模型、让它完成一些任务。然后她把成果分享了出来,还给我发了一封邮件说‘我很想去你的实验室工作’。她的履历看起来非常有希望,因为她真的动手去做了、尝试了,而且是真的热爱这件事。”
“所以我认为,先动手实践、从经历中学习,再把成果分享出去、写进简历,就是很好的转型路径。现在开源的资源很多,足够让你上手实践。”
“好,这是最后一个问题,谢谢大家!”
补充:三个人,三条关于数据的路线
“在演讲开头提到的分歧:数据的规模究竟来自人类视频,还是来自机器人自身的经验,Chelsea Finn在本文中给出了立场,却没有展开背后的机制——为什么机器人的经验无可替代。”
“补上这层机制的,是Physical Intelligence的另一位联合创始人、加州大学伯克利分校教授Sergey Levine。他近期在Ryan Peterman主持的技术播客中谈到,语言模型依靠互联网数据取得成功之后,一种自然的推论是先用网络视频完成预训练,再把机器人数据叠加在上面。而他认为真正有效的顺序恰好相反:先用机器人数据建立起接地,也就是让模型的表征与真实的物理动作对应起来,有了这层基础,模型才更善于吸收其他来源的知识。”
“支持这一判断的论据,来自他的同事与佐治亚理工研究者合作的一项分析。他们拿Physical Intelligence自己的机器人基础模型,也就是一个只用机器人数据训练、从未见过任何人类视频的模型,再叠加人类视频数据,然后观察模型内部的表征发生了什么变化。结果显示,当机器人数据量较小时,人类经验与机器人经验在模型内部是两类互不相干的表征;而当机器人数据的占比提高到全量,这两类经验转而按任务本身归类,几乎不再区分某个动作是由人还是由机器人做出的。”
“Sergey Levine同时还提到三个未被本文覆盖的判断:”
“第一是时间表。他认为人形机器人真正可用的时间尺度是‘个位数年’,而非十年以上。至于什么算‘真正可用’,他给出的判断依据是,模型进入一个未曾用于训练的新环境后,能靠自主经验持续改进到实用水平,而不是停在50%左右的准确率。”
“落地路径分为两端。一端是结构化程度高的场景,比如周围都是受过训练的作业人员、任务相对可预测的作业环境,这类场景安全顾虑小,可能就在当下或明年就能实现,但每一份数据的边际价值也更低,因为环境缺少多样性。另一端是家庭这类完全非结构化的环境,多样性一开始就很充分,代价是对安全的要求高得多,还需要更长时间,不过大概率也不会拖到十年之后。他把这个取舍概括为:起飞得早但斜率小,起飞得晚但斜率大。”
“第二是演示为何具有误导性。泛化是需要多次试验才能体现的属性,而不是单次试验能够证明的。一段高难度的杂技式表演看上去很有冲击力,但它和‘在从未见过的物体、从未进入过的环境里,把一件平淡的事做成’,完全不是一个难度级别。”
“第三是关于中国机器人生态。他没有回答谁更领先,而是把话题转向生态的健康程度。在他看来,除模型与算法之外,供应链、制造与硬件研发同样是这个生态的组成部分;他也明确表示,机器人研究所使用的低成本可靠硬件,目前大量来自中国。”
“最后这一点,恰好补上了本文没有展开的另一部分。Chelsea Finn这场演讲讲的全部是‘大脑’——可靠性怎么拿到、记忆怎么装进去、一个模型如何覆盖所有任务。但一个能开箱即用的通用模型,前提是它有足够便宜、足够可靠以及足够标准的‘身体’可以附着,而那部分能力不在实验室,在供应链和制造业里。”

