文章摘要
8月19日,Generalist发布新一代机器人基础模型GEN-1.5,其核心突破是改变机器人学习新任务逻辑,采用“物理提示”,让机器人看演示即学新任务,学习成本逼近零。与上一代模型相比,它虽成功率低,但更能适应长尾任务。目前它还只是研究发布,不过展示了清晰路线,有望让机器人成为大众可用的基础设施。

人们总是高估未来两年的变化,而低估未来十年的变化。

8月19日,国内人形机器人企业登陆科创板,首日股价一度暴涨超6倍,资本市场对机器人硬件赛道的热情被彻底点燃;而在大洋彼岸的美国剑桥,一间实验室里的双臂机器人刚刚完成了一次令人惊艳的即兴操作。

人类演示了拉开钱包取出钞票的动作后,这台机器人第一次尝试用右手抓取却没能成功——但它没有陷入卡顿,没有机械重复同一个动作,也没有等待程序员介入,而是自动切换左手,顺利完成了取钱流程。

在场的记者观察到,这台机器人的应变能力远不止于此:当演示用的刷子被提前拿走后,它改用簸箕完成了清扫积木的任务;当桌面只剩一根香蕉时,它甚至将香蕉当作临时刷子,完美复刻了同样的清扫动作。这是外媒记者在现场记录下的真实场景,而这台机器人正是搭载了新一代模型GEN-1.5的通用机器人。

一个值得关注的对比数据是:GEN-1.5在陌生任务上的平均成功率仅为59%,而它的上一代模型GEN-1,在专项任务上的成功率可以达到99%以上。这个看起来「暴跌」的成功率数据,却让行业内部感到兴奋——真正的变化并非可靠性,而是学习新任务的边际成本。

GEN-1.5第一次让机器人学习新任务的成本逼近了零,这也让我们不禁思考:机器人的ChatGPT时刻,或许真的越来越近了。

机器人终于有了自己的提示方式

8月19日,Generalist正式发布了新一代机器人基础模型GEN-1.5。这款模型的核心突破,在于彻底改变了机器人学习新任务的逻辑。

传统的机器人训练中,人类需要为单个任务收集数小时的专项数据,经过多轮后训练调整模型参数,最终让机器人可以稳定完成标准化动作,就像培养一个动作精准的熟练工人。而GEN-1.5的逻辑完全不同:人类只需要在机器人面前完成一次3到12秒的任务演示,这段动作会被编码为传感器-动作序列,直接送入机器人的上下文窗口,不需要修改任何模型参数,机器人就能现场理解并执行任务。

这种模式被称为Physical Prompting(物理提示),就像我们给大模型粘贴几个示例prompt一样,机器人不需要重新训练,只需要「看一眼」演示,就能理解任务的核心逻辑。更细节的是,当演示场景和实际执行场景存在差异时——比如积木的颜色、摆放位置发生变化——机器人依然可以完成任务,这说明它复刻的不是一段录像,而是任务本身的核心逻辑。

根据官方发布的技术文档,GEN-1.5提供了两种核心运行模式,我们可以通过一组数据清晰对比两者的差异:

模式 新任务数据 是否训练 平均成功率
GEN-1「任务精通」 约1小时 需要后训练 99%+
GEN-1.5「Physical Prompting」 3–12秒、一次演示 不训练 59%
GEN-1.5「快速适应」 5分钟、约50次演示 10个梯度步骤 83%

今年4月发布的GEN-1,走的是工业标准化路线:为单个任务投入约1小时的专项数据,经过后训练打磨后,成功率可以稳定在99%以上,适合需要极致精准的专项场景。

而GEN-1.5则做出了完全不同的权衡:不需要更新模型参数,不需要重新训练,只需要一次3到12秒的演示,就能执行全新的任务。如果愿意多投入5分钟,进行约50次演示并进行10个梯度步骤的微调,成功率可以提升到83%。

简单来说,GEN-1解决的是「机器人能不能把一件事做熟」的问题,而GEN-1.5试图解决的是「机器人能不能立刻学会一件新事」的命题。

为什么59%比99%更有意义?

第一眼看到59%的成功率,很多人会觉得这只是一个普通的实验数据,算不上突破。但决定机器人产业形态的,从来不是单个任务的成功率,而是新增任务的成本结构。

GEN-1的99%代表的是「把单个任务打磨成标准化流程」的能力,就像自动化工厂里的专用机械臂,只能完成固定的几种动作,但精度极高、稳定性极强。这种模式适合少数高标准化的场景,但无法覆盖现实世界中大量的长尾任务。

而GEN-1.5的59%,代表的是「把陌生任务变成可执行任务」的能力,更像人类的学徒:不需要长时间的专项训练,只需要看一遍演示就能上手尝试,之后再在实践中逐步优化。

现实世界的需求从来不是10个标准化任务,而是10万个充满变数的长尾任务。过去几年机器人落地的最大障碍,从来不是能不能完成某个任务,而是「每增加一个任务都要重新投入成本」:数据收集成本高、训练成本高、部署和维护成本高,最终导致「做得出来,但无法规模化落地」。当学习新任务的成本降到「看一眼就会」的程度,机器人才能真正覆盖服务业、制造业和家庭场景中那些不需要专门编写程序的小事。

这个逻辑我们其实在大模型时代已经见过:早期的软件需要为每个任务编写专门的规则,而现在只需要给出一个prompt和几个示例,就能快速适配新的场景。现在,同样的逻辑正在从文本世界延伸到物理世界。

并非首个单样本学习机器人

单样本模仿学习并非今天才出现的技术:2024年的ICRT研究已经尝试用传感器-动作轨迹提示机器人完成新任务;今年6月的Behavior Prompting Policy直接提出了「用一次人类演示作为行为提示」的思路;7月NVIDIA等团队发布的RoboTTT,将机器人上下文窗口扩展到8000个时间步,展示了基于人类视频的单样本模仿能力和长任务执行能力。

所以更准确的表述是:GEN-1.5并非首个单样本学习机器人,按照Generalist官方的说法,它是目前已知的第一个「在大范围灵巧、闭环物理任务上,普遍展示出单样本/少样本演示学习能力」的模型。此前的同类研究要么只能覆盖有限的任务变体,要么局限于特定物体、任务类型或传感方式。

行业内的研究者也给出了积极评价:外媒报道中,佐治亚理工学院的Danfei Xu认为Generalist团队可能是目前「最接近可部署的通用机器人模型团队」之一;斯坦福大学的Karen Liu则指出,这种不绑定单一机器人硬件的大规模物理数据训练路线,已经开始展现出实际效果。

三大技术路线:语言、反馈与演示

如果把具身智能看作一个整体赛道,头部团队其实在押注三种不同的提示思路:

其一,Physical Intelligence的π0.7模型,通过语言、元数据和视觉子目标进行提示,将已有的技能重新组合以解决陌生任务,优势在于语义控制、长任务执行和跨机器人形态迁移,也就是「用语言提示」;

其二,Skild AI的技术路线,让机器人根据执行失败的反馈在上下文窗口中调整身体控制,重点在于跨机器人形态的运动能力适配,也就是「用反馈提示」;

其三,Generalist的GEN-1.5,直接将「新任务的传感器-动作演示」作为提示,也就是「用演示提示」。

这三条技术路线大概率会走向融合:语言告诉机器人「要做什么」,演示告诉机器人「怎么做」,反馈则帮助机器人「修正错误」。

香蕉当刷子:理解、模仿还是模式匹配?

回到那根香蕉的场景:当机器人用香蕉代替刷子清扫积木时,很多人会立刻认为它「理解了刷子的功能」。但严格来说,这可能是真正的理解,可能是简单的模仿,也可能只是训练数据和上下文提示在高维空间中形成的相似模式——它只是看起来像理解。目前并没有公开的研究证据可以明确区分这三种情况,Generalist团队也没有给出相关解释。

但比「是否真正理解」更务实的看点在于:当任务演示可以直接送入机器人的上下文窗口,我们第一次可以用「提示工程」的思路来研究和优化机器人的行为。未来或许会出现一个全新的工种——物理提示设计师:他们知道如何通过一次演示让机器人学得更快,也知道机器人容易在哪些环节出现偏差,如何通过更精准的演示提升成功率。

如果这条路线得以落地,机器人产业的分工也将发生改变:不再需要程序员为每个任务编写代码,而是普通人可以通过简单的演示教会机器人完成新的工作。

同一天的大洋两岸

GEN-1.5发布的同一天,国内人形机器人企业登陆科创板,首日股价一度暴涨超6倍,最终收盘涨幅接近460%。次日,该企业创始人对「具身智能的ChatGPT时刻」给出了具体定义:当机器人进入陌生环境,可以完成约80%的常规任务时,就标志着这个时刻的到来。他判断,乐观情况下这个时刻会在两三年内到来,保守估计则需要五到十年。

把这两个事件放在一起看,可以清晰看到全球具身智能赛道的分工差异:

国内的机器人企业正在快速解决机器人的「身体」问题:通过优化硬件成本、完善供应链体系、提升工程化能力和出货量,让机器人从昂贵的专用设备变得更加普及,资本市场也在为这个赛道集中下注;

而美国的基础模型团队则在解决机器人的「大脑」问题:让机器人可以在陌生环境中现场学习,打破了「每更换一个任务就需要重新训练」的旧模式。

按照该创始人的80%成功率标准,GEN-1.5的59%成功率还有明显的差距,但它展示了一条清晰的前进路线:不再追求将每个任务都训练到99%的完美精度,而是将学习新任务的成本降到接近零,再通过迭代逐步提升可靠性。

当机器人的硬件成本足够低、出货量足够大,同时学习新任务的边际成本趋近于零,机器人才能从「少数人的专业设备」变成「多数人可以使用的基础设施」。

写在最后

需要明确的是,GEN-1.5目前还只是一项研究发布,并非可以直接下载使用的模型或量产产品:它没有开源模型权重,没有发布完整的技术论文,也没有经过第三方的统一评测,目前演示的任务也仅局限于十项简单的短时桌面操作。

因此,将其看作一个「值得高度关注的能力信号」,比直接宣布「机器人的ChatGPT时刻已经到来」更加准确和负责任。

但这个信号本身已经足够清晰:过去,机器人学习每一项新任务都需要投入大量成本;而现在,新任务第一次变成了一个可以直接使用的提示。

大洋的一边,正在让机器人从「昂贵」变得「普及」;另一边,正在让机器人从「笨拙」变得「会学习」。最终的落地场景还很遥远,但前进的路线已经比以前更加清晰。

以上内容不代表本平台立场,仅供读者参考