具身智能新里程碑:GEN-1.5实现83%操作成功率

8月中旬的机器人行业迎来一连串热点:19日,宇树科技正式在科创板挂牌上市,市值突破600亿元大关;当天,英伟达CEO黄仁勋的女儿现身北京,参观了正在举办的世界机器人大会;而就在次日凌晨,硅谷机器人初创公司Generalist AI推出了全新的具身智能基础模型GEN-1.5,迅速点燃了整个行业的讨论热情。
就在两个月前,这家公司刚刚完成4亿美元的融资轮,斯坦福大学教授李飞飞以个人身份参与投资,小米联合创始人林斌、Zoom创始人袁征也加入了天使投资人阵营,英伟达同样是重要股东,一众行业顶尖资本和专家纷纷押注这个赛道。
GEN-1.5展示的核心能力正是这轮融资的最佳注脚:只需为机器人展示一段3至12秒的动作演示,无需任何训练或微调,它就能当场复现任务;在10项不同的操作任务测试中,模型的平均成功率达到了59%。
这彻底改变了机器人开发的成本与周期:过去教会机器人拧开瓶盖,工程师可能需要花费数月时间编程调试,或是投喂数万条训练数据反复调参;而现在,只需要一段3秒的动作演示,加上零行额外代码就能实现。不少行业顶尖研究者将这次发布类比为2020年GPT-3的横空出世,认为具身智能正式迎来了属于自己的「GPT-3时刻」。
无需刻意训练的即兴策略,从预训练中自然涌现
研发团队做了一个经典实验:先用5分钟的人类演示数据(仅进行了1个梯度步骤的微调)教会机器人用刷子将积木扫入碗中,随后更换工具测试模型的泛化能力。当模型拿到一根香蕉时,它自动将香蕉当作刷子,用横扫的动作将积木扫进碗里——这并不意外,因为香蕉的外形和接触逻辑与刷子高度相似;而当拿到一个簸箕时,模型放弃了「扫」的策略,转而用另一只手将积木推到簸箕上,抬起簸箕后将积木直接倒入碗中。
「扫」和「铲起倾倒」是两种完全不同的接触序列,训练数据中从未出现过类似的簸箕使用场景。研发团队通过最近邻语言搜索在189万段预训练场景中检索,也没有找到匹配的用法,也就是说,没有任何人在任何阶段告诉模型应该如何使用簸箕完成任务。
类似的即兴行为在测试中反复出现:当碗被一张纸盖住时,模型会主动掀开纸张再放入积木,有时还会在完成后将纸重新盖回碗上,而这类场景从未出现在训练数据中;当乐高积木粘在机械手指尖时,模型会用另一只手将其拨落;训练数据仅演示了单只手旋转罐盖,模型在部分测试中自发切换为双手操作,采用了完全不同的抓取和旋转策略;甚至只被训练过将单块积木放入碗中的模型,会自发开始按颜色分拣多块积木。
这些能力的共同来源,正是大规模的预训练数据。GEN-1.5已经连续进行了超过8个月的预训练,历经三个训练阶段。根据研发团队公布的验证集曲线,模型的「下一步动作预测误差」持续下降,至今没有出现收敛的迹象。用大语言模型领域的术语来说,这就是具身智能的缩放定律:随着物理交互数据规模的扩大和训练时间的延长,模型的泛化能力会持续增强。
一个反直觉的发现进一步验证了这条规律:微调的梯度步骤越少,模型的即兴发挥能力反而越强。研发团队解释称,轻度微调让模型更接近预训练阶段积累的广泛行为库,保留了更多可调用的「物理经验」。仅10个梯度步骤就只改变了模型参数的0.15%,用团队的话说,这几乎相当于「提醒模型一些它几乎已经知道的事情」。
GEN-1.5还突破了长期困扰机器人领域的两大核心鸿沟:其一,只需将模拟器中录制的动作演示塞入上下文窗口,真实机器人就能直接执行任务,并且可以泛化到不同的机械手和全新的物体位置,尽管预训练数据中不包含任何仿真数据;其二,在部分测试中,人类可以直接用双手在机器人摄像头前演示动作,机器人随后就能用机械臂复现整个任务流程。研发团队强调,所有这些能力都并非刻意设计的结果:没有专门针对上下文学习的架构改动,没有元学习循环,也没有设置鼓励即兴发挥的辅助训练目标,这些能力完全从大规模物理数据的预训练中自行涌现。
操作学习的「圣杯」时刻
此前其他研究团队也曾展示过类似的上下文学习能力,但大多仅限少数特定任务类型,GEN-1.5的新颖之处在于其覆盖的任务广度。需要说明的是,目前测试的任务仍属于简单的短程操作,比如拧瓶盖、拉拉链等,距离真实场景中的长程复杂任务仍有不小的差距。
将时间线拉回2020年6月,OpenAI发布GPT-3,这款模型首次实现了无需重新训练,只需在对话框中给出几个示例就能完成全新语言任务的能力——比如给出「红→苹果,黄→香蕉」的示例,再提问「绿→?」,模型就能给出「西瓜」的答案。这种能力被称为上下文学习,也是大语言模型从专用工具转变为通用平台的关键分水岭。而GEN-1.5,正是将同样的逻辑搬进了物理世界。
Generalist AI将这种能力称为「物理提示」,操作方式非常直接:将一段包含传感器数据和动作轨迹的真实动作演示,塞入模型的30秒上下文记忆窗口,剩余空间用于接收实时环境观测,模型就能立刻尝试执行任务,整个过程没有任何训练步骤。
这里需要明确一个关键概念:梯度步骤。在传统方法中,教会机器人学习新任务需要数万次梯度下降,每一次都是对模型内部参数的微调,这个过程通常需要大量数据和算力。而GEN-1.5的one-shot模式,也就是仅演示一次的模式,完全跳过了所有梯度步骤,模型参数没有任何改动。
研发团队在10项不同的操作任务上测试了GEN-1.5的表现,包括拧开玻璃罐盖、拉开笔袋拉链、从钱包里取钱、叠纸、叠杯子、翻手机、用刷子扫积木、打开书本封面、撕开真空垫、清扫垃圾。测试结果分为两组:one-shot模式,也就是仅看一遍演示、零梯度步骤,10个任务的平均成功率为59%;few-shot模式,也就是少样本学习,使用5分钟数据、约50次演示、10个梯度步骤,平均成功率达到83%。
将这些数据和2020年GPT-3在语言任务上的表现对比,可以发现两组数字的结构高度相似:GPT-3的one-shot成功率约为45%,few-shot,也就是约100个示例,成功率约为65%。
这组数据的变革意义在于:在大语言模型出现之前,让AI完成一项全新的语言任务,比如翻译一种从未见过的格式,需要专门采集数据、训练全新模型,周期往往以月计算;而GPT-3出现后,这件事变成了在输入框中写下几个示例,时间成本从数月压缩到数秒。GEN-1.5正是在物理操作领域完成了同样的突破:过去教会机器人完成一项新任务需要数月编程或数万条数据调参,现在只需要一段3到12秒的演示。正如研发团队在官方博客中写道的:这改变了两件事——机器人变得可用的速度,从数月缩短到数秒;以及谁能使用机器人,从只能由专业工程师操作,变成任何人都可以轻松使用。
行业沸腾的一周:从上市热潮到技术突破
GEN-1.5的发布,恰好赶上了整个具身智能行业最密集的一周。8月19日开始,世界机器人大会在北京亦庄开幕,超过300家企业参展,带来了2000余件展品,其中150余款是全球首发新品。三天后的8月22日,第二届世界人形机器人运动会在国家速滑馆「冰丝带」开赛,共有666支队伍携带2056台机器人参与51个项目的1301场比赛,队伍数量比首届增长了138%。本届运动会首次设置了21个场景赛项,要求人形机器人在工厂、酒店、家庭服务等真实环境中完成长程任务,机器人的「上岗实测」成为了本次活动的核心主题。
刚刚上市的宇树科技,2025年的人形机器人出货量超过5500台,位居全球第一,全年营收17亿元,毛利率达到60%,甚至连DeepSeek也参与了其战略配售。但宇树的招股书中也隐藏着一组反差数据:2026年一季度的营收增速从上年同期的332.64%回落至68.49%,扣非后净利润同比下降52.55%,增速放缓的核心原因是研发投入的大幅增加。
宇树科技正在追赶的,正是它目前还缺失的核心能力:具身智能大模型。有行业分析指出,宇树虽然造出了全球出货量第一的机器人躯体,但却面临「大脑缺席」的结构性困境。2026年被称为具身智能的「上市大年」,超过20家公司明确了上市计划,但这波上市潮背后很大程度上是资金压力驱动的,大量竞争对手依赖一轮接一轮的融资维持运转,研发节奏完全被融资窗口牵着走。
宇树创始人王兴兴在世界机器人大会上公开表示,限制人形机器人发展的主要瓶颈正是具身智能大模型,他预计未来快则两到三年,慢则五到十年,有望实现机器人领域的ChatGPT时刻。而GEN-1.5的发布,正是对这一判断的首个实证回应。缩放定律在具身智能领域确实存在,大规模预训练能够让新任务适配的边际成本趋近于零。这一结论对宇树这类机器人躯体厂商有着直接的产业意义:一旦通用的具身智能大模型成熟,机器人躯体的价值将取决于它能多快接入这颗通用大脑,而不再仅仅依赖硬件参数和出货规模。
Generalist AI的团队背景也与这条技术路线高度契合:联合创始人Pete Florence和Andy Zeng均来自谷歌DeepMind机器人团队,另一位联合创始人Andrew Barry则来自波士顿动力。公司在2026年6月完成了4亿美元的融资,由Radical Ventures领投,英伟达和Bezos Expeditions参投,投后估值达到20亿美元,目前正以30亿美元的估值洽谈新一轮融资。
行业专家的集体沸腾与理性思考
GEN-1.5的发布在机器人研究社区引发了强烈反响。联合创始人Pete Florence在社交平台上写道:「自从开始研究机器人基础模型以来,广泛的one-shot上下文学习一直是我心中最清晰的目标,现在我看到了将近十年的想象终于走进了现实世界。」Florence还提到,他和Andy Zeng在研究生阶段就讨论过一种「Ctrl-C-Ctrl-V」式的能力:看到一个动作,机器人就能复制,但实现起来极其困难,因为「你想粘贴的那个世界,和你复制的那个世界永远不一样」。
卡内基梅隆大学的机器人研究者Chris Paxton在社交平台上称GEN-1.5「可能是真正的GPT时刻」,并写道:「操作学习的圣杯,毫无疑问,就是one-shot learning。」
作为具身AI研究者,这对这个领域来说是一个真正特别的时刻。
美国东北大学具身智能研究者Jimmy Yang转发这条消息时评论道:「作为具身AI研究者,这对这个领域来说是一个真正特别的时刻。」
英伟达机器人技术总监Jim Fan则提供了深入的技术观察视角,他指出GEN-1.5涌现出这些能力的两个关键因素:一是训练数据中自然存在的对称重复动作模式,比如组装家具时反复拧螺丝,第二颗螺丝就是第一颗的「上下文学习样本」;二是数据中人类失误后的恢复动作,比如东西掉了捡起来继续,这种「失败-恢复-继续」的完整弧线让模型在测试时自然展现出纠错能力。Jim Fan还提到,Generalist AI使用的UMI数据采集方式,也就是人类直接戴着机器人夹爪操作,保留了人类的「物理直觉」,而传统遥操作中经过VR设备的中转会让这种直觉大量流失。
当然,行业中也存在理性的质疑声音,Jim Fan在同一条推文的评论区里写道:「演示目前仍然有点太简单了,还不能下结论。」

