文章摘要
北美具身智能初创企业SkildAI发布机器人基础模型S1,其核心能力是上下文学习(ICL),可通过观看人类示范视频完成复杂操作,在未见过任务上成功率达66%。它突破传统机器人训练范式,实验验证了ICL的规模化潜力。SkildAI发展迅速、定位独特,若ICL缩放定律持续生效,通用机器人落地进程或远超预期。

最近具身智能领域接连传来突破性进展,就在此前Generalist推出可学习3到12秒动作的具身大脑Gen 1.5之后不久,北美具身智能初创企业发布了全新机器人基础模型S1,将机器人上下文学习的任务长度提升到了10分钟以上,再次点燃了行业对通用机器人的期待。

S1的核心能力是上下文学习(in-context learning,ICL),它无需在后续阶段针对新任务进行专门的微调或后训练,仅通过观看一段人类示范视频,就能直接完成从未接触过的复杂操作流程。在官方演示中,机器人完成了煎饼制作、咖啡冲泡、植物换盆以及设备组装等长程任务,在未见过的OOD任务上成功率达到66%,远超基于语言提示的VLA模型的9%。

若采用传统的后训练微调路线,想要追平S1仅看一次演示就能达到的效果,需要约380次任务演示数据。行业对此评价颇高,有观点认为通用机器人的出现时间可能从原本预期的七年缩短至两年,还有人指出从Rhoda、Generalist到如今Skild S1的10分钟任务,机器人的“GPT时刻”正在真正到来——一旦这种能力实现泛化,未来开发机器人技能将变得像给大模型编写提示词一样简单。

传统机器人训练的痛点与范式突破

和大模型的学习流程类似,传统机器人学习通常先在海量数据上完成预训练,掌握基础能力后,再针对具体场景收集真机数据,通过后训练让机器人学会专有技能。但两者的数据成本却天差地别:大模型的预训练和后训练数据大多可以通过互联网快速获取,甚至能自动生成;而机器人的所有训练数据都需要在现实环境中采集,不仅成本高昂,且难以规模化。

Skild AI在技术博客中就提出了尖锐的质疑:如果每学习一个新任务都需要耗费几十甚至几百小时的真机数据进行后训练,那所谓的“基础模型”又谈何“基础”?甚至有相关研究指出,当新任务的数据量足够多时,从零开始训练的模型甚至能追平经过预训练再微调的模型,这让具身预训练的核心价值受到了挑战。

对此,Skild给出的解决方案是上下文学习,并以大模型的发展路径作为参照。他们将当前的机器人学习比作BERT时代——每个新任务都需要重新准备数据并微调模型;而GPT-3之后出现的上下文学习能力,让模型无需修改权重,仅通过提供示例提示就能快速掌握新任务,这正是Skild想要为机器人领域实现的范式转换。他们认为,预训练的核心价值不应只是减少后训练的数据量,而是让机器人具备直接从上下文中学习新技能的能力。

S1的上下文学习能力细节

Skild认为,检验机器人上下文学习能力的核心维度有两个:一是能否学会训练数据中从未出现过的新技能,二是能否将已有技能重新组合,完成长周期、高复杂度的全新任务。

和此前Gen 1.5展示的秒级任务相比,S1将上下文学习的任务长度拓展到了最长10分钟。以植物换盆任务为例,该任务需要连续完成数十个操作步骤,机器人不仅需要精准模仿视频中的动作,还要理解任务的整体意图、明确当前所处的进度、合理组合不同的技能,甚至在出现操作失误时及时调整应对,而非简单的行为克隆。

在整个测试过程中,S1没有使用任何微调或后训练流程,模型权重完全保持不变,仅通过观看示范视频就完成了所有展示任务,这基本对齐了大模型从BERT需要特定场景微调,到GPT-3仅通过示例就能完成OOD任务的跨越,唯一的区别是S1使用的提示不再是语言文本,而是更贴合机器人下游任务的动作视频。

实验验证:ICL的规模化潜力

在实验环节,Skild对比了ICL视频提示和传统语言提示VLA模型的表现。测试分别在训练数据见过的任务和未见过的OOD任务上展开:

当训练数据量仅为1000小时时,语言提示的效果更优,但随着数据规模提升,ICL的优势逐渐显现。当训练数据达到10万小时时,在训练过的任务上,ICL的成功率为96%,语言提示为89%;而在最关键的未见过的OOD任务上,ICL的成功率达到66%,语言提示仅为9%,两者差距超过7倍。

为了进一步验证S1的泛化性,研究团队在不同实验条件下进行了测试,结果显示语言提示VLA的性能下降幅度最高达到ICL的3倍,说明ICL学到的不是固定场景下的动作复刻,而是能够根据当前环境灵活规划动作的通用能力。

在单次学习(One shot learning)测试中,S1仅通过一条视频演示,无需任何后训练,就能在新任务上达到66%的成功率;而传统VLA模型需要约380次任务演示的后训练,才能达到同样的水平,即使将演示次数提升到2000次,传统后训练的最终成功率也仅为86%。

这也印证了Skild提出的ICL缩放定律:随着训练数据量的增加,模型不仅能掌握更多的技能,更能熟练地从演示中学习新的任务能力。

Skild AI的行业定位与发展路径

Skild AI成立于2023年,背后的创始人是卡内基梅隆大学机器人研究所的两位知名学者Deepak Pathak和Abhinav Gupta,前者主要研究机器人学习、强化学习与计算机视觉,后者则是计算机视觉和自监督学习领域的专家。两人早在2022年就合作推出了WHIRL项目,让机器人通过观看人类视频实现单次模仿学习,S1的技术路线并非一蹴而就。

2024年,Skild走出隐身模式后,迅速完成3亿美元A轮融资,估值达到15亿美元;2026年1月,该公司又完成14亿美元C轮融资,估值超过140亿美元,由软银领投,英伟达、贝索斯等机构跟投,两年多时间估值增长近10倍。

在北美具身智能赛道中,Skild的定位十分独特。相较于聚焦“机器人GPT”的PI、主打单次学习的Generalist,以及主打全栈方案的其他企业,Skild始终强调“Any robot, any task, one brain”的理念,希望同一个智能核心能够适配机械臂、四足机器人、人形机器人等多种不同形态的硬件,通俗来说就是想要成为机器人时代的安卓系统。

基于这一定位,Skild的数据策略覆盖了三个维度:真机遥操的数据最贴近真实硬件,但成本高昂;第一视角人类视频最容易规模化,但和机器人的身体感知存在差异;仿真数据成本低、可大规模生成,但存在仿真到现实的迁移 gap。因此他们全面采用了真机遥操、第一视角视频、仿真等多种数据来源,S1的ICL能力正是这一数据策略的自然延伸。

从2025年9月推出LocoFormer,到2026年2月实现首次领域内ICL,再到5月首次完成翻煎饼任务,最终在8月发布S1,Skild将机器人上下文学习的能力推进到了最长10分钟的OOD长程任务领域。

如今行业关注的焦点已经不再是机器人能否学会更多技能,而是机器人学习新技能的成本能否从“数百次演示”转变为“看一遍就会”。如果ICL的缩放定律能够持续生效,那么所谓的机器人GPT时刻或许不再只是营销噱头,通用机器人的落地进程可能会远超此前的预期。

参考链接
[1]https://www.skild.ai/blogs/s1

以上内容不代表本平台立场,仅供读者参考