文章摘要
Figure发布人形机器人新一代模型Helix2.5,该模型基于覆盖全球的大规模人类行为数据集Index预训练,首次让机器人获得跨环境泛化能力,能在30户未采集过数据的陌生家庭实现零样本全身自主作业,成功率从9%提升至56%,打破了以往需针对每个环境单独训练的模式,标志着具身智能向通用智能迈出关键一步,不过该成果目前距离商用落地仍有差距。

Figure发布Helix 2.5模型,让机器人在30户陌生家庭实现零样本全身自主作业,成功率从9%跃升至56%。核心突破在于用人类行为数据集Index预训练,使机器人首次具备跨环境泛化能力,不再需要“一屋一训”。这一进展标志着具身智能从专用系统走向通用智能的关键转折。

Figure发布Helix 2.5模型

机器人为什么不能“举一反三”?

一个成年人走进陌生朋友的厨房,想做一顿饭。他不会因为灶台高度不同就不知所措,也不会因为锅铲放在抽屉左边而非右边就放弃。人对物理世界的理解是可迁移的——换一个环境,经验依然管用。

这正是当下机器人与人类之间最根本的差距。

Figure发布的Helix 2.5模型,试图回答一个直指核心的问题:人形机器人能否进入一个它从未见过的家,立刻开始工作——用自己的全身,独立完成?

答案比人们预期中更接近“可以”。

Figure在旧金山湾区租下30户真实的住宅,将搭载Helix 2.5的Figure 03人形机器人送入这些从未采集过任何数据的家庭。机器人整理客厅、折叠毛巾、铺床,全程没有额外训练、没有微调、没有针对环境或物体的任何适配。这一实验的规模和数据,在整个人形机器人领域尚属首次。

一台“看过人类做家务”的机器人

理解Helix 2.5的关键,不在于它做了什么,而在于它是从哪里学会的

过去的人形机器人训练,遵循一条朴素但代价高昂的路径:在机器人将要工作的环境中采集数据,在同样的环境中训练,在同样的环境中评测。Helix 02就是这个逻辑的产物——它能协调全身完成长时序任务,从卸载洗碗机到连续200小时分拣包裹。但这些能力的学习都建立在一个前提上:机器人需要事先“熟悉”它将要工作的场所。

Helix 2.5打破了这个前提。

Figure的解决方案是Index——一个全球规模的人类行为数据集。Index不是机器人数据,而是人类的数据。Figure通过移动应用邀请全球用户记录自己执行日常任务的过程:整理房间、叠衣服、清洁厨房,甚至清理猫砂、更换机油。截至目前,Index已覆盖108个国家和地区,累计上传超过1600万条视频,每秒新增约35分钟的人类行为数据。

这里有一个容易被忽略的工程哲学问题:为什么人类的行为数据可以用来训练机器人?

答案藏在“泛化”的本质里。一台机器人在一个家庭中学会铺床,它学到的表面上是“如何操作这特定尺寸的床、这特定材质的床单”。但如果训练数据足够多样,模型有机会学到更深层的东西:如何判断床的边界、如何调整站姿以适应不同高度的操作面、如何在折叠被角时施加适当的力。这些是物理世界的通用规律,与具体的床无关。

Index数据集的多样性指标佐证了这一点:每1000小时的数据平均覆盖373种独特任务、1146种不同操作对象、116种不同环境。这不是“更多的同质数据”,而是一个刻意构建的物理交互知识库

9%到56%:一个数字背后的范式转换

Helix 2.5最值得深入分析的实验设计,是它如何隔离出“预训练”这个单一变量的贡献。

Figure保持模型架构、优化方式、超参数、下游数据和评估条件完全一致,只改变一件事:是否使用Index预训练来初始化模型。结果清晰而有力——从零开始的策略零样本成功率为9%,使用Index预训练的策略为56%

六倍以上的提升,来自一个变量的改变。

更具说服力的是,Index数据集中没有任何一项评估任务占比超过1.90%。这意味着56%的成功率不是靠“记住”任务数据实现的,而是从大量无关的人类行为数据中习得了可迁移的物理理解

另一个令人侧目的数据是:Helix 2.5使用的任务专用数据量仅为Helix 02的一半,却将行为泛化到了30个前所未见的新环境。用更少的数据,做更广泛的事——这正是通用智能系统的核心特征。

从工程角度看,这个结果的意义远超数字本身。它意味着机器人能力的构建方式正在经历一次根本性转变:从“为每个环境定制一套能力”到“用一套底层理解适应所有环境” 。前者的边际成本随部署规模线性增长,后者的边际成本趋近于零。

Helix 2.5与Helix 02:一次代际跨越的量化对比

对比维度 Helix 02 Helix 2.5
核心定位 全身协调的长时序任务执行 跨环境零样本泛化
训练数据来源 机器人操作环境中的采集数据 Index人类行为数据集预训练
任务专用数据用量 基准水平 仅需Helix 02的50%
泛化环境数量 固定或有限环境 30个陌生家庭
零样本成功率 未公开(同条件从零训练约9%) 56%(420次试验完成237次)
自我纠错能力 有限 后退定位、改变站姿、绕床修正
行为范围 运动+操作+双手协调 运动+刚性/可变形物体操作+双手协调+主动感知
部署验证 200小时物流分拣直播 30户真实家庭实验

这张表格中最关键的一行,是“泛化环境数量”。Helix 02证明的是“机器人在一个地方能工作多久”,Helix 2.5回答的是“机器人在多少地方能工作”。前者关乎耐久性,后者关乎通用性。 耐久性是工程问题,通用性是科学问题。Helix 2.5跨越的是后一道门槛。

56%意味着什么——以及不意味着什么

Helix 2.5的成果足够令人兴奋,但值得以更冷静的视角审视其边界。

56%的成功率意味着近一半的任务尝试未能完整完成。 对于实验室演示而言,这个数字已经足够震撼。但对于“可靠的机器人管家”这一目标而言,它仍然有一段不小的距离。

Figure自己在公告中也明确表态:“重点不是说通用人形机器人已经解决了”。这个自我克制的判断值得尊重。在机器人领域,演示视频与真实部署之间的落差是行业反复经历的教训。Helix 2.5的实验是在Figure租赁的房屋中、由Figure团队执行的,其独立复现性尚待第三方验证。

但56%的真正含义,不在于它是否达到了“可用”的标准,而在于它证明了什么

在Index预训练出现之前,人形机器人面对陌生环境的零样本成功率是9%。这个数字意味着一件事:没有预训练,泛化几乎不存在。Helix 2.5将这一数字推升至56%,说明泛化能力是可以被“教”出来的——不是通过教机器人如何整理一个特定的客厅,而是通过让它“看过”成千上万个人类整理房间的视频,从中提炼出关于空间、物体和动作的通用理解。

这种能力有一个更简洁的名字:从经验中学习。这是人类智能区别于专用系统的核心特征。Helix 2.5是第一个在全身人形机器人上展示这一特征的系统。

藏在机器人动作里的“直觉”

在Figure公开的实验录像中,有一个细节值得注意:机器人在陌生环境中会后退以重新定位,会改变站姿以适应不同高度的操作面,会绕着整张床移动以修正折叠角度。

这些行为看起来简单,但它们涉及一种在传统机器人系统中极难实现的认知能力:知道自己做错了,并且知道怎么纠正

传统工业机器人依靠精确的路径规划来避免错误——它不需要知道“如果我偏了怎么办”,因为它在物理上不会偏。但家庭环境充满了不确定性:沙发的位置和训练数据中的不同,毛巾的材质变了,地上的玩具挡住了移动路线。在这些条件下,“从不犯错”是不可能的,真正重要的是“犯错后能否恢复”。

Figure将这种能力归因于Index预训练。这个解释是合理的:在人类行为数据中,人类完成家务的过程本身就包含大量的微调和纠错——弯腰够不到就换一个角度,叠被子发现方向不对就翻过来重来。这些“不完美”的行为模式,恰恰是机器人学会自我纠错的素材。

有时候,训练数据中的“噪声”才是最有价值的部分。

从实验室到家庭之间

Helix 2.5的技术突破需要在商业化的坐标系中理解。

Figure的部署路径已经清晰可见:先物流,后家庭。2026年5月,Figure与Catalyst Brands签署商业协议,在内华达州里诺配送物流中心部署人形机器人,处理供应链中的重复性分拣和包装任务。此前,Figure 03机器人完成了连续200小时的分拣直播,累计处理约24.96万个包裹。

这条路径的合理性在于:物流场景是高度标准化的,与Helix 2.5所解决的问题——“陌生环境中的泛化”——看似关系不大。但恰恰是这种“先标准化、后通用化”的策略,为Figure积累了宝贵的规模部署经验。物流场景中的长时间自主运行验证了硬件可靠性,而家庭场景中的泛化能力验证了智能系统的上限。

问题在于,家庭环境的复杂度远超物流中心。物流中心的分拣任务在空间布局、物体类型、操作流程上都有严格的一致性;而一个普通家庭中,客厅的沙发可能在窗边也可能在墙角,毛巾可能是纯棉也可能是竹纤维,床的高度从30厘米到60厘米不等。Helix 2.5在30户家庭中56%的成功率,反映的正是这种复杂性的真实影响。

Figure CEO Brett Adcock将Helix 2.5称为“Figure做过的最重要的项目”。这个判断可能不仅仅是对技术本身的评价,更是对它所代表的方向的评价:如果泛化能力可以被训练出来,那么人形机器人的部署就不再是“每个客户定制一套系统”的工程问题,而是“训练一次、部署到所有地方”的平台问题。

数据规模定律:机器人领域的“摩尔定律时刻”?

Helix 2.5的实验还揭示了一个更具前瞻性的发现。

Figure在多次翻倍Index预训练数据量的过程中,观察到下游机器人动作预测的损失呈现平滑且可预测的下降趋势。更关键的是,在训练最大规模模型之前,Figure就能将最终的损失预测到小数点后四位。

这意味着,人形机器人的泛化能力也遵循数据规模定律

这个发现的意义可能被低估了。在大语言模型领域,“更多数据+更多算力=更好性能”已经被反复验证,成为整个行业投资逻辑的基础。但在此之前,人形机器人领域缺乏类似的证据。每一代模型的提升更多依赖于架构创新和工程优化,而非可预测的规模扩展。

如果Helix 2.5揭示的规模定律成立,那么人形机器人的发展轨迹将发生根本性变化:从“等待下一次架构突破”变为“可以计算需要多少数据和算力来达到目标能力” 。这将使投资决策、研发规划和部署节奏都变得更加可预测。

Figure的举动印证了它对这一逻辑的信心:公司已承诺投入价值35亿美元的算力资源训练Helix系列,并与Nscale签署了锁定约10万块英伟达Vera Rubin系列GPU的多年期算力协议。这个规模的投入,只有在相信“数据越多、算力越大、效果越好”的前提下才合理。

一个更深层的问题:机器在学习“什么”

Helix 2.5的成果迫使我们重新思考一个问题:当机器人在陌生家庭中成功折叠一条从未见过的毛巾时,它到底学会了什么?

传统观点倾向于将机器人能力理解为动作序列的执行:先做A,再做B,最后做C。按这种理解,“折叠毛巾”就是一个固定的动作模式,模型需要学会在不同条件下复现这个模式。

但Helix 2.5的泛化能力暗示了一种不同的可能性:机器人学到的可能不是动作本身,而是动作与物体状态之间的因果关系——折叠的本质是“通过施加力改变可变形物体的拓扑结构”,而非“执行某个特定的关节运动序列”。

这两者之间的区别,类似于“背下一首诗”和“理解一种语言”。前者只能复现已知内容,后者可以生成从未见过的新句子。

Figure的实验中有一个细节支持这种解读:机器人能够在床上移动整个身体来调整折叠角度。这不是预先编程的动作,而是根据实际物体状态和空间条件实时生成的全身协调行为。如果一个系统只是“执行动作序列”,它无法做到这一点。

从Index数据集中的人类行为视频中,Helix 2.5可能学到了一个更深层的东西:人类在操作物体时,身体是如何作为一个整体与物理世界互动的。这种理解一旦形成,就可以被迁移到任何具体的物体和环境中去。

人形机器人的下一个分水岭

Helix 2.5不是一个终点,而是路线图上的一个坐标。

它所证明的最重要的事情,可以用一句话概括:泛化能力可以通过预训练获得,而不必在每个新环境中从零构建。 这个命题在NLP和计算机视觉领域已经被验证过无数次,但在全身人形机器人上,这是第一次。

接下来的问题不再是“泛化是否可能”,而是“泛化的速度和规模能否被精确预测和控制”。Figure的数据规模定律实验给出了初步的肯定回答,但要从56%走向更高,需要的可能不只是更多的数据和算力,还有对“什么类型的数据能最有效地促进泛化”的更深理解。

还有一个更根本的问题悬而未决:当机器人在30户家庭中的成功率达到90%甚至95%时,它是否真的“理解”了家务,还是只是学会了极其精确的模式匹配?这个问题的答案,可能决定了人形机器人是走向“可靠的自动化工具”,还是“真正的通用智能体”。

Helix 2.5没有回答这个问题。但它把问题推到了一个人们能够认真讨论它的位置。

FAQ

Helix 2.5是什么?

Helix 2.5是Figure发布的最新一代人形机器人神经网络模型,核心能力是在从未见过的新环境中实现零样本全身自主作业,无需针对新环境采集数据、微调或适配。

Helix 2.5与Helix 02最大的区别是什么?

Helix 02的核心能力是在已知环境中执行长时序全身任务;Helix 2.5的核心突破是跨环境泛化——在30个陌生家庭中零样本完成家务任务,任务专用数据用量仅为Helix 02的一半。

零样本(Zero-Shot)在这里具体指什么?

指机器人在进入30个测试家庭之前,没有在这些家庭中采集过任何数据,没有针对这些家庭的家具、物品或空间布局进行过训练或微调。机器人使用的是同一个模型检查点,在全部30户家庭中完成任务。

Index数据集是什么?

Index是Figure构建的全球规模人类行为数据集,通过移动应用邀请全球用户记录日常任务过程。目前覆盖108个国家和地区,上传视频超过1600万条,每秒新增约35分钟数据。

56%的成功率算高还是低?

在零样本条件下,这是一个里程碑式的数字——没有预训练时仅为9%。但距离可靠的家用部署(通常需要95%以上)仍有明显差距。

Helix 2.5会改变人形机器人的部署方式吗?

核心影响在于:如果泛化能力可以通过预训练获得,那么机器人的部署将不再需要为每个新环境定制训练。这将从根本上降低部署的边际成本,使规模化落地变得更加可行。

以上内容不代表本平台立场,仅供读者参考