文章摘要
本文是对 RSS 2026 会议的观察。会上提出北美具身智能公司未成熟,中国领先在机器人硬件。VLA 与世界模型并非对立,可结合。数据治理比规模重要,还可让模型生成数据;机器人设计应围绕数据采集。“全身智能”受关注,需搭建完整系统。中国硬件出海领先,但智能全球化待探索。

在悉尼参加RSS 2026的几天交流中,我们听到了两个与国内舆论截然不同的核心判断,这也成为本次参会最值得梳理的行业观察。

“包括Physical Intelligence在内,如今的北美头部具身智能公司离成熟都还有不短的距离。整个领域,也还没出现真正的奠基性工作。”

“中国真正领先的,恰恰是机器人硬件。美国同样没有成熟答案,中国公司又何必急着把自己称为‘中国版XX’?”

刚抵达会场时,一个疑问最先浮上心头:为何在国内已经火了近半年的世界模型,在这场机器人顶会上却依然围绕VLA展开讨论?

周一的日程中,世界模型与记忆主题组成了一场45分钟的分论坛;而周二下午,模仿学习与VLA相关的报告从三点多一直延续到傍晚,占据了大半个午后时段。

这与国内“VLA已死,世界模型当立”的热议形成了鲜明反差——今年但凡有融资动态的具身智能企业,几乎都将世界模型纳入了技术路线图,将其视为行业的新答案。

为何在机器人顶会上,大家依然在讨论VLA?难道国内外的行业节奏真的相差半年之久?

经过与多位研究者、创业者交流后我们发现,这一差异的核心原因在于顶会的审稿周期已经跟不上AI领域的迭代速度。以RSS 2026为例,论文截稿于1月30日,4月27日公布录用结果,7月13日线下会议召开——从截稿到会议结束,已经过去了近五个半月。如果再算上从构思到实验、写作的数月周期,如今展现在会场的研究成果,往往在大半年甚至一年前就已经启动。

因此,顶会论文更像是一段时间内的技术切片,而非当下的行业热点。当然,这并非否定论文的价值,任何研究都需要站在前人的基础之上。此前我们已经记录过本次RSS的获奖论文,此处不再赘述。相比复述论文内容,我们更想聊聊那些只能在现场交流中才能捕捉到的行业观察。

RSS 2026程序主席Matei Ciocarlie在开场时提出了一个直击本质的问题:“为什么我们要来这里?为什么不直接把论文发到arXiv,把视频发到X,然后就结束?”他的答案落在了一个词上:connection,也就是连接。

会议的价值从来不止于台上的报告,更在于人与人之间的线下交流、讨论与思想碰撞。本次参会期间,我们不仅与现场的学生、研究者和创业者展开了深度对话,还联合多家机构举办了线下交流活动,包括星海图、自变量、千寻、智元在内的多家企业,也将交流延伸到了会后的自由交流时段与晚宴中。

VLA与世界模型:并非对立的选择

数据已经成为具身智能领域公认的核心话题,但不可否认的是,在审稿人和投资人的视角中,模型创新依然是最受关注的方向。从本届RSS的整体情况来看,围绕抓取操作、模仿学习的研究依然占据主流,很多团队在推广时都会重点提及自家的模型方案。

回到最初的疑问:VLA与世界模型,到底该如何选择?在与Sergey Levine团队的两位博士生交流时,我们抛出了这个问题。他们给出的答案是:两条路线并不矛盾,甚至可以并行推进——Pi0.7本身就集成了世界模型组件。

不同的具身任务适配不同的处理逻辑:比如家务场景中,机器人需要先理解人类指令,通过语言将复杂任务拆解为多个子步骤,逐步规划行动;而当任务是将物体从A点移动到B点时,借助图像或视频生成能力预测动作结果、生成视觉子目标会更加高效。

不过对于Pi团队而言,语言依然承担着更核心的角色。这也解释了从《Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control》到Pi0.7的研究中,“Steerable”始终是核心设计——它不仅是让机器人听懂指令,更是允许人类或上层模型通过语言、视觉子目标乃至更细粒度的控制信号,持续引导机器人选择和组合动作。

Pi团队并不排斥图像或视频生成技术,但更倾向于让VLM承担语义理解与任务推理,再通过语言指令、视觉子目标等接口,将高层推理落地到机器人的具体动作中。

在一次晚宴交流中,我们再次提到了国内对两者差异的流行概括:VLA根据数据输入和语言指令直接输出动作,而世界模型可以预测未来状态,辅助机器人规划动作、规避风险。对方并没有直接认同这一划分,而是反问:“你真的见过部署了世界模型的机器人,主动判断某个动作存在风险、并选择替代方案吗?”

这一追问将讨论拉回了更具体的层面:对于世界模型而言,关键不仅在于能否准确预测未来,更在于它应该预测什么,以及这些预测能否真正帮助机器人完成操作。

佐治亚理工学院的Simar Kareer曾在Pi实习,专注于第一视角方向的研究,他认为世界模型的预测目标应当由下游任务决定。如果目标是让机器人完成动作,更合理的路径是让视频预测与动作预测联合学习,而非单纯训练模型生成未来画面。现阶段的视频预测或许能生成视觉上合理的未来状态,但未必能准确感知机器人手与抓取物体的尺寸,缺少与真实动作相关的信息,再逼真的预测也难以转化为可靠的操作。因此,视频预测无法完全取代动作监督,它可以帮助机器人想象未来,而动作预测与监督则负责将想象落地为可执行的动作。

香港大学的陈立博士在《Robot World Models》研讨会上补充了另一层视角:即便确定了预测对象,“生成未来”与“判断未来是否有用”也不必由同一个模型完成。在他的RISE框架中,动力学模型负责生成未来状态,价值模型则判断这些状态是否符合任务目标。机器人可以先在模型生成的虚拟场景中尝试不同路径,再通过价值信号优化策略,减少真实世界中的试错成本与风险。

由此可见,世界模型并非VLA的替代方案,二者可以相互结合。本届RSS会场内外,已经有不少团队开始探索二者融合的混合架构,Pi0.7就是典型代表。真正的核心问题在于:世界模型应该预测什么,以及这些预测如何服务于机器人的实际动作。

数据规模重要,但治理更关键

尽管模型创新更容易产出论文、吸引关注,数据已经成为具身智能领域毫无争议的核心命题。在海报展示环节,我们也向Simar请教了数据 scaling 的相关问题。

Simar从EgoMimic一路研究到EgoVerse,专注于将第一视角人类数据应用于机器人学习,照理说他应该是第一视角数据的坚定支持者。但当被问及如何规模化采集数据时,他的建议却出人意料:“第一视角数据固然有用,但我其实不建议直接从数据公司购买。”

他以大模型领域为例,指出OpenAI、Anthropic等厂商的优势不仅在于数据规模,更在于数据的清洗、筛选、配比与组织方式,这一点在机器人领域同样适用。也就是说,相比单纯堆砌数据量,数据的curation(治理)可能更为关键。

不过当被问及具体的治理方法和合理的数据规模时,他并没有给出直接答案,只是建议参考Pi0的训练规模(1万小时)以及公开数据集。他强调,这个数字只是参考,并非经过验证的 scaling law。

类似的讨论也出现在论文汇报的问答环节。有研究指出,随着VLA预训练数据规模和多样性的提升,人类数据向机器人策略的迁移能力会逐渐显现。现场有观众追问如何衡量数据多样性,Simar表示团队会在不同 checkpoint 和数据配方上开展实验,寻找效果更优的组合,但具体的配比细节并未透露。

与诺亦腾机器人的工作人员交流时,我们了解到一个现实:对于模型公司或实验室而言,架构可以写入论文,但数据配方更像是不愿轻易公开的核心机密。这也解释了为何尽管所有人都在谈论数据,论文中最亮眼的依然是模型方案。

诺亦腾团队也提出了未来数据行业的新可能:数据公司不再仅仅按小时出售原始素材,而是可以自行训练模型、开展对照实验与评测,最终向机器人企业交付经过筛选、可直接用于训练的数据方案。此时数据公司的价值不再是“采集了多少小时数据”,而是“清楚哪些数据真正有用”。

当然,不建议直接购买数据并不代表Simar不看好第一视角数据。在《Data-Centric Robotics:What Data Do Robots Really Need?》研讨会上,他重新梳理了机器人领域的数据金字塔。

传统的认知中,数据金字塔最底层是规模最大的互联网数据,中间是仿真数据,最上层是数量最少、成本最高的机器人遥操作数据,从数据规模来看这一结构并无问题,但它暗含了一个错误假设:互联网和人类视频天然可以作为机器人学习的基础,少量机器人数据仅负责最后适配。

EgoVerse的实验给出了不同的结论:仅使用机器人数据与自由形态人类数据,性能提升有限;仅加入与任务对齐的人类示范,改善同样不明显。最显著的提升来自三类数据的协同组合:机器人遥操作数据、与机器人任务对齐的片段式人类数据,以及覆盖场景与长尾行为的自由形式人类数据。

机器人数据与任务对齐的人类数据共同提供了“锚点”,帮助模型理解人类行为与机器人动作空间的对应关系。因此,数据多样性并非简单地将不同来源的数据混合,真正决定效果的是数据组合中是否存在足够的对齐区域。

但无论如何筛选,真实机器人数据和具身人类数据都难以无限采集。那么能否换一种思路,让模型自行生产训练数据?

机器人“数据匮乏,模型充裕”

在闭幕主题演讲中,斯坦福大学的Karen Liu教授将机器人领域概括为“Model-rich, Data-poor”,回应了上述问题。

“数据匮乏”不仅意味着依靠人工遥操作采集数据难以规模化,随着机器人任务从桌面抓取走向灵巧操作和全身控制,数据采集的难度也在不断提升。更关键的是,这种采集方式暗含了一个默认假设:每一条示范数据都能立刻对训练产生作用。

“模型充裕”则提供了另一种思路:将已有模型转化为数据引擎,自行生产训练数据。计算机图形学积累了物理仿真、动画和数字人模型,计算机视觉拥有3D重建和几何模型,机器人学则有轨迹优化、运动规划和动力学模型。这些模型各有所长,但很难直接作为通用的机器人策略。在Karen看来,问题并非模型无用,而是我们一直给它们安排了错误的任务——它们可以退居训练阶段,作为“教师”将已有知识转化为高质量的机器人示范数据。

近年来,连接传统仿真模型与机器人学习的技术已经逐渐成熟:一方面,3D Gaussian Splatting可以高效重建真实环境,为真实资产到虚拟场景的转换提供部分解决方案;另一方面,全身动作跟踪策略可以将运动学轨迹转化为真实机器人的动作,为虚拟到真实的迁移提供支持。目前缺少的正是将两端连接起来的完整链路。

Karen团队在VLK中搭建了一条Real-to-Sim-to-Real Pipeline,整套系统无需人类示范,在重建的室内环境中自动合成了4.8万条视觉、语言和全身运动学轨迹,训练出的策略可以迁移到真实的Unitree G1机器人上,完成导航和物体搬运任务。尽管这还不能完全取代真实数据,但至少证明:机器人规模化的起点,未必只能依靠招募更多人员遥操作机器人,也可以通过激活已有模型的数据生产能力,启动数据飞轮。

数据定义硬件形态

如果数据如此重要,那么机器人是否应该围绕数据采集来设计?Sunday Robotics的答案是肯定的——他们先设计了Skill Capture Glove和机器人手,再围绕这一硬件形态打造整台机器人。

Sunday Robotics创始人Tony Zhao与联合创始人Cheng Chi(分别是ALOHA、ACT与Diffusion Policy、UMI的核心作者)在周一的研讨会上表示,团队并没有先购买现成的机器人再考虑数据采集,而是先确定了数据采集手套与机器人手的形态,让两者在结构上尽可能一一对应,再围绕这一硬件设计机器人的其他部分。也就是说,数据不再只是机器人制造完成后收集的训练材料,反而反过来定义了传感器、机器人手乃至整台机器人的形态。

来自UIUC的Wenzhen Yuan也表达了类似的观点:机器人手指的形状、相机、光源和材料,都应当与感知模型和操作策略协同设计。触觉智能不仅是传感问题,更需要传感器、数据、模型与机器人形态的共同优化。

如果说上述讨论还聚焦于手部数据采集,诺亦腾展位上的全身动作捕捉技术,则将这一思路扩展到了整具身体。从手臂、躯干到双腿,机器人需要学习的不再只是如何抓取物体,还包括如何移动、保持平衡,并在接触过程中协调全身动作。这也引出了本届RSS另一个值得关注的方向:全身智能。

迈向全身智能时代

在今年的RSS Early Career Spotlight演讲中,来自香港大学、源策未来的李弘扬教授提出了“全身智能(Whole-Body Intelligence, WBI)”的概念。这一概念指的是让人形机器人从异构的人类与机器人经验中学习可复用的全身协同先验,据此在真实环境中生成安全、自适应、可执行的行为。

初次听到这个概念时我们有些意外:宇树机器人的产品已经能够在春晚舞台上完成跑跳表演,今年多家企业的演示也都在向精细操作发力——下半身已经能够移动,上半身也越来越擅长操作任务,为何还要单独提出全身智能?

问题恰恰藏在“能跑”与“能操作”之间的衔接处。当前的机器人可以走到桌前站稳,再伸手抓取物体,但真实世界的任务往往不会如此配合机器人:搬起自行车时,双腿需要随重量变化调整重心;伸手够远处的物体时,另一只手可能需要主动抬起维持平衡;遇到狭窄通道时,需要一边侧身一边继续搬运物品。到了这一阶段,移动与操作已经无法再被拆分为两个独立的动作,机器人需要将腿、腰、躯干和双手视为一个整体,边移动边操作,并根据环境实时调整身体姿态——这正是李弘扬所说的全身智能。

具体而言,运动控制解决的是机器人如何稳定地从A点移动到B点;全身控制解决的是如何让整具身体稳定执行给定动作;而全身智能则需要进一步回答:面对陌生任务时,机器人该调用身体的哪些部分,如何协调移动与操作,遇到意外时能否自行恢复。

因此,李弘扬并没有将希望寄托在一个直接从图像输出电机电流的超级模型上,而是提出了一套分层系统:最上层的“大脑”负责理解语言、调用记忆与长程规划;中间的具身模型将任务转化为全身动作;更底层的身体模型与控制器则负责平衡、接触与实时执行。不同模块以不同的时间尺度运行,共同完成一项任务。他在现场提到的Figure Helix 02,也采用了从语义推理、全身动作到平衡控制的分层架构。

那么为何底层控制依然值得投入大量精力?北京通用人工智能研究院的研究科学家黄思远给出了一个形象的比喻:人类大脑皮层约有160亿个神经元,而主要负责控制、平衡与协调的小脑则有约690亿个神经元,占整个大脑神经元数量的80%以上。机器人领域亦是如此:让机器人“知道要做什么”固然困难,但让数十个关节在真实世界中同时稳定完成动作,同样远未解决。当前看到的跑跳、空翻等演示,大多是针对特定动作训练的专业能力,距离一个模型驾驭多种动作还有很长的路要走。

黄思远提出的路径是:先为跑、跳、攀爬等不同能力训练多个专业控制模型,让这些“专家模型”生成高质量的运动轨迹,再交由更通用的模型学习。小模型先将单项技能练到足够成熟,大模型再吸收它们的经验,获得更广泛的身体能力。

回顾多位演讲者的观点,不难发现类似的思路反复出现:Karen Liu让已有专业模型退居训练阶段充当“教师”;Tony Zhao在高层策略与底层控制之间寻找合适的系统接口;黄思远用多个专业模型为通用控制模型提供经验;李弘扬将这些能力整合进一套全身智能系统;Wenzhen Yuan则尝试将触觉感知融入机器人基础模型。

Tony Zhao也曾提到,机器人不太可能依靠一个直接从图像输出电机电流的模型解决所有问题:高层策略负责理解任务、生成动作目标,底层控制负责平衡与稳定执行,而两者之间的动作表示连接方式,仍然需要专门设计。

端到端与模块化从来不是二选一的问题:端到端关注的是单个模块内部如何从数据中学习,模块化则关注整个系统如何分工。大模型并没有消灭小模型,而是将它们重新定位为教师、身体先验与底层控制器。模型可以采用端到端的方式,但系统仍然需要分层设计。

从这个角度来看,全身智能并非简单地将机器人的腿和手连接到同一个模型上。具身智能的下一步,或许不只是为机器人更换更聪明的“大脑”,更是搭建一套能够让大脑真正调动整具身体的完整系统。

硬件先行出海,智能后续跟上

说完学术层面的观察,我们再来聊聊产业层面的现状。一位来自Pi的人士告诉我们,北美在冒出几家具身智能企业后,很快进入了相对平静的阶段,而国内几乎每天都有新公司成立,且多数能够获得融资。按照他的观察,如果仅看创业热度、硬件供给和出海进度,中国的具身智能产业已经明显领先于美国。

这一差异也体现在RSS现场:从参会者来源来看,中国与美国是人数最多的两个国家,依然是会场的主力;但在赞助商名单中,中国企业几乎成为展厅的绝对主角。宇树、千寻智能、诺亦腾机器人、Seeed Studio、智元机器人,以及总部位于新加坡、同时在上海设有团队的Sharpa都出现在了本次展会中。

一个值得思考的问题是:对于一场以学术交流为主的会议,企业专门赞助并搭建展位是否值得?毕竟RSS本身仍是一场小而精的学术会议,每年仅接收100至200篇论文。现场的海报展示环节往往比赞助展厅更拥挤,展位前最常见的并非带着采购清单的企业客户,而是追着技术细节提问的学生和研究者。

从现场反馈来看,如果仅计算卖出的机器人数量,这笔投入未必划算——前来咨询的依然以高校和科研机构为主,真正带着明确采购任务的企业客户并不多。但这恰恰解释了为何具身硬件会率先出海:硬件看得见、摸得着,价格、负载和可靠性都容易比较。即便当地尚未形成成熟的具身智能产业,高校和开发者也可以先采购机器人用于科研、教学和二次开发。

在与宇树的交流中我们了解到,四足机器人的现实需求反而比人形机器人更加明确。国内常见的文娱表演、商务指引等场景在澳洲市场规模有限,而矿区勘测、巡检和分拣等能够明确计算投入产出比的任务,反而更容易获得关注。

Seeed Studio则代表了硬件出海的另一条路线:相比完整的人形机器人,他们提供的开源硬件和边缘计算设备价格更低,同时配套了相对完整的社区、安装教程和二次开发指引。对于预算有限、具身生态尚未成熟的海外高校来说,一个便宜且易于上手的开发平台,往往比酷炫的演示更有吸引力。这也解释了为何相比购买完整机器人,海外用户对模型和自动化方案更加保守——他们更希望先看到明确的投入产出比,再决定是否部署。

不同企业也选择了不同的落地方式:宇树等企业更多借助当地合作伙伴和分销商销售产品,以降低进入新市场的成本;智元则选择在澳新地区设立本地团队,智元工作人员表示,尽管独立运营的成本更高,但能够更快获得客户反馈,了解当地真正需要的任务场景,以及机器人如何融入已有生产流程。Sharpa从成立之初就将全球市场作为核心,在新加坡和上海同时布局,他们认为参加RSS的价值未必是现场成交,而是提前接触研究者、模型公司和开发者,融入下一轮技术与数据生态。

综上,中国企业集中出现在RSS现场,并非只是为了刷存在感。他们一边销售硬件,一边寻找当地合作伙伴、开发者和任务需求——顶会展位既是销售和招聘的窗口,也是进入海外技术生态的门票。但硬件先行出海,并不代表具身智能已经完成全球化布局。中国在供应链、价格和交付能力上的优势,让机器人率先拿到了出海船票,但如何让模型适应当地任务、形成数据闭环、建立开发者生态,仍然需要在当地重新探索。而且这并非只是中国企业的问题,正如前文提到的,包括Pi在内的北美头部具身智能企业距离成熟仍有很长的路要走,整个领域尚未出现公认的奠基性突破。当外界总喜欢给国内企业贴上“中国版XX”的标签时,Pi的人士反而感到不解:中国真正领先的恰恰是机器人硬件,既然美国的答案也尚未成熟,国内企业何必急于对标他人?

会议的本质是人与人的连接

回到最初的问题:我们为什么要来RSS?Matei Ciocarlie在开幕式上的讲话给出了最好的答案。他在结尾分享了一段特别的寄语,尤其是针对在场的学生:

“那些真正的大佬一般都不会来听开幕式(笑)。当然,也有例外,我刚才好像看到Oliver坐在后排。不过总体来说,这些话主要是送给学生们的。”

现场有多少学生?请举一下手。欢迎大家。还有谁是第一次参加RSS?哇,非常多人,欢迎。

为什么我们要来会议?为什么不直接把论文发到arXiv,把视频发到X,然后就结束?因为会议真正重要的,是人与人的交流,是聊天、讨论和面对面的连接。

我当年还是学生的时候,最大的梦想就是成为大牛们的Conference Buddy,和他们一起聊天、喝酒、跑步。但这其实很难。后来我发现了一个百分之百有效的方法,保证成功,绝不会失败:等你现在的Conference Buddy,未来变成大牛。

RSS 2012同样在悉尼举办。当时Kris Hauser正在拍照,Dylan Shell坐在那里,我和Anca Dragan也在。那时我们都还没什么名气,只是一起玩、一起聊天、一起认识彼此。后来,Dylan穿上了RSS程序主席的夏威夷衬衫,Kris也穿过,今年轮到了我。

所以,去和知名教授聊天完全没有问题。你可以直接走过去说:“Hi,我很喜欢你的工作,可以聊聊吗?”这完全可以。但我真正想强调的是,更重要的是认识你的同龄人,和他们建立联系,一起成长。因为今天坐在你旁边的人,就是未来整个领域的领导者。你们现在建立的,可能是未来几十年的合作关系。

还有一点,和别人聊天的时候,不要一直越过对方的肩膀,寻找现场有没有更资深的人可以聊。不要这样。认真认识你眼前的人。

第二件事,是关于焦虑。最近大家都在说,机器人领域变化太快了。这是真的。我进入机器人领域已经大约25年,从来没见过这么多人进入这个领域,没见过这么多资金,更没见过机器人的能力增长得如此之快。这是一个令人激动的时代,但也是一个容易焦虑的时代。很多学生都会觉得:“我是不是跟不上了?”“我的工作是不是不够好?”我自己也有过这种感觉。

为了缓解焦虑,我有两样东西。第一是终身教职,第二是Perspective,也就是看问题的角度。终身教职没办法送给大家,但Perspective可以分享一点。

第一,没有任何人的工作真的和视频里一样完美。每个人的视频,都会比真实效果看起来更好。所以,当你看到一个特别惊艳的视频时,请记住,真实情况没有看起来那么完美。它可能确实非常优秀,但永远没有视频里显得那么完美。

第二,你现在看到整个领域高速发展,其实是全世界几千名研究者共同努力的成果。它不是某一个实验室的产出,也不是某一个人的产出。没有谁真的比你高效10倍。只是所有人的成果都被精心包装起来,再一起摆到你面前,所以你才会觉得:“怎么一下子出现了这么多东西?”

第三,请记住,如果今天你坐在RSS的会场里,你已经进入了这个领域的最高舞台。这里就是机器人研究的顶级联赛。在这里,你当然会遇见世界上最优秀的人。就像踢足球一样,你会面对哈兰德,也会面对姆巴佩,他们真的很强。但与此同时,你也正在和世界上最优秀的人一起比赛。请享受这一点。

未来,你们当中的一些人也会成为世界上最优秀的人。即便没有,你依然站在最高水平的赛场上,偶尔也能在最大的舞台上打进一个漂亮的进球。所以,请享受这个时代。这是机器人领域最好的时代。让我们一起珍惜它,让这一切变得值得。谢谢大家。RSS 2026,正式开(闭)幕!

以上内容不代表本平台立场,仅供读者参考