物理AI“ChatGPT时刻”:专家圆桌激辩未来3-5年

2026年世界人工智能大会的上海会场,一场被称为具身智能领域“华山论剑”的智启具身论坛正式拉开帷幕。来自海外的Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等头部机构,与智元机器人、清华大学、腾讯Robotics X等国内学术与产业力量齐聚现场,数十位具身智能领域的核心从业者带来了最新的技术进展与商业落地思考。
参会者纷纷展示了各自的模型架构、数据体系与训练方案。从表面看,所有团队都在朝着通用人形机器人的目标前进,但当拆解各家的技术路线时,不难发现背后的技术路径与商业逻辑差异巨大,甚至在核心赛道的判断上已经出现了明显分歧。
各家亮出技术底牌,路线分歧远超预期
智元机器人带来了多项亮眼成果:其GO-2机器人在LIBERO基准测试中以98.7%的成绩刷新了行业SOTA;自研的世界模型GE-Sim 2.0拿下了WorldArena全球第一;旗下龙旗南昌产线的机器人已经稳定运行3个月,任务成功率达到99.99%。智元联合创始人姚卯青提出,“模型决定起点,数据定义终局”,团队正通过全栈技术飞轮攻坚数据、表征、闭环三道核心壁垒。
清华大学计算机副研究员苏航则将研究重点放在了机器人的可恢复性上——他认为真正的智能并非不会犯错,而是具备错误修复能力。其团队提出的TUTOR方法,将长程任务的自主成功率从8.3%提升至35%,为机器人的失败自救提供了新的技术路径。
海外团队Physical Intelligence发布了最新的π0.7模型,实现了单个模型开箱即通吃多任务,甚至可以在未经过专门训练的机械臂上实现零样本迁移。该机构研究科学家任至意坚信,当前的模型能力已经足够,唯一缺失的是上下文理解能力,泛化能力会随着模型训练自然涌现。
Genesis则押注人手数据手套方案,通过捕捉人类日常家务动作来获取训练数据,号称仿真训练速度比传统方案快1000倍。联合创始人王尊玄介绍了团队如何让物理AI以软件迭代的速度快速进化。
Dyna Robotics的DYNA-1机器人则在真实餐厅场景中实现了99.4%的折餐巾成功率,单日可完成85多张餐巾折叠工作。创始人兼首席科学家马也骋坦言,通用模型目前仍存在可靠性不足的问题,而专用模型又缺乏可扩展性,因此团队选择先将任务可靠性做到极致。
在展示完各自的技术成果后,各家对于具身智能的核心赛道判断出现了明显分歧:智元聚焦数据、表征、闭环三道壁垒,PI认为核心是上下文理解,Dyna则将可靠性作为第一优先级,清华团队则强调机器人的失败恢复能力。可以说,这场论坛的第一场交锋,就是各家对赛道定义的互相碰撞。
物理智能的三大壁垒与三场核心争论
尽管各家路线不同,但现场也形成了一个隐秘的共识:具身智能的下一阶段竞争,不再是比拼Demo的花哨程度,而是看谁能将“经验”规模化落地。这一转变源于大语言模型成功带来的行业错觉——不少人认为只要放大模型规模、增加训练数据、堆砌算力,机器人就能迎来属于自己的ChatGPT时刻。但物理世界的规律与数字世界截然不同,物理智能的规模化发展面临三道核心壁垒:数据墙、表征墙与闭环墙。
姚卯青用一句话点明了两者的差异:数字智能本质是“知识系统”,可以通过语言表征实现大规模积累;而物理智能则是“经验系统”,目前仍在寻找通用的经验表征方式。经验系统需要覆盖空间感知、物理交互、精细操作、失败恢复、工具使用五大核心能力,其判断标准被称为“经验密度”——单纯录制画面和关节角度只能算是“一小时录像”,只有同时记录任务目标、物体状态、动作质量、错误原因与最终结果,才能称得上是“一小时经验”。数据规模回答的是“见过多少”,而经验密度回答的是“学到多少”,两者之间存在着巨大的产业鸿沟。
围绕物理智能的规模化发展,现场展开了三场核心争论:经验数据从何而来、如何衡量数据质量、能否通过仿真降低试错成本。
争论一:数据采集——全量覆盖还是精准取舍?
真机遥操作数据是最对口的训练数据,但成本极高:一名操作员只能同时盯守一台机器人,想要积累互联网级别的数据量,成本会远超机器人本身的投入。
智元选择了全量覆盖的路径:姚卯青提到,当前物理AI的数据量仅为大模型的两万分之一,为了填补这一差距,智元联合觅蜂科技打造了具身智能数据平台型供给基础设施,开源了行业首个百万级真机数据集AGIBOT WORLD,目前累计下载量已超过120万次。
Dyna Robotics则构建了20万+小时的数据集金字塔,马也骋在分享中提到,团队的实践经验是将部署数据融入下一轮预训练,随着迭代次数增加,后续部署的时间会越来越短,最终可以实现零成本迁移到全新任务场景。
Sunday Robotics CEO赵子豪则从另一个维度提出了观点:短期内,无本体数据是成本最低、效率最高的选择,但长期来看,当机器人部署到多样化的真实环境中,现场部署数据将成为终极数据源。
Genesis采用了轻巧采集的路线:通过配备数据手套的仿人手机械臂,捕捉人类日常做家务的动作,比如洗碗、拧瓶盖等,从全球每天海量的家务活动中提取训练数据,快速获得接近人类活动规模的数据入口。
而Dyna则反其道而行之,不追求数据量的绝对规模,而是强调数据使用效率:团队仅用20万小时的数据集,就能实现1小时以内的后训练迁移到全新任务,相当于用精准的“枪法”替代了单纯的“弹药堆砌”。
清华大学的苏航则泼了冷水:人类的手部动作与机器人夹爪的工作逻辑存在本质差异,人类拥有全局视野、触觉反馈与常识储备,而机器人往往只能通过腕部相机看到巴掌大的区域,单纯投喂人类动作数据,并不等于让机器人掌握了人类技能,数据量多并不等于数据可用。
争论二:数据质量——粗数据便宜难学,精数据好用难量产
传统的训练数据筛选逻辑是“保留成功案例、删除失败样本”,就像只让孩子看标准字帖。但Physical Intelligence选择了反其道而行之:他们让机器人模拟咖啡师工作,不仅要求90%以上的成功率,还会记录所有失败场景,比如手柄掉落、牛奶洒出、无法插入杯架、出液时机错误等,再为每一段失败数据添加详细标签。
从π0到π0.7,PI的团队一直在训练模型理解同一批数据中的不同意图与质量差异,甚至为机器人编写系统提示词,比如“你是追求最高质量与效率的机器人,不要犯错”,如同操控大语言模型的Prompt一样来优化物理策略。
Dyna则更进一步,训练了专属的奖励模型,让机器人自主评估当前动作的完成质量,再通过持续学习吸收失败经验,打磨出极端场景下的纠错能力。
这也引出了行业的两难困境:粗制数据成本低但模型学习难度大,精制数据效果好但难以大规模量产,如何找到两者的平衡点,成为了所有团队都需要解决的难题。
争论三:训练路径——让机器人在虚拟世界摔一万次
真机训练成本高昂,不少团队开始探索让机器人在虚拟环境中训练,也就是所谓的“在梦里练习”。Genesis将这种模式称为“以软件的速度进化”,号称仿真训练速度比传统方案快1000倍,无需砸坏真实杯子、租赁真实厨房就能完成大量试错。
智元则在世界模型方向投入了更多资源:GE-Sim 2.0不仅可以生成合理的未来场景视频,还集成了本体状态预测和任务结果判断模块,在单张H100显卡上可以实现2.3秒推演25帧的速度,拿下了WorldArena全球第一,将虚拟世界从“视频导演”升级为了能评估状态、给出评分的训练训练场。
但这种路径也存在巨大争议:虚拟环境中的微小偏差,会在强化学习过程中被不断放大;机器人还可能学会在虚拟世界中钻规则漏洞,成为“虚拟规则大师”,一旦部署到真实环境中,就会被一块湿毛巾这样的小细节“教做人”。
Dyna和PI则更信任真实场景的数据:Dyna将机器人直接部署到真实餐厅中,PI则依靠真实数据飞轮和自主运行中的人工接管来持续打磨模型。仿真放大试错成本,真机校准真实差距,两种路径各有支持者,预算分配的优先级也成为了另一个争论点。
圆桌激辩:核心问题与共识
主题演讲环节各家只是展示了各自的成果,而圆桌讨论环节则充满了火药味,六位嘉宾围绕具身智能的核心问题展开了激烈辩论。参会嘉宾包括智元的姚卯青、Physical Intelligence的任至意、Dyna Robotics的马也骋、腾讯Robotics X的张正友、Sunday Robotics的赵子豪,以及另一位行业专家徐丹飞。每个人的技术路线选择,本质上都是其商业站位的投影。
1亿小时:ChatGPT时刻的核心门槛
姚卯青给出了一个具体的量化指标:“头部语言模型已经达到了100万亿Tokens,对应约100亿小时的语料,而具身智能的数据量还差1万倍以上。”他认为,要实现物理世界的ChatGPT时刻——也就是机器人能够在真实环境中开箱即用,完成日常任务并理解开放式指令——至少需要1亿小时级别的真实交互数据。
这一数字并非空想,姚卯青解释道,物理世界比语言世界复杂得多,噪声更多、信息冗余度更高,只有当模型掌握了物理世界的通用运行规律,实现从开放式指令理解到任务规划,再到70%-80%的常见任务成功率,才算是真正迎来了临界点。
VLA已死?技术路线的共识与分歧
网络上曾流传“VLA已死”的说法,任至意对此回应称:“到目前为止,我还没有看到有哪家团队做出了比π0.7更令人印象深刻的Demo,所以VLA可能还没有死。”他坚持认为,VLA与世界模型并不冲突,未来的目标是训练一个能够原生理解上下文、预测未来的模型,无论是VLA还是世界模型,都在朝着这个方向前进,两者并不矛盾。
马也骋则提供了另一个视角:Dyna团队确实已经从VLA切换到了世界动作模型,“在某些特定任务和场景中,我们发现WAM比VLA更高效,尤其是在我们特别关注模型鲁棒性和数据效率的情况下”。
张正友给出了更宏观的判断:“整个行业还处于起步阶段,技术路线远未收敛,不像大语言模型已经基本确定了核心范式。”
通用大脑还是全栈软硬件?两条路线都有机会
机器人公司的另一个核心战略选择,是专注于通用模型,还是同时研发模型、机器人本体和部署系统。
Physical Intelligence更倾向于先使用简单、稳定、维护成本低的机器人本体,快速搭建数据与模型研发基础设施。任至意表示,团队目前更多是在做基础研究,推动机器人基础模型能力的持续涌现,但他也提到:“长期来看,我们肯定会考虑打造更可靠的硬件,只是时间问题。”
智元则选择了更重的全栈路线,覆盖足式、双足、轮式机器人以及灵巧手的研发。姚卯青解释道,智元既要做长期研究,也要推进商业化落地,而商业化部署必须面对可靠性、成本、成功率和一致性等严格指标,只有深入参与硬件设计、生产和测试,才能区分哪些问题来自模型,哪些问题源于硬件和通信系统的限制。
张正友认为,两条路线都有成立的可能:“就像手机行业,苹果依靠软硬件一体化建立生态,而Android通过操作系统适配大量硬件;PC时代的Mac和Windows也长期共存。机器人行业未来也可能同时存在全栈公司和通用‘大脑’平台。”关键不在于路线本身,而在于公司是否具备与路线匹配的资源和能力。
大厂vs创业公司:谁能赢得未来?
张正友笑着说:“大厂的问题大家都很清楚,大模型时代谷歌发明了几乎所有核心技术,但最终OpenAI脱颖而出。”他给创业公司的建议是,不要做容易被大厂基座模型“吞噬”的增量式创新,“如果创业公司做的事情很容易被纳入大厂的基座模型,前景不会太好,应该聚焦在数据、场景这些需要深入耕耘的领域”。
马也骋则从技术角度补充道:“机器人策略必须在本地运行,对延迟极其敏感,不像语言模型可以调用云端API,所以即使没有开源模型,机器人公司也必须自研,这是不可避免的。”
腾讯Robotics X的选择也很明确:只做大脑,不做本体。张正友坦言:“我们在硬件领域还没有成功过,有自知之明。”
ChatGPT时刻:2到5年的行业共识
当被问及物理AI的ChatGPT时刻何时到来时,嘉宾们给出了惊人的共识区间:不到5年。姚卯青给出了最乐观的2年预测,赵子豪认为“少于3年”,张正友认为需要3-5年,马也骋和任至意都选择了4年,徐丹飞则给出了5年的预测,平均下来,顶尖专家们认为物理AI的ChatGPT时刻大约会在3-4年后到来。张正友补充道:“但要踏踏实实去做,这3到5年才有希望。”
物理AI的时代已经不远
圆桌讨论结束了,但关于具身智能的争论远未停止:VLA与世界模型谁将成为主流?真机数据还是人类数据更有价值?全栈路线还是通用大脑更具优势?这些问题暂时没有标准答案,但有一点可以确定:物理AI正在以远超预期的速度向我们走来。当数据飞轮真正转动起来,当模型能够从与真实世界的每一次交互中持续学习,那道横亘在Scaling Law面前的物理壁垒,终将被推倒。而那一天,或许就在2029年之前。


