WAIC世界模型圆桌:技术路线、物理理解与部署挑战

作为当前人工智能领域热度居高不下却又缺乏统一共识的赛道,世界模型至今在概念定义、技术路径、训练范式、数据标准以及评测体系等多个维度都尚未形成收敛的共识。7月19日的WAIC世界模型专题论坛上,一场信息密度极高的圆桌讨论邀请到六位来自不同企业的世界模型技术负责人参与,他们分别来自大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人以及自变量机器人,其中大晓机器人首席科学家陶大程担任本场讨论的主持人。这些行业前沿从业者的观点,完整呈现了当前世界模型领域的真实生态。
比起表面的共识,嘉宾们的观点分歧更能反映行业的真实思考方向。
按照模型推演世界的空间维度,各家的技术路线大致可以分为三大阵营:
- 像素生成派:代表企业为极佳视界,核心聚焦像素级的世界模拟与视觉合理性生成
- 隐空间(JEPA)派:以无界动力为代表,依托隐空间完成世界状态的推演与物理量回归
- 融合派:包括大晓机器人、蚂蚁灵波、自变量机器人与智元机器人,其中大晓机器人主打理解、生成与预测一体化的架构,蚂蚁灵波则推出了覆盖多条技术路线的世界模型体系
不同的技术路线也带来了对核心问题的不同看法,首当其冲的便是世界模型究竟该对物理世界有多大程度的理解。
无界动力的夏中谱认为,评价世界模型的核心标准应当是其对几何、运动、力等物理状态的预测精度,理想的世界模型应当尽可能贴近专业物理模拟器的表现。而蚂蚁灵波的沈宇军则提出不同观点,他认为“物理合理性”比“物理精度”更重要——机器人不需要成为专业物理学家,只需掌握影响自身动作的关键物理规律即可,比如知晓同重量的铁比棉花下落更快,却无需纠结具体的下落速度数值,也不必精准复现每一条运动轨迹的物理参数。
关于世界模型的能力评价标准,嘉宾们同样存在显著分歧。
智元机器人的任广辉提出,推理的长时物理一致性是评价世界模型能力必不可少的指标之一,这是因为其团队的世界模型主要用于仿真场景,长程推演正是仿真器的核心生命线。而自变量机器人的王昊则直言长程推演属于“伪需求”,相较于这项能力,他更看重推理的时效性:如果模型推理速度过慢,错过机器人的决策窗口,再完整的物理理解也无法发挥实际价值。
这些观点碰撞的背后,其实是各家团队在捍卫自身模型的核心优势:隐空间模型可以直接回归物理量,因此能够大胆要求高精度的物理预测;而像素生成模型天然擅长生成视觉上合理的场景,因此更侧重物理合理性的呈现。对于长时一致性的需求差异,则源于不同的应用场景:智元的模型作为仿真工具需要长程推演,而自变量将世界模型与VLA整合进端到端框架,预测只是动作生成的前置步骤,过长的预测会拖慢整体推理速度,挤占宝贵的决策时间。
除了技术路线与评价标准的分歧,嘉宾们对于世界模型下一阶段最可能率先收敛的方向也各有判断。
任广辉与夏中谱都认为,行业将率先在统一表征领域形成共识——就像大语言模型的Token统一了自然语言的处理格式,具身智能至今尚未找到属于自己的“通用表征”,需要将视觉、语言、动作等多模态信息对齐到统一的表征空间中。
王昊则押注架构融合方向,他认为未来的世界模型将整合视频生成的未来预测能力、隐空间的高效推理能力以及3D显式建模的空间记忆能力,各取所长构建全新的架构体系,这一路径在大语言模型的发展历程中已经得到验证。
沈宇军的判断则聚焦于触觉模态,他笃定下一阶段行业将形成共识:触觉将成为机器人不可或缺的感知模态。一旦触觉数据的采集与建模取得突破,物理世界机器人专用的世界模型与数字世界的通用世界模型将彻底分道扬镳。目前多数机器人的世界模型都是从数字视频生成模型迁移而来,而蚂蚁灵波正在开发具身原生的世界模型,从机器人控制执行的实际需求出发,基于自回归架构从头预训练,让模型适配“边预测、边行动”的具身场景,而非为生成美观的视觉画面设计。
陶大程则提出,世界模型的收敛不会出现在某一条单一的技术路线上,而是会率先形成统一的评测标尺。就像深度学习的爆发并非源于神经网络在学术论战中说服特征工程派,而是ImageNet将所有方法拉到了同一套评测标准之下,当评测标尺统一后,行业收敛自然会随之到来。论坛期间,大晓机器人也发布了PHYSICAL IQ平台,这是首个具身原生、面向多场景、多本体、多任务的物理智能评测基准,用于公平量化不同机器人本体与世界模型的物理智能水平。
尽管各家在技术路线上存在分歧,但当机器人进入真实物理世界后,最终的评价标准会变得非常朴素:能否稳定完成既定任务。
不同嘉宾对此有着不同的表述:夏中谱将其定义为“决策有效性”,任广辉则从技术角度描述为“最终为策略提升多少实际指标”,朱政则用“多任务真机成功率”来衡量。这些说法虽然措辞不同,但核心目标完全一致。
在实验室环境中稳定完成Demo任务并不困难,毕竟可以为单次展示投入大量资源,但真实世界的规模化部署才是真正的难点。王昊分享了一个行业规律:模型能力从90%提升到99%,再从99%提升到99.9%,投入的成本并非线性增长,而是会呈现指数级提升。实验室中看似微小的错误率,在真实部署场景中会演变为频繁的人工接管与返工,最终带来难以核算的高额成本。
此外,对随机与突发场景的应对能力,也是机器人走出实验室后必须补上的短板。沈宇军举了商超机器人的例子:当机器人需要寻找一包蔬菜时,顾客可能随手将蔬菜放进牛奶柜,这类单个事件看似偶然,但对于每天需要面对不同顾客的机器人来说,这却是日常工作的常态。
陶大程特别强调了端侧能力对于规模化部署的重要性。当前很多世界模型运行在云端,但机器人留给自身做决策的时间通常只有几十毫秒到几百毫秒,无法依赖持续稳定的网络连接,云端算力也无法实时响应所有请求。他指出,行业最难的不是让模型变得足够聪明,而是让智能变得廉价、可靠且及时——Demo展示的是模型的能力上限,而规模化部署考验的则是模型的能力下限。
最后,嘉宾们也探讨了一个值得深思的问题:如果两年后回望当下,哪些选择是正确的,哪些又存在偏差?
沈宇军认为,当前行业容易混淆“模型的内在能力”与“模型展现出来的能力”:前者是泛化效率、可交互性等内在属性,后者则是生成效果等外在呈现。从两年后的视角来看,所有为提升模型架构内在能力所做的工作都是正确的,但过度追求外在的呈现效果则有待商榷;所有为搭建数据链路所做的准备都是正确的,但当下积累的数据最终是否会被后续迭代使用、是否需要更新,目前仍不确定。
朱政则提出,当前行业过多将精力分散在模型之外的商业化探索上,在基础模型尚未收敛的阶段就铺开大量商业化场景,最终成功的概率会非常低。
任广辉则预测,两年后世界模型将走向更加“具身原生”的方向,需要大规模的具身原生数据以及专门为具身智能设计的原生架构,才能适配真实机器人的应用场景。
这场持续一小时左右的圆桌讨论,覆盖了世界模型领域最值得关注的核心话题,完整呈现了行业现阶段的共识与分歧。陶大程在最后总结道:“分歧是论文的素材,重叠是产业的基底。”对于整个行业而言,当下的观点分歧非但不是问题,反而成为了推动行业发展的红利。

