物理AI技术断裂层待弥合,元戎Superfluid Lab构建闭环体系

当前物理AI领域正迎来全新的发展瓶颈。过去一年多,视觉-语言-动作模型(VLA)、世界模型、基座模型与数据闭环等概念,成为头部智能驾驶与具身智能企业频繁提及的核心方向。越来越多AI企业开始探索将模型落地真实场景,让机器具备环境理解、趋势预测与行动执行的完整能力。尽管不同技术路线各有侧重,但深入到底层逻辑后,行业共同指向的核心问题逐渐清晰:AI如何从真实世界采集有效数据,如何将感知到的信息转化为对环境的深度理解,再将理解落地为可执行的行动,最终通过行动反馈实现持续迭代学习。
这个核心问题并非近年才出现,当行业技术路线逐渐收敛,真正的发展瓶颈开始浮出水面。
智能驾驶技术的研究对象经历了多次迭代升级,大致可分为三个核心阶段。早期的驾驶系统采用高度模块化的架构,感知模块负责识别车辆、道路与行人,预测模块推演其他交通参与者的运动轨迹,规划与控制模块则最终生成车辆的具体行动指令,每个模块各司其职,拥有独立的性能指标。随着端到端模型的兴起,行业开始减少人工预设规则与模块间的固定接口,让模型直接从传感器输入生成行驶轨迹或控制信号。而当物理AI热潮席卷行业后,研究方向进一步向前延伸。
当前物理AI的主流技术路径已大致收敛为“两条明线加一条暗线”。第一条明线是VLA模型,即视觉-语言-动作一体化架构,将视觉信息采集、语义场景理解与行动指令生成整合到统一模型体系中,让AI能够直接感知环境、理解场景并做出决策,理想与小鹏等企业均选择了这一技术路线。第二条明线以世界模型为核心,重点学习环境随时间与动作变化的演化规律,世界模型可以应用于场景生成、闭环仿真、数据生产与模型评测等多个环节,既能够帮助模型掌握物理世界的运行逻辑,也能为其他行动模型提供训练与验证的虚拟环境,华为WEWA、蔚来NWM都是这一路线的典型代表。而第三条暗线则是物理AI基座模型,通过大规模物理世界数据的预训练,让模型学习环境变化规律、物体间的关联关系与世界运行的底层逻辑,再通过少样本微调或后续训练适配不同任务。严格来说,基座模型并非与VLA、世界模型并列的路线,而是前两条明线共同追求的终极方向。目前两条明线的边界正逐渐模糊,从最初的路线选择转向能力协同,但将二者整合落地绝非易事。
尽管行业已经具备了这条技术链路中的大部分组件,但各环节之间仍存在三层明显的“断裂”。第一层断裂出现在模型与数据之间。物理AI需要海量真实场景数据,但数据规模的单纯扩张并不会自动催生对世界的深度理解,模型需要从数据中学习空间关系、时间变化规律、行为模式与行动后果。真实环境中暴露的能力缺口,反过来决定了下一轮数据采集、筛选与生成的方向,因此数据与模型之间需要建立持续的反馈闭环:由模型发现能力短板,数据系统补充对应场景,训练系统完成新一轮迭代,再通过评测与真实环境验证确认模型是否获得了新的能力。
第二层断裂位于视觉认知与行动执行之间。即便模型能够识别场景并理解其中的关联,也不代表可以生成稳定可靠的行动。以智能驾驶为例,当车辆识别到前方行人靠近路口并判断其可能横穿道路后,还需要解决一系列细节问题:在何处开始减速、减速幅度如何控制、是否需要提前变道、周围车辆会做出怎样的响应,以及整个动作能否在实时算力约束下平稳执行。视觉与语义理解需要转化为连续、实时且可验证的具体行动,VLA模型承担了连接认知与行动的核心任务,但这一连接仍需要未来预测、策略训练、闭环评测与真实场景验证的全方位支撑。
第三层断裂则存在于模拟环境与真实世界之间。世界模型与仿真系统能够以极低成本生成海量训练场景,理论上模型可以在虚拟环境中经历无限次测试,学习各类复杂情况,但真实世界的复杂性远超仿真场景:交通参与者的行为存在高度不确定性,传感器会受到天气、光照与遮挡的影响,大量长尾事件难以被仿真系统完整建模,且模型在虚拟环境中获得的能力提升,未必能完全等比例转化为真实场景中的表现。因此物理AI需要建立双向闭环链路:将真实世界中的问题引入仿真与训练流程,再将虚拟环境中训练出的能力放回真实场景中验证。
这些横跨数据、算法、仿真、基础设施、产品与工程团队的断裂层,看似分属不同技术方向,实则共同指向一个核心问题:物理AI需要一套能够持续学习与进化的完整系统,这绝非单一独立模型可以解决。由此,技术问题开始跨越部门边界,延伸至如何将全链路技术整合为统一的研究闭环。当前物理AI企业的当务之急,正是弥合各环节的断裂,搭建完整的研发闭环。
而在建立技术闭环之前,还需要解决研发体系中的两层核心“摩擦”。第一层摩擦存在于技术环节之间。模型暴露的能力不足需要反馈至数据系统,真实场景中的问题需要接入仿真与训练流程,训练后的模型能力需要回到真实环境接受检验,而这些环节并非彼此独立的孤岛,任何一个环节的衔接不畅,即便投入再多的数据、算力与模型规模,也只能带来局部指标的提升,无法实现整体能力的跃迁。第二层摩擦则体现在研发组织内部。通常来说,企业的基础模型、VLA或世界模型、数据系统、仿真团队与AI基础设施团队分属不同部门,每个团队都有自己的专业目标与工作节奏,但完整的技术闭环要求所有环节围绕同一个模型问题实现快速反馈,现实中这些环节往往难以天然对齐。因此,技术闭环的落地最终需要对应的组织闭环作为支撑。
正是在这样的行业困局下,国内首个面向物理世界基础能力研究的AI实验室——Superfluid Lab应运而生。该实验室由以智能驾驶技术起家的国内头部AI企业元戎启行设立,由前DeepSeek核心成员、元戎启行首席科学家阮翀带队。
实验室的命名“Superfluid”意为超流体,这是一种完全没有黏性的特殊物质状态,可以理解为“无视摩擦力”的流体:它可以在环状容器中无损耗地持续流动,也能以零阻力穿过极其微小的缝隙。元戎在7月29日发布的《对话Superfluid》文章中,解释了命名的两层含义:其一,希望实现信息的零阻力流动,让团队协作零内耗;其二,面向物理世界的智能系统,同样需要一套零摩擦的底层架构,这恰好对应了研发闭环需要解决的两层技术与组织摩擦。
据知情人士透露,Superfluid Lab于今年5月在元戎内部成立,目前已完成基础设施重构等早期筹备工作。实验室以基座模型为核心研究方向,重点探索VLA模型,同时推进世界模型与多模态理解技术的落地。在首次公开实验室时,元戎同步启动了招聘,岗位分为三个核心方向:
- 大模型算法方向,重点研究视觉、语言与动作的融合,让AI具备面向物理世界的完整能力
- 仿真算法方向,涉及物理规律建模、环境交互与仿真到真实的迁移技术
- AI Infra方向,负责构建支撑大模型训练的新一代基础设施
从招聘方向可以看出,Superfluid Lab覆盖了模型、仿真与训练基础设施三大核心板块,其基本技术架构大致为:基座模型从物理世界数据中形成环境认知,VLA模型将认知转化为具体行动,世界模型推演行动结果并提供虚拟仿真环境,AI基础设施支撑大规模训练与高频实验,最终由真实场景完成最终验证。
在《对话Superfluid》中,元戎将实验室的研究重点概括为三组核心关系:模型与数据之间的流畅性、视觉与行动之间的衔接、模拟与真实之间的迁移。实验室的第一步工作是明确核心问题,再逐步进入研究与解决流程。基座模型被放在了整个闭环的中心位置,阮翀甚至将其称为“一种信仰”——这里的信仰并非指某项技术已经拥有确定答案,而是指向持续挑战模型能力上限的研究周期与目标,即让模型能够解决越来越复杂的现实问题。
基座模型的特殊之处在于,它改变了过去AI研发以单点能力优化为核心的模式,因此基座模型的竞争,本质上不只是算法技术的竞争,更是围绕模型持续迭代的整套研发体系的竞争。这套技术闭环也对组织架构提出了全新要求,从招聘信息可以看出,Superfluid Lab强调开放的研究环境、相对扁平的协作模式与较少的固定工作边界,不同方向的研究人员围绕同一个模型展开工作,共同对最终的模型能力负责,这是一种全新的研发组织范式。
与传统研发围绕车型、版本与功能迭代不同,Superfluid Lab并不以某一款产品的发布节点作为研究终点,而是围绕基础模型能力搭建长期研发路线,更像是一个持续循环的进化过程,其研究单位从独立模块转向持续演进的模型,评价目标也从局部指标扩展至模型的整体最终能力。当然,这种组织模式是否能够真正提升物理AI的研发效率,仍需要时间的验证,Superfluid Lab本身更像是一次大胆的探索,尝试通过改变研发组织方式,搭建更高效的能力积累路径。
这背后也映射着整个智能驾驶与物理AI行业正在发生的深层变革。回顾智能驾驶过去几年的发展,行业竞争的核心正在经历阶段性的升级,技术竞争也进入了全新的阶段。从自动驾驶到物理AI,技术竞争的演进路径大致可分为三个阶段:
第一阶段是产品竞争,行业比拼的是功能覆盖范围、用户体验、量产规模与商业化效率,技术价值主要通过可交付的产品能力体现;第二阶段是模型竞争,端到端模型、VLA模型与世界模型相继成为新的竞争焦点,数据规模、模型参数、训练算力与迭代速度开始成为拉开企业技术差距的核心指标;第三阶段则是基础能力与组织竞争,企业需要将人才、数据、算力、模型、仿真、工程与真实世界反馈整合为一套能够长期进化的完整系统。
从这一趋势来看,Superfluid Lab可以视为元戎启行提前布局第三阶段竞争的重要尝试。据接近元戎启行的人士透露,该企业从创立之初就将自身定位为一家AI公司,也是最早将自身定位为“物理AI”企业的厂商之一,这一布局可以追溯至2025年3月,比行业整体的物理AI浪潮提前了近一年。元戎最初选择从智能驾驶领域切入,是因为辅助驾驶场景中积累的真实数据、工程能力与开放道路测试经验,是行业公认的物理AI能力的重要“试金石”。随着基座模型、多模态等技术逐渐成熟,这些积累的资源开始具备向更广泛物理世界场景延伸的潜力。Superfluid Lab正是在这一背景下成立,依托智能驾驶场景产生的数据与工程反馈,可以更专注地将研究目标指向物理世界的通用基础能力。在此过程中,元戎启行也逐渐从提供辅助驾驶技术的服务商,转型为生产物理世界基础能力的科技企业。
这种发展思路与十年前OpenAI的成立逻辑存在一定相似性:2015年末OpenAI创立时,人工智能领域已经拥有大量应用与研究成果,但行业仍缺乏一套能够持续提升智能能力的基础体系,OpenAI选择围绕通用智能的底层问题搭建长期研究组织,最终推动了基础模型时代的到来。几年后,随着大模型技术的突破,基础模型成为AI产业的核心底座,大量上层应用都建立在这一能力之上。如今,物理AI领域也正经历类似的阶段:自动驾驶、机器人等应用场景已经进入快速发展期,但行业仍缺乏一套能够理解物理世界、预测环境变化、并通过真实反馈持续进化的基础能力体系。当时OpenAI探索的是数字世界智能的底层能力,而今天物理AI领域正在寻找的,则是一套面向真实物理世界的智能底座,Superfluid Lab正是这一背景下的一次重要探索。
当然,这一定位目前仍需要长期的实践结果来支撑,相较于过去通过新模型、新参数与性能纪录衡量进步的阶段,第三阶段的竞争周期更长,也更难在短期内证明其价值。但连接数据、研究、工程与真实世界的核心能力,往往需要更长时间的沉淀才能形成。阮翀对此有过直接的解释:“快速迭代的技术往往也会被快速替代,而长期投入搭建的基础能力,一旦成型就会成为众多快速迭代业务的核心底座。”真正的长期主义,始终是去做那些难而正确的事情。

