AICon深圳站:技术焦虑解药+AI领域热点汇总

在近期的WAIC活动现场,清华大学车辆与运载学院、人工智能学院教授李升波带来了主题演讲《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》,首次系统性提出了“物理原生智能”(Physics-native Intelligence,简称Phi)的概念,并完整阐述了其核心特征与技术体系,为破解具身智能发展的根本性难题提供了全新的技术范式。
李升波指出,物理原生智能具备三项核心特征:第一,采用解耦的状态表征世界而非单纯的传感器观测,系统状态由物理模型的“显状态”和神经网络的“隐状态”共同构成,兼顾准确性与泛化能力;第二,模型结构严格遵循时序性与因果性,坚持时序优先原则,原因先于结果,动作规划尽量减少对未来信息的依赖;第三,训练过程必须嵌入底层物理规律约束,比如对称性、守恒性以及动力学系统的辛几何结构等。
以下内容根据李升波教授的现场演讲整理,略有删节调整:
过去十年,人工智能领域诞生了诸多里程碑式的进展,从ResNet网络、AlphaGo到ChatGPT、DeepSeek等,每一次突破都引发了全球范围的广泛关注。我们探索、研究并开发人工智能,核心目标始终是让智能系统具备更强的通用化能力——唯有拥有通用能力,才能称得上真正的智能,无论是视觉智能、语言智能还是多模态智能,都在朝着通用化的方向持续演进。
作为当前人工智能的热点方向,具身智能同样以通用化为目标。人类本身就是具身智能的典型范例,类似人类与周围环境的交互模式,具身智能体需要与物理世界进行实时交互:通过感知环境、做出逻辑决策、执行对应动作,进而对物理实体产生影响。具身智能体能够交互的物理实体越多,其通用化能力就越强,智能水平也就越高。
具身智能并非全新概念,汽车领域的工程师是最早的实践者与开拓者。自动驾驶是首个实现量产的具身智能系统,而机器人则是当前行业关注的重点方向。未来的世界将是泛在的具身智能世界,智能体可以与一切可交互的物理实体进行互动。
不过,开发通用化的具身智能难度极大,远比视觉、语言领域的AI更具挑战性。即便到今天,自动驾驶的智能水平仍未达到人类驾驶员的水准,仅能实现L2级的驾驶辅助功能,尚未达成L4级的全场景自动驾驶能力。与自动驾驶相比,机器人的自由度更高、场景结构更复杂、交互对象更多样,如何开发具备通用能力的具身智能体,是学术界与工业界共同面临的重大难题。
目前具身智能主要沿用端到端模型的训练路线。从实际应用来看,自动驾驶需要百亿级别的网络参数以及亿级的驾驶片段数据;而机器人的本体与场景更为复杂,需要万亿级别的网络参数以及千亿级别的交互片段数据,训练难度至少是自动驾驶的十倍以上。如果继续沿用当前视觉、语言、多模态大模型的训练思路,显然无法实现通用具身智能的目标。
幸运的是,过去六十年来人工智能领域的先驱们为我们提供了诸多启发,让我们能够从全新的角度思考智能的开发范式。比如McCarthy建议重视世界的一般性表征,Pearl提出要关注人类认知的因果关系,Hopfield则强调嵌入物理系统的集体属性。结合这些先贤的思想,以及近十年人工智能的技术进展与具身智能的应用需求,我们逐步形成了物理原生智能的概念、特征与技术体系。
物理原生智能是一类更依赖物理规律、以更好地与物理世界交互为目标的具身智能。它依然以数据驱动的端到端模型训练作为基础架构,但从世界模型、数据结构与训练算法三个维度,充分考虑物理实体对智能的客观要求:比如物理世界的数据稀缺、功能安全性要求更高、模型训练需要兼顾稳定性与长期性。
具体来说,物理原生智能的特征包括:以解耦的状态表征系统动力学而非传感器观测值;设计满足时序性与因果性的隐式模型结构;采用底层物理规律规范模型的训练过程,使其更好地匹配物理世界的特性。
第一个特征要求系统状态由两部分构成:显状态服从系统动力学与物理约束,能够实现长期稳定的状态转移;隐状态服从物理规律驱动的受控转移,能够保证长期推演不会出现漂移。第二个特征需要满足三个要求:时序优先,即原因先于结果,状态预测不能依赖未来信息;干预敏感,即改变动作输入后,后续状态应产生可解释的差异;反事实思考,不仅关注正样本,还要挖掘负样本的信息收益。第三个特征则要求:对称守恒,即由对称性决定的物理量应保持守恒或受控变化;结构保持,即训练动力学应保留几何结构与能量收支规律。
物理原生智能需要全新的训练范式。一方面,需要使用虚实混合的数据来解决物理世界数据匮乏的难题;另一方面,需要采用阶梯式训练技术,逐步提升性能,而非寄希望于单一训练方法一蹴而就。建议将训练过程至少分为三个阶段:首先是监督学习预训练,随后进行强化学习后训练,最后使用强化学习进行真机微调。每个阶段所使用的数据、性能指标与训练算法都需要根据实际情况进行调整。
仅具备基本特征与训练范式还不足以开发物理原生智能,接下来从世界模型、数据结构与训练算法三个方面介绍具体的开发方法。世界模型是物理原生智能的核心。从朴素世界模型、世界动作模型到受控世界模型,面向具身智能的核心问题是如何增加动作输入,让模型能够真正影响物理世界。世界动作模型通过增加逆动力学模型,将未来状态与动作进行关联;受控世界模型则直接增加一个动作维度。但这两种方案都存在明显缺陷:长程、精细化且高稳定的动作输出效果不佳,且与强化学习等类脑训练算法的匹配度不高。
物理原生世界模型的设计更加强化因果律的满足,以显式、隐式两类状态作为转移动力学的核心:前者直接嵌入物理动力学模型,后者则通过神经网络构建物理模型。从观测到状态的转换采用已有的编码器机制,便于充分利用现有大模型领域的研究成果。将策略模块、评价模块直接与状态关联而非原始观测数据,这种结构化的信息输入方式,能够有效提升模型的动作准确性、功能安全性与可解释性。
数据层面,从当前观测到下一个观测的转移数据是基础,同时需要增加奖励信号r与人类经验知识K,这三者构成了物理原生数据的三要素。无论是互联网的视频数据、Ego/UMI数据、真机操作数据还是仿真合成数据,都可以通过数据重构、时空对齐与质量增强等手段,转化为结构统一的物理原生数据。
不同的数据分量如何与模型训练结合?转移特性主要用于支撑编码器、解码器与受控转移模块的训练,并提供部分策略性能;奖励信号则以强化学习为主,支撑评价模块并进一步提升策略性能;人类经验知识则通过大模型的评价能力,嵌入到受控转移模型或评价模型中,为世界模型的性能提升提供支持。
将数据信息注入模型需要配套的算法支持。物理原生算法的设计有三个核心要求:第一,嵌入训练动力学的底层规律,尤其是结构对称守恒的特性。神经网络模型的训练过程本质上是动力学系统的离散状态演化过程,与物理世界的动力学类似,训练动力学也存在广义能量守恒、辛几何结构保持等底层规律,如果能够将这些性质强制嵌入训练算法设计,将极大提升训练系统的稳定性。
第二,具备绝对安全保障能力。绝对安全性是具身智能模型训练的特殊要求,指的是在真机训练过程中,每一代模型都必须满足安全硬约束。就像人类新手学习驾驶,不仅要学会之后保证安全,学习过程中也要确保安全。从理论上来说,要达到这一要求,需要同时训练每一代的最优策略与它所运行的可行区域,而可行区域的扩大与智能体对环境的认知不确定性相互制约,需要通过博弈机制达到均衡状态,这就是保障绝对安全的基本原理。
第三,具备抗遗忘能力,这类似于人类的学习过程。由于具身智能的数据较为稀缺、应用场景繁多且每个任务的性能要求较高,训练过程只能通过多阶段分步实施,让性能持续进化提升,而不能指望通过一次性训练解决所有问题。因此,如何让每一批数据都发挥作用,后续训练不会遗忘之前的性能,是训练算法的基本要求,设计的关键在于构建抗遗忘条件与梯度正交机制。
围绕物理原生智能的技术框架与核心思路,清华大学的研究团队在过去十年开展了一系列核心算法的创新研究,自主研发了面向具身智能的通用训练平台GOPS(General Optimal Control Problem Solver)。该平台以用户定义的任务和约束为输入,能够自主组织训练数据生成、对象与环境建模、任务转化、网络构建、优化求解、参数调优、代码部署与控制器集成,形成从模型研发到端侧应用迭代的全流程闭环,旨在降低具身智能系统的开发门槛,提升模型训练、调优与部署的效率。
GOPS平台内嵌了一系列覆盖强化学习、模型优化、安全训练、状态估计与大模型微调的物理原生算法:DSAC通过连续值分布建模缓解策略高估问题,提升中小规模强化学习的稳定性;RAD将辛结构守恒融入自适应优化器,抑制异常梯度引发的参数更新振荡;LipsNet结合傅里叶滤波与李普希兹约束,缓解神经网络策略的动作震荡;RACS构建安全强化学习的三元迭代框架,通过可行域内外的差异化更新,实现安全区域的单调扩展与策略收敛;DACER将反向扩散模型嵌入在线策略迭代过程,支持多模态动作生成并缓解策略分叉难题;BOOM采用规划自学习驱动的世界模型强化学习机制,兼顾算法稳定性与复杂控制性能;NANO依托自然梯度下降构造几何约束的非线性高斯滤波器,提升复杂系统的状态估计能力;MVP引入瞬时速度约束和复合生成与选择机制,兼具生成式策略的高表达能力与单步生成的高时间效率。
人工智能的时代方才开启,方兴未艾。当前信息智能领域已经发展得如火如荼,而具身智能正处于快速发展的路上。物理原生智能为我们从自动驾驶走向机器人、走向更广泛的物理实体,进而迈向泛在具身智能的未来,提供了一条值得持续探索的技术路径。或许在不远的将来,我们能够看到人机交互、人机接口技术取得重大突破,在蛋白质领域、基因领域与量子领域开发出与人类智能相提并论的智能系统。


