文章摘要
剑桥大学一项研究聚焦数据驱动下动力系统学习。研究构造“对抗动力系统”,揭示部分系统即便数据充足也难稳定学习,根源在于数据信息量。指出数据驱动学习面临判断数据是否充分、瞬态行为混入建模两大难题,并点明传统Koopman建模缺陷。为此提出新算法,引入可解复杂性指数,经实际验证效果优,明确学习先判断系统可学性。

我们常默认,在AI领域只要训练数据足够充足、模型规模足够庞大,就能够学会任何系统的运行规律。而代码生成等领域的突破性进展,似乎也进一步佐证了这一观点。但关于AI能力边界、模型是否会完全取代人类工作的疑问,最终都指向一个基础科学问题:究竟在什么条件下,我们可以仅凭观测数据,就准确恢复出一个动力系统的内在规律?

近日发表于学术期刊的一项剑桥大学研究给出了明确答案:存在一类特殊的动力系统,无论向模型提供多少训练数据,都不存在能够实现稳定收敛的学习算法。

研究背景

现实世界中的绝大多数动态过程都可以被归类为动力系统,小到生物体内的信号传导网络,大到全球气候变化、流体运动、电力电网调度、金融市场波动,都属于这一范畴。但其中很多复杂系统至今没有明确的数学方程可供描述,因此科研人员一直希望能够直接通过观测得到的轨迹数据,直接学习系统的演化规律。

近年来,基于数据驱动的动力系统建模方法发展迅速,包括Koopman学习、动态模态分解以及各类深度学习预测模型都得到了广泛应用。但在实际落地过程中,一个普遍的现象始终存在:部分系统的建模效果会随着数据量提升持续优化,而另一些系统无论增加多少训练数据,模型始终无法实现稳定学习。此前,这类现象一直缺乏统一的理论解释,而本次研究则通过严格的数学证明,揭开了这一谜题的核心逻辑。

核心研究方法

与以往先聚焦算法优化的研究思路不同,本次研究首先从待学习的问题本身出发,构造了一类特殊的“对抗动力系统”。这里的“对抗”指的是,构造出在有限观测窗口内完全无法被区分的两个动力系统,以此来检验数据驱动学习的理论极限。

举个简单的例子:如果我们观测到一个未知系统的前10000步轨迹,系统A和系统B在这10000步内的表现完全一致,但从第10001步开始,两者的演化路径出现了根本性的分歧。那么对于任何学习算法来说,这10000步的观测数据都无法提供任何可以区分两个系统的统计信息,无论使用神经网络、Transformer还是其他解析算法,都无法准确判断真实系统到底是A还是B。

研究团队将这一思想推广到一类精心构造的动力系统,并证明:对于这类系统,任何学习算法都无法突破理论极限,最终的预测成功率最高只能达到50%。这一限制来自于数据本身所包含的信息总量,而非算法本身的能力上限。

数据驱动学习的核心困境

很多人会将动力系统学习失败的原因简单归结为训练数据不足,但本次研究明确指出:数据规模和数据所包含的信息量并不是同一个概念。如果两个系统在前10000步的观测中完全一致,仅在后续步骤出现分叉,那么即使拥有再多的前10000步数据,也无法为区分两个系统提供任何有效信息。也就是说,在数据没有包含足够的区分信息之前,单纯增加样本数量并不能提升学习效果。

具体来说,所有数据驱动的动力系统学习算法都面临两个根本性的逻辑难题:

1. 无法判断数据是否已经足够充分

很多动力系统满足遍历性,其长期统计平均值最终会收敛到稳定值,但目前并没有通用的方法可以判断,需要观测多久才能获得足够代表系统整体特性的数据。不同系统的收敛速度可能相差数个数量级,这也导致算法无法准确判断当前已有的观测数据是否已经足以支撑可靠的建模结果。就像人类通过数百年的观测总结出光速不变、熵增定律,背后也隐含着对观测时长的隐性判断。

2. 瞬态行为混入长期动力学建模

绝大多数真实系统都会经历两个阶段:初始的过渡过程,以及后续的稳定动力学阶段。实际观测得到的数据往往同时包含这两部分内容,这就导致学习算法很容易将短暂的过渡现象误认为是系统长期稳定的运行模式,进而产生大量虚假的特征。很多Koopman学习方法中出现的虚假特征值,其根源就在于此。

Koopman建模的核心挑战

Koopman理论近年来在非线性动力系统建模领域得到了广泛关注,其核心思路是将非线性动力系统表示为一个无限维的线性算子,而我们需要恢复的正是这个算子的谱结构,包括特征值、特征函数以及Koopman模态,这些参数直接决定了系统长期的动态演化方式。

经典的扩展动态模态分解方法,目标就是利用有限的观测数据来逼近这个无限维的线性算子。但这一思路本身存在根本性的困难:有限维的矩阵很难可靠地逼近无限维的线性算子。研究团队证明,在很多场景下,该传统方法会持续产生虚假的特征值,即使不断增加训练数据,这些伪谱特征依然会存在。因此,提升计算精度并不能解决根本问题,缺乏理论层面的收敛保证才是传统Koopman建模方法的核心缺陷。

新型Koopman学习算法

针对传统方法的缺陷,研究团队提出了一套全新的Koopman学习算法。与传统方法直接依赖有限矩阵谱分解不同,新算法能够根据轨迹数据自适应选择观测函数,并建立了完整的误差分析框架。

该算法的核心突破有三点:一是从理论上证明了算法的收敛性;二是可以准确计算预测结果的误差上限;三是能够对学习结果的可信度进行量化判断。与传统算法只能输出预测结果不同,新算法还可以同时生成一份“可信度证书”,告诉使用者当前的观测数据是否足以支撑建模结果,以及最终的预测误差最多可能达到多少。

可解复杂性指数(SCI)

研究团队引入了“可解复杂性指数”这一概念,用于衡量一个动力系统建模问题需要多少层渐近极限才能真正求解。

简单来说,部分问题仅需要通过增加数据规模就可以实现收敛,这类问题的SCI等于1;还有部分问题需要同时增加数据规模和模型规模才能逼近真实解,对应SCI等于2;而SCI更高的问题则需要更多层的嵌套极限才能得到可靠的建模结果。不同的动力系统对应着不同的SCI数值,这也意味着它们的学习难度存在本质区别。

SCI的提出也将动力系统学习与现代可计算性理论联系在了一起,清晰地证明了:一个动力系统的学习难度首先由其本身的数学结构决定,模型规模和计算资源的投入都无法突破这一数学属性的约束。

实际场景验证

研究团队通过北极海冰长期变化分析这一真实应用场景,对新算法进行了验证。新算法成功识别出了多个隐藏的Koopman模态,这些模态对应着北极不同区域海冰的衰减过程。

实验结果显示,新算法的预测效果优于现有的动力学模型和深度学习模型,且训练成本极低,仅使用普通CPU即可完成训练。此外,该算法还能够输出空间误差边界,为每一次预测提供量化的可信度评估。

研究的核心意义

这项工作的价值远不止于改进了一种Koopman学习算法,更重要的是重新定义了数据驱动学习的研究顺序:首先判断系统是否可学习,再确认数据是否包含足够的有效信息,最后再针对性地设计学习算法。

一个系统是否能够被数据驱动的模型学习,首先取决于其本身的数学结构是否允许,数据规模、模型规模和计算资源的投入都会受到这一数学边界的约束。这一结论可以类比时间序列预测:任何时间序列都可以拆解为趋势项、周期性项和随机项,其中随机项的占比直接决定了预测准确性的上限。如果一个系统完全由随机性主导,即使邀请顶尖学者来设计算法,也无法实现可靠的预测。

从这个角度来看,宇宙本身的随机性并非一件坏事,反而为所有物种留下了生存的空间,也解释了为什么无论AI技术如何发展,都无法成为真正的“先知”。

未来的动力系统数据驱动建模工作,首先需要回答一个根本性的问题:该系统的数学结构,到底能否提供足够的信息,让学习算法掌握其内在的演化规律。

相关研究论文:Adversarial dynamical systems characterize when data-driven learning succeeds or fails

以上内容不代表本平台立场,仅供读者参考