文章摘要
当前大型语言模型发展面临持续学习能力、稀疏奖励适配性与长上下文处理能力三大核心瓶颈,本质上是如何实现稳定的持续学习问题。目前常用脚手架工具可缓解部分问题,但未解决核心矛盾。持续学习存在稳定 - 可塑性权衡难题,大模型尚未找到有效方案。该问题影响对 AI 改变世界的预测及不同行业就业风险判断。

当前大型语言模型的发展面临三大核心瓶颈:持续学习能力、稀疏奖励适配性与长上下文处理能力。

持续学习的核心目标,是让AI像人类一样在日常交互中不断积累新知识,同时不遗忘已掌握的技能。理想状态下,当新的实验结论证伪了原有理论时,模型可以在当天精准调整对应知识的权重,且不会干扰对其他领域内容的判断。

稀疏奖励问题主要影响模型在细分领域的精准判断力。比如很多工程场景下,需要等待完整的现实实验结果才能获得训练信号,如果实验周期较长,模型能获取的反馈信号就会非常有限,此时模型只能输出通用性较强的模糊判断,缺乏聚焦到具体场景的精准决策能力。

长上下文处理的痛点则更容易被大家感知:当需要处理大型代码库、长篇文档这类复杂内容时,模型常常会在处理到后半段时遗忘前半段提到的约束条件,很多开发者在使用AI辅助编程时都有过类似的体验。

目前行业内常用的脚手架工具,也就是大家常说的Harness,本质上是通过间接方式缓解这些瓶颈:通过预设技能模板为模型提供明确的约束,一定程度上弥补了模型难以聚焦细分场景的问题,同时也能辅助实现轻量化的知识更新;对于长上下文问题,则通过可读写的外挂内存来扩展记忆容量,这类外挂内存也能部分解决个性化知识的更新需求。

很多人会好奇,为什么持续学习对人类来说是天经地义的能力,当前的大模型却难以实现?这就要从神经网络的知识存储方式说起:神经网络的知识并非像人类一样分门别类存储在独立的“抽屉”中,而是分散在数万亿个权重参数里,每个参数同时参与存储多条不同的知识。当我们为了加入新知识调整参数时,每一次修改都会在不经意间改写原有知识的存储,这就是大家常说的“灾难性遗忘”——人类学习煮咖啡之后,并不会因此忘记如何骑自行车,但当前的大模型却很难做到这一点。

理清了这个核心矛盾后再来看稀疏奖励和长上下文的问题,就会发现它们本质上都不是独立的难题,而是持续学习能力缺失带来的衍生问题。比如如果我们能让模型稳定地积累新知识,那么长上下文的需求就会被弱化,因为模型可以将长期经验内化到自身参数中,而非每次都依赖外部的“小抄”;同样,稀疏奖励的问题也会得到缓解,因为模型可以像人类一样,通过少量的反馈逐步沉淀出精准的直觉判断。从长远来看,大模型的三大瓶颈本质上其实是同一个核心问题:如何实现稳定的持续学习。

长上下文的本质只是权宜之计

很多人会先关注长上下文的优化,但其实长上下文只是当前的权宜之计。既然无法将经验直接内化到模型的参数中,行业目前的解决方案就是将所有需要的知识整理成“小抄”,在每次对话前投喂给模型,长上下文的长度本质上就是这份“小抄”的厚度。但读取“小抄”和真正掌握知识完全是两回事:每次都需要从头开始翻阅,不仅容易遗漏细节,而且每次对话都需要重新加载,无法实现记忆的持续留存。

持续学习的核心矛盾:稳定与可塑性的权衡

要理解持续学习的难点,就必须提到机器学习和神经科学领域的核心矛盾:稳定-可塑性权衡。简单来说,一个学习系统如果可塑性过强,能够快速适应新环境,就很容易遗忘已有的旧知识;如果稳定性过强,尽可能保留原有参数不被修改,又会难以学习新的知识,无法应对环境的变化。

这两个极端的表现分别是:高可塑性的参数对新数据的更新速度很快,能够快速适配新场景,但旧知识很容易被覆盖,也就是灾难性遗忘;高稳定性的参数几乎不会被修改,能够很好地保留原有能力,但无法学习新的任务,甚至在数据分布发生变化时也无法做出调整。

人类的大脑在进化中选择了“慢而稳”的模式:我们可能需要花几个月才能掌握微积分,但二十岁学会的技能,到六十岁依然可以熟练使用。这也解释了两种看似矛盾的流行说法:一方面有人说“人脑过了三十岁就很难学会新东西”,另一方面又有人认为“人类的独特优势在于长期的知识连贯性”——这其实都是低学习率带来的正反两面:学习新知识的速度慢,是为了换取长期存储知识的稳定性。

而当前的大模型则陷入了两个糟糕的极端:在日常对话中,模型表现出“快而不存”的特点,每次交互都是一次性的,无法留存对话中的知识;而如果通过重新训练来更新模型,又会变成“快而乱存”,很容易破坏原有掌握的技能。目前行业内还没有找到能够实现“快而稳”的有效方案。

那人类的大脑是否解决了这个稳定-可塑性的矛盾呢?其实并没有,神经科学中的经典理论“互补学习系统”给出了答案:大脑的海马体负责快速学习,存储具体的事件记忆,具备较高的可塑性;而大脑皮层则负责缓慢地整合信息,提取长期的统计规律,具备较高的稳定性。简单来说就是“快速学习记忆-缓慢巩固-形成稳定知识”,而非每次经历都直接修改大脑皮层的参数。但从本质上来说,大脑皮层依然是整个学习过程的瓶颈,拉长时间来看,人类的学习依然是“慢而稳”的模式。

回到当前的大模型解决方案,比如技能模板、外挂内存这类工具,本质上都是在假设模型本体的参数不会更新的前提下,搭建了一个粗糙的“外挂海马体”。但这类方案并没有解决真正的核心问题:大模型的问题不是学习速度太慢,而是学习速度太快,每次参数更新都会大幅改变模型对特定问题的认知一致性,而真正的稳定性问题依然没有得到解决。

比如那些期待AI能够独立成为科学家的人会面临一个无法解释的矛盾:如果一次参数更新就能让模型对某个细分问题的认知发生变化,那么如何让模型能够基于稳定的认知框架,指导后续多年的实验研究?而另一边,认为人类专家不可替代的观点则认为,人类几十年积累的判断力和审美能力,恰恰是当前AI所缺失的——真正的皮层整合,也就是让经验真正内化到模型自身的参数中,目前还没有人能够实现。

这也是为什么所有关于“AI何时真正改变世界”的预测,最大的不确定性都集中在持续学习这个核心问题上。

这个问题也能帮助我们更好地判断AI对不同行业就业的影响:一份工作是否依赖非通用的长上下文、随时更新的环境信息,以及非标准化的判断能力?如果你的工作同时满足这三个条件,那么在持续学习技术取得重大突破之前,你会相对安全;如果你的工作三个条件都不满足,那么就会面临较高的被AI替代的风险,只是目前AI还没有完全覆盖到而已。

举个例子,微软Copilot的四款核心工具中,Excel的被替代风险最高,PPT和代码开发的风险不相上下:PPT需要处理大量非标场景,而代码开发则需要更长的上下文支持;而文档类工作则会长时间需要人类进行微调,因为这类工作高度依赖个性化的判断和长期积累的知识。如果没有持续学习的重大突破,大模型在完成了第一批低风险的标准化任务之后,就会进入发展的停滞期。

以上内容不代表本平台立场,仅供读者参考