LLM三大瓶颈:持续学习如何决定AI能力边界

当前大语言模型的发展正面临三个核心瓶颈,分别是持续学习、稀疏奖励与长上下文管理,这三个问题共同限制了AI像人类一样持续进化并落地更复杂的场景。
所谓持续学习,核心目标是让AI像人类一样在日常学习中既能掌握新知识,又不会遗忘已有的技能。比如当新的实验结果证伪了某一理论时,模型可以当天精准调整对应知识的权重,同时不影响对其他内容的判断。
稀疏奖励问题则会影响模型在多领域的判断力:很多工程领域的判断需要等待现实实验完成才能得到定论,如果实验周期较长,AI能获得的训练信号就会非常有限,此时模型只能输出通用性较强的模糊判断,缺乏聚焦细化的能力。
长上下文问题则更直观,比如在阅读大型代码库时,模型经常会写到后面就忘记了前面的约束条件,很多使用AI辅助写代码的开发者应该都有过类似的体验。
目前行业内常用的脚手架工程(也就是大家所说的harness),本质上是在缓解这些问题:针对模型缺乏聚焦细化能力的问题,通过skills做约束;同时skills也能一定程度缓解持续学习的问题,因为可以实现每日更新。长上下文的问题则通过可读写的memory来缓解,而memory也能部分解决持续学习中的个性化知识更新难题。
为什么现在的LLM无法实现人类习以为常的持续学习?
这源于神经网络的知识存储逻辑和人类大脑完全不同:人类的知识可以分门别类存储,但神经网络的知识是分散在数万亿个权重中的,每个权重都会同时参与多条知识的存储。当我们为了写入新知识调整权重时,每一次修改都会悄悄改写旧有的知识,这就是大家所说的灾难性遗忘现象,而人类大脑并不会出现这个问题——比如学会煮咖啡之后,我们并不会因此忘记如何骑自行车。
理清这个核心逻辑后就会发现,稀疏奖励和长上下文这两个问题,本质上都是持续学习无法实现时衍生出来的附带问题,并非独立存在的挑战。
为什么我们需要长上下文?
既然无法将经验直接写入LLM的权重中,行业的解决方案就是把所有需要的知识整理成“小抄”,在每次对话前都塞给模型查看,这也就是长上下文技术的本质——把“小抄”做得越来越长。但读取“小抄”和真正掌握知识完全是两回事:每次对话都需要从头浏览全部内容,过长的“小抄”还容易出现遗漏,而且每次对话都是全新的起点,无法积累持续的知识沉淀。
反观人类,稀疏奖励的问题并不会致命:哪怕每天获得的反馈很少,每一次经历的教训都会慢慢积累成直觉,最终形成稳定的判断体系。
如果真正解决了持续学习的问题,长上下文和奖励设计就会变成可选的优化项,而非必须的功能。从这个角度来看,LLM的三个核心瓶颈,本质上其实是同一个问题。
为什么持续学习如此难以实现?
这里需要引入一个核心概念:稳定性-可塑性权衡(stability–plasticity tradeoff)。简单来说,任何学习系统都面临一个两难选择:如果过于容易学习新知识,就很容易遗忘旧有的内容;如果过于保守以保住旧知识,又会很难适应新的环境变化,这是持续学习、神经科学以及在线学习领域的核心问题之一。
我们可以把这个权衡的两个极端分开来看:可塑性过强的系统,参数会快速根据新数据更新,优势是能快速适应新环境,但缺点是旧知识很容易被覆盖,也就是灾难性遗忘;稳定性过强的系统,参数几乎不会调整,优势是旧能力可以稳定保留,但缺点是无法学习新任务,甚至无法应对数据分布的偏移。
人类大脑经过进化,被调整到了“慢而稳”的状态:我们可能需要花几个月才能掌握微积分,但二十岁学会的技能到六十岁依然可以熟练使用。这也解释了两种看似矛盾的流行说法:一种是“人脑过了三十岁就很难学习新知识”,另一种是“人类的独特优势在于几十年如一日的知识连贯性”——其实二者都是低学习率的正反面:写入新知识的速度慢是代价,而知识存储的稳定性则是回报。
而当前的LLM则处于两个糟糕的极端:在对话场景中表现为“快而不存”,而重新训练时则是“快而乱存”,目前行业内还没有人能打造出“快而稳”的LLM系统。
那人类大脑是否解决了稳定性-可塑性的问题呢?其实并没有。神经科学中的经典互补学习系统理论认为:海马体的学习速度很快,具备高可塑性,用于保存具体的事件记忆;而大脑皮层的学习速度较慢,具备高稳定性,用于提取长期的统计规律,也就是“快速学习记忆-缓慢整合-形成稳定知识”的路径,并不会在每次经历事件后就直接大幅调整核心参数。但从根本上来说,大脑皮层才是这个系统的瓶颈,所以拉长时间来看,人脑依然是一个慢而稳的学习结构。
看到这里大家应该能明白,目前行业内的skills、memory等方案,本质上都是假设模型的本体权重(相当于人类的大脑皮层)不会更新,以此搭建了一个粗糙的外挂版“海马体”。但仔细思考就会发现,这个方案并没有解决最核心的问题:LLM的问题不是学习速度太慢,而是太快了——下次训练时所有的skills都可以被导入模型,但稳定性的问题却几乎没有得到解决。
期待AI能够取代科学家的人无法解释一个问题:如果一次权重更新就会让AI对某个细分领域的认知一致性发生变化,那么该如何用这样的模型来指导后续多年的实验研究?而相信人类专家不可替代的一方所提到的行业护城河——几十年积累的判断力和审美品味,恰恰就是当前AI所缺失的能力。真正的皮层整合,也就是让经验真正融入模型本身的知识体系,目前还没有人能够实现。
这也是所有关于“AI何时真正改变世界”的预测中,最大的不确定性都集中在持续学习这个问题上的原因。
这也能帮助我们更好地判断AI对就业的影响:可以用三个标准来衡量——你的工作是否依赖非普遍性的长上下文、是否需要随时适配更新的环境、是否需要非普遍性的专业判断?如果三项答案都是“是”,那么在持续学习取得重大突破之前,你的工作是安全的;如果三项答案都是“否”,那么你的工作就存在较高的被AI替代的风险,只是目前LLM还没有覆盖到这个领域而已。
我们可以拿微软Copilot的四个工具作为例子:Excel的场景标准化程度最高,是最危险的;PPT和代码的风险程度相近,PPT的非标情况更多,而代码则需要更长的上下文;文档类的工作则会长期需要人类进行微调。如果没有持续学习的重大突破,LLM在完成了这三类低风险的工作之后,就会进入发展停滞的阶段。

