大语言模型记忆机制全景解析:隐显混合与存储策略

在大语言模型的技术迭代中,「记忆」已经成为绕不开的核心概念,但长久以来这个词的定义始终模糊:从推理时的KV缓存,到检索增强的外部知识库,再到智能体的长期存储,不同技术都被冠以记忆的名号,却很少有统一的分类标准来梳理这些看似杂乱的方案。一篇由顶尖学术团队联合完成的综述文章,为大语言模型的记忆机制搭建了统一的架构分类体系,将从注意力缓存、循环状态建模、测试时训练到专家混合路由、哈希寻址存储等一系列看似无关的技术,全部纳入统一的设计空间进行对比分析。这篇综述的核心结论是:记忆正在从模型缩放的副产品,转变为下一代大语言模型的核心架构设计维度,这一趋势可能比单纯增加参数规模更深刻地影响模型形态。
三正交轴分类框架:统一记忆的评价坐标系
该综述的核心贡献在于提出了三正交轴分类框架,任何大语言模型的记忆机制都可以通过这三个维度进行定位:
| 轴 | 取值 | 回答的问题 |
|---|---|---|
| 表征(Representation) | 隐式 vs 显式 | 存的是什么?有没有独立的读写接口? |
| 更新动态(Update Dynamics) | 离线 vs 在线 | 什么时候更新?训练期还是推理期? |
| 持久性(Persistence) | 短期 vs 长期 | 信息能影响多久的计算? |
这三个维度基本相互独立:显式记忆既可以采用离线更新方式(如专家混合模型),也可以在线更新(如测试时训练的记忆模块);在线更新的记忆既可以是短期的滑动窗口注意力,也可以是长期的循环状态建模。该综述的表格部分梳理了从2017年Transformer诞生到2026年最新的Mamba-3、Engram、Kaczmarz线性注意力等超过45个代表性系统,按照三轴框架进行分类,堪称目前最全面的大语言模型记忆架构编年梳理。
隐式记忆:内嵌于计算流程的工作记忆
隐式记忆并非独立的存储模块,而是内嵌在模型计算流程中的临时记忆,其核心载体是自注意力机制。自注意力本质上是一种可微分的内容寻址工作记忆:历史输入的token被编码为键值对,新的输入通过查询向量实现内容检索。这种记忆模式支持在线更新与灵活访问,但受限于上下文窗口大小,且会随着推理结束而被丢弃。
关于隐式记忆有两个值得关注的观察:
- 上下文窗口扩大 ≠ 记忆能力变强。实证研究显示,长上下文模型往往无法充分利用名义上的存储容量,理论存储上限与实际利用率之间存在明显鸿沟。
- StreamingLLM 本质是隐式淘汰策略:通过滑动窗口结合少量注意力锚点token,持续覆写大部分历史信息,其长上下文能力并非来自无限存储,而是依赖精心设计的访问模式。
稀疏注意力技术(如Sparse Transformer、BigBird、Longformer)从记忆视角来看,是在固定存储预算内重塑访问路径;而MoBA、NSA等方案则进一步通过学习到的路由规则替代固定模式,实现块级的记忆访问控制。选择性注意力则承担了记忆的准入控制角色,决定哪些token值得被模型重点关注。相关研究显示,仅需要少量精心选择的全局记忆锚点,就能显著稳定长上下文推理的效果。
统一视角:注意力记忆的扩展方式不是"存更多",而是"更精细地控制准入、访问与保留"。
循环序列记忆:把历史压缩进状态
2024到2026年,循环序列记忆成为技术赛道的热点,相关技术的演进脉络清晰可见:
- 线性注意力与SSM主线:Linear Attention → GLA → Mamba/Mamba-2 → Mamba-3(复数MIMO状态空间,2026);RWKV系列演进到RWKV-7(向量门控广义delta规则)。
- 状态编辑语义:Gated DeltaNet-2把"键侧擦除"和"值侧写入"解耦;Kaczmarz Linear Attention把写入建模为键归一化投影;Kalman Linear Attention引入不确定性感知的滤波更新。
- KDA / Kimi Linear:通道级对角衰减 + 对角加低秩转移,是Kimi Linear的循环核心。
- 层级状态容量:Log-Linear Attention用Fenwick树层级状态,在"恒定大小状态"和"全量KV存储"之间找到对数级中间地带。
循环记忆的代价也很明确:状态与计算耦合,缺乏灵活读写控制;长程压缩会损失保真度。
显式记忆:可寻址、可持久、可写
显式记忆的定义性属性不是实现形式,而是自主性:存储的信息独立于即时计算图存在,可以被独立于标准前向传播的机制更新、访问和维护。
参数化记忆模块:推理时也能长记性
- Titans:专用记忆模块在推理时通过"惊讶度驱动的梯度信号"逐token更新——只改记忆参数,不动骨干。
- TTT-E2E:辅助参数子集在推理时对输入做端到端优化。
- In-Place TTT:更激进——直接把FFN的down-projection矩阵当作可复用快权重记忆,在标准MLP块内部赋予自主写语义。论文因此提出一个重要判断:显式记忆不一定是一个独立的"记忆库",也可以是一个被赋予写语义的静态参数矩阵。
- MEMORYLLM / LM2:固定大小的持久记忆槽/记忆池,跨层嵌入,前向自更新。
解耦学习动态是这一路线的共同心法:骨干编码通用能力,记忆参数吸收上下文信息——缓解灾难性干扰,但带来容量、更新稳定性和过拟合瞬时信号的新权衡。
查找式记忆:存储与计算解耦
- kNN-LM:外部持久datastore,跨推理调用存活——比KV Cache更"显式"。
- Engram(2026):哈希寻址的稀疏记忆槽,把记忆稀疏性和专家稀疏性明确分开——MoE稀疏激活的是"参数化变换",Engram稀疏寻址的是"存储的记忆条目"。这个区分很关键:查找记忆不能被还原为条件计算。
- PlugLM / ExplicitLM:可编辑记忆库,条目甚至是人类可读的token序列——让存储知识可检查、可定点更新。
论文特意划清了与RAG的边界:RAG靠外部编排管线,这里讨论的是嵌入模型结构的持久存储——记忆库是架构组件,不是工程外挂。
MoE = 参数空间里的条件记忆
这是全文视角最新颖的一节:MoE本质上是一种离线显式记忆。每个专家是一个持久的参数化记忆块,路由器就是在参数空间上做"上下文相关的寻址"。Mixtral的专家涌现专业化、DeepSeek-MoE的细粒度专家划分,都在强化这个解读:MoE实现的是模块化、可选择性访问的持久知识记忆。
多时间尺度更新:记忆的时间维度
Nested Learning引入层级化更新频率——不同参数子集以不同速率演化,形成"快适应-慢适应"的连续谱,直接呼应经典的快慢权重分解。这触及了稳定性-可塑性两难:高频更新适应性强但易漂移,低频更新稳定但迟钝。时间控制与结构持久性同等重要。
三轴之外,论文还分解了记忆怎么写的五类机制,这是全篇最具工程参考价值的内容。
系统层:混合架构、效率管理与评测
混合架构:从固定配比到信号门控
- 层间交错:Samba(Mamba+滑窗注意力)、Jamba(SSM-Attention混合块)、LightTransfer(把预训练Transformer的"懒惰层"替换为流式组件)、Priming(把混合化变成知识迁移问题)。
- 固定预算混合:OLMo Hybrid、Kimi Linear、Hymba、Falcon-H1——注意力放在哪一层、哪个头,都是设计时静态决定的。
- 新趋势:自适应混合路由。AMOR只在高熵位置激活事后注意力精炼块;HAM让循环记忆处理每个token,只把"循环状态预测不好的token"准入稀疏KV缓存。核心问题从"注意力该插在哪"变成"哪些token值得高分辨率存储"——混合记忆从静态层布局变成动态资源。
记忆管理:不是工程事后补丁,而是架构设计轴
CommVQ(KV向量量化)、PagedAttention(KV分页虚拟化)、Bottlenecked Transformers(工作记忆周期性巩固覆写)、Memory Caching(缓存循环状态快照而非逐token KV)——论文的立场是:压缩、虚拟化、结构化稀疏,重塑的是记忆的表征、访问与扩展方式,这是架构问题,不是系统运维问题。
评测:记忆不是一个标量
NIAH、LongBench、RULER、L-Eval、SCROLLS各有分工,但论文批评现有协议把"记忆容量"和"推理能力、Scaling效应"混为一谈。它呼吁把记忆性能分解为正交维度:容量、保真度、持久性、抗干扰、效率——隐式和显式记忆需要不同的评测协议(前者看长程依赖与噪声稳定性,后者看更新一致性、检索精度与延迟)。

