文章摘要
DeepSeek正式发布V4.1-Flash版本,该版本落地原生多模态能力,开启了多模态领域的信息动力学新范式。它将上下文从单纯Token序列转化为可计算状态,通过六大技术模块从深度、空间等四个维度压缩上下文有效自由度,解决了传统Transformer超长上下文处理的瓶颈,大幅提升了超长文本与多模态数据处理效率,后续将聚焦打造内生时空认知能力。

随着DeepSeek V4.1-Flash版本的正式发布,该模型终于落地了原生多模态能力,标志着多模态领域的信息动力学新范式正式开启。

这款新版本的核心设计逻辑,在于将上下文(Context)从单纯的Token序列转化为可计算的状态,通过沿深度、空间、时间和数值精度四个维度持续压缩上下文的有效自由度,大幅提升了模型处理超长文本和多模态数据的效率。

传统Transformer模型在处理长度为 的上下文时,全注意力计算的复杂度达到 ,同时KV缓存的存储空间也会随着上下文长度 线性增长,这成为超长文本处理的核心瓶颈。

沿深度重整化上下文:Causal Encoder-Decoder架构

V4.1-Flash引入了Causal Encoder-Decoder(CED)架构,将模型网络拆分为前后两个独立阶段。首先由因果编码器对输入上下文进行编码,生成中间状态;解码器再基于该中间状态生成输出Token,这样超长上下文无需以原始序列形式贯穿整个网络,大幅降低了计算压力。

更关键的是,CED架构实现了输入与输出的非对称计算:在Prefill阶段,每个Token仅激活约80亿参数,而在Decode阶段则需要激活约160亿参数。这意味着模型在读取长上下文时会采用较低的计算预算完成粗粒化处理,而在生成具体Token时则投入更多计算资源,实现了计算资源的精准分配。

用重整化群(RG)的视角来看,CED架构相当于沿网络深度对上下文进行粗粒化处理,从高维的Token序列中提取出后续推理所需的有效表征,简化了后续的计算过程。

静态记忆与动态状态:Engram模块

V4.1版本扩大了Engram静态记忆的规模,参数总量达到约1960亿。对于高频、确定性的N-gram模式,模型可以直接通过查表(Lookup)的方式获取结果,避免这些模式反复进入主干网络进行动态计算,进一步节省算力。

通过这一设计,模型形成了两条并行的记忆路径:Engram模块负责保存相对稳定的静态关系,而CED架构与KV缓存则负责保存当前上下文的动态状态。这相当于将已经验证稳定的关系固定下来,仅将仍需根据上下文动态演化的关系保留在动态状态空间中,优化了内存和计算资源的使用效率。

沿深度复用关系:CSA2机制

CED架构完成了上下文的粗粒化处理,而CSA2机制则进一步减少了网络深度方向上的重复计算。注意力机制可以被拆解为两个核心问题:Indexer负责决定“去哪里查找相关信息”,而KV缓存则负责提供“查到的内容是什么”。

CSA2机制会根据不同网络层的变化程度,在Full、Reuse和Reindex三种模式之间动态切换。对于变化较小的网络层,模型会直接复用已有的关系计算结果,仅对发生变化的局部关系进行重新计算,避免了不必要的重复运算。

从RG视角来看,网络深度方向上的表征会逐渐形成相对稳定的富集范畴,后续的网络层无需重新构造全部的态射关系,仅需更新发生变化的局部关联即可,这一逻辑在TTT模块中同样适用。

沿空间筛选态射:层次化Indexer

超长上下文处理的另一个瓶颈在于,查询(Query)需要面对的关系空间过于庞大。V4.1版本通过层次化Indexer机制,先对候选关系进行粗筛,再选择Top-K的有效关系,将原本的平坦搜索转化为分层检索流程。

这一设计并没有消除上下文长度带来的搜索依赖,而是通过逐步粗粒化完整关系图,仅保留当前查询所需的有效态射关系,大幅缩小了实际需要计算的关系范围。因此,稀疏注意力的核心本质是减少关系的自由度,而非简单地减少Token的数量。

沿时间管理状态:Bounded Replay机制

上下文还存在时间维度的问题,历史状态没有必要始终保持最高的分辨率。Bounded Replay机制仅保留有限范围的局部历史状态,当需要恢复更早的历史信息时再进行重放操作。

这一逻辑与“Memory保存关系、Recall采样过去”的设计思路高度一致:过往的历史信息不必完整驻留在当前的计算空间中,仅需要作为可恢复的状态存在即可,进一步优化了内存占用。

压缩状态物理表征:FP4精度优化

在完成上下文粗粒化、静态记忆剥离、跨层复用和关系筛选之后,仍需保存的KV缓存状态可以通过低位宽表征进行进一步压缩。这一优化虽然在一定程度上牺牲了部分精度,但有效降低了内存占用,适配了实际部署的算力限制。

整体来看,这一系列优化形成了一条连续的信息压缩链:先减少状态的总数量,再减少重复计算的开销,随后缩短状态的生命周期,最后降低单个状态的存储精度。

CED、Engram、CSA2、Indexer、Replay和FP4六大技术模块并非孤立存在,它们共同协作,实现了上下文状态的生成、表征、检索、复用、生命周期管理和存储优化的全流程控制。

从Token到状态,从状态到范畴:V4.1的重整化流

CED沿深度完成上下文粗粒化,Engram固化稳定的关联关系,CSA2沿深度复用已有计算结构,Indexer沿空间筛选有效态射,Replay沿时间管理历史状态,FP4最终压缩状态的物理表征;再结合此前推出的mHC模块,整个模型形成了一条“Token-表征-关系-状态-采样”的完整重整化流。

V4.1-Flash版本的核心变化在于,这种“表征-关系-采样”的结构化逻辑开始直接融入推理计算过程。此时的上下文不再仅仅是模型需要处理的一串Token,而是逐渐演变为可以被重整化、复用、检索、重放和压缩的关系状态。

从更宏观的视角来看,模型的学习过程本质上是重整化的过程,学习的结果是形成富集的范畴,而推理过程则相当于对重整化结果进行采样的逆过程。

随着V4.1-Flash版本落地原生多模态能力,DeepSeek正式开启了多模态领域的信息动力学新范式。基于这一版本的基础大模型架构,后续的模型演进将开始聚焦于内生的时空认知能力的打造。

更多技术细节可参考官方技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

以上内容不代表本平台立场,仅供读者参考