文章摘要
2026年9月10日,DeepSeek发布全新架构系列最小尺寸模型V4.1Flash,该模型具备原生内置多模态视觉理解能力,通过不对称参数设计、KVCache压缩等技术创新,在性能、速度、成本等指标上全面超越上一代旗舰V4Pro。

2026年9月10日,DeepSeek正式发布新模型V4.1 Flash,这是全新模型架构系列中尺寸最小的成员,却具备原生多模态视觉理解能力。经多方测试,该模型在性能、速度、成本等指标上全面超越上一代V4 Pro。本文将深度解析这次发布的技术逻辑与行业影响。

DeepSeek正式发布新模型

一、这次发布到底意味着什么?

2026年9月10日,DeepSeek正式发布新模型DeepSeek-V4.1 Flash。消息并不突然——此前一天,DeepSeek官网已预告了这次发布计划。但发布后的信息量,远超大多数人的预期。

这不是一次常规迭代。DeepSeek官方将V4.1 Flash定义为“全新模型结构系列中的最小尺寸模型”,具备原生多模态视觉理解能力。更关键的是,官方明确表示:经内部和外部多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro。

“最小尺寸”碾压“最大旗舰”——这个信号本身就值得深思。

从2025年4月V3首次引发全球关注,到如今V4.1 Flash登场,DeepSeek在大约一年半的时间里完成了从V3到V3.1、V3.2、V4、V4.1的多次跨越。每一次迭代都在回答同一个问题:在算力受限的条件下,如何让模型更聪明、更快、更便宜?

V4.1 Flash给出的答案,可能比之前的任何一次都更有说服力。

二、V4.1 Flash的技术架构拆解

2.1 552B参数的MoE:参数规模背后的取舍逻辑

V4.1 Flash是一个552B参数的混合专家模型,采用了全新的Causal-Encoder-Decoder结构。这个架构最显著的特点是输入和输出不对称——输入激活仅8B参数,输出激活16B参数。

这种不对称设计的意义在于:输入侧的计算量被大幅压缩,而输出侧保留更强的生成能力。对于绝大多数实际使用场景而言,用户输入(prompt)的token数量远小于模型输出(completion)的token数量,这种结构可以让模型在推理时把更多算力用在“生成”而非“理解”上。

对比V4 Pro的1.6万亿参数和V4 Flash的2840亿参数,552B的体量处于中间位置,但激活参数的控制更为激进。这不是简单的“做大”或“做小”,而是在参数效率和能力之间寻找新的平衡点。

2.2 混合注意力架构与KV Cache革命

V4.1 Flash继承了V4系列的混合注意力架构,核心由Compressed Sparse Attention和Heavily Compressed Attention交替叠加构成。CSA负责在稀疏模式下高效筛选关键信息,HCA则对上下文进行极限压缩。两者配合,使得模型在处理百万token级别的长上下文时,单token推理FLOPs和KV cache占用都大幅下降。

但V4.1 Flash在KV Cache上的优化更进一步。官方数据显示,新一代模型大幅减少了KV Cache缓存大小,与上一代模型相比,对HBM的需求减少到1/4,对SSD的需求减少到1/8。

这个数字需要认真对待。在Agent使用场景中,缓存命中的费用往往占比较高。KV Cache压缩意味着同样的硬件可以支撑更多的并发请求,也意味着Agent类任务的使用成本被实质性拉低。

2.3 mHC:让深度模型“不崩”的关键

V4系列引入的Manifold-Constrained Hyper-Connections是容易被忽视但极其重要的创新。

传统残差连接是何恺明2016年在ResNet中提出的,十年来几乎没有根本性变化。但随着模型层数增加和参数规模膨胀,传统残差连接开始暴露问题:信号传递不稳定,训练过程中容易出现梯度爆炸或消失。

mHC的做法是将残差流之间的混合矩阵约束到“双随机矩阵”的流形上。通俗地说,就是让信息在层与层之间传递时,始终保持一种数学上可控的平衡状态。矩阵的谱范数天然不超过1,相当于给残差传播套上了一个硬上限。

这个约束带来两个直接好处:一是训练稳定性大幅提升,模型可以堆得更深而不崩;二是这种矩阵在乘法下是封闭的,堆很多层也不会出现数值漂移。

实测中,mHC带来的额外wall-time开销控制在overlapped pipeline的6.7%以内。用一个很小的计算代价,换来了模型可扩展性的质变。

2.4 原生多模态:不是“外挂”,是“内置”

V4.1 Flash的原生多模态视觉理解能力,是这次发布中最具战略意义的升级。

此前,DeepSeek在2026年8月发布过V4-Flash-Vision-Exp实验性多模态模型,它是在V4-Flash基础上增加了视觉理解能力,文本能力与V4-Flash保持一致。而V4.1 Flash的不同在于:多模态理解能力直接写入了基础架构,而非后期附加。

这意味着文本、图像(以及潜在的视频)在同一个架构中共享底层的表示和推理能力,而不是通过“视觉编码器+文本模型”的拼接方式实现。在实际效果上,V4.1 Flash在需要视觉理解的Agent基准测试中展现了显著优势——Chartography得分78.9(含工具调用),BabyVision(含工具)达到89.6。

三、性能数据:全面对比与深度解读

3.1 V4.1 Flash vs V4 Pro:核心指标横向对比

评测维度 DeepSeek V4.1 Flash DeepSeek V4 Pro(0813版) 变化趋势
参数总量 552B(MoE) 1.6万亿(MoE) 大幅缩小
输入激活参数 8B 远高于8B 显著降低
输出激活参数 16B 远高于16B 显著降低
GPQA Diamond 90.9 约87-88 提升
HLE(纯文本) 36.8 约33-35 提升
Codeforces Rating 3471 约3200+ 提升
Terminal-Bench 2.1 90.6 约82-85 大幅提升
KV Cache(HBM需求) 上一代的1/4 基准 降低75%
KV Cache(SSD需求) 上一代的1/8 基准 降低87.5%

V4.1 Flash在各项核心基准上的表现不仅追平了体量远大于自己的V4 Pro,在部分指标上还实现了明显超越。

Terminal-Bench 2.1从V4-Flash正式版的82.7提升到90.6,意味着在终端操作和Agent任务执行上的能力有了质的飞跃。Codeforces Rating达到3471,这是一个接近人类顶尖竞赛选手水平的数字。

3.2 与全球头部模型的对比

评测项目 V4.1 Flash GPT-5.6 Sol Claude Opus 5 GLM-5.3
GPQA Diamond 90.9 约92-93 约93-94 约88
Terminal-Bench 2.1 90.6 约88-90 约90-92
Terminal-Bench 3.0 30.0 34.4 43.3
HLE(纯文本) 36.8 约38-40 约40-42
Agents‘ Last Exam 31.8
单MToken价格 0.14/0.28美元

在Terminal-Bench 2.1上,V4.1 Flash的90.6分已经进入全球第一梯队。但在更严苛的Terminal-Bench 3.0上,30.0分与Opus 5的43.3分仍有明显差距。这个差距值得注意——它说明V4.1 Flash在“标准Agent任务”上表现出色,但在“极端复杂的终端操作”场景中,与顶级闭源模型还有追赶空间。

Arena.ai的评测给出了81.2分(满分100),排名在GPT-6 Astra(82.7)之后,高于GPT-5.6 Sol(77.6)。考虑到V4.1 Flash的参数量和定价,这个排名具有相当的竞争力。

3.3 速度:开发者的第一感受

“更快了”——这是内测阶段开发者反馈中最频繁出现的评价。有开发者提到,同一任务端到端运行,V4.1 Flash全面碾压V4 Flash Vision-Exp,例如SVG代码生成快了6倍,长上下文检索快了5倍多。

速度提升的来源是多方面的:更小的激活参数量、更高效的注意力机制、更紧凑的KV Cache,以及新架构在推理路径上的整体优化。

四、API生态与定价策略:真正的“降维打击”

4.1 定价下调的力度

V4.1 Flash发布的同时,DeepSeek宣布API价格进一步下调。新定价于2026年9月10日12:00生效:

计费项目 空闲时段 高峰时段
缓存命中输入 0.02元/百万token 0.04元/百万token
缓存未命中输入 1.0元/百万token 2.0元/百万token
输出 4.0元/百万token 8.0元/百万token

缓存命中的输入价格降至0.02元/百万token,这个数字在行业内几乎找不到对标。对于高频调用、多轮对话、Agent工作流等缓存命中率高的场景,这意味着一轮对话的成本可能低到可以忽略不计。

4.2 V4 Pro的有序退役

DeepSeek宣布将于北京时间2026年9月14日12:00下线V4 Pro服务,届时原V4 Pro请求将自动路由至V4.1 Flash,并按V4.1 Flash的单价计费。

这个决策的信号非常明确:在DeepSeek自己的评测中,V4.1 Flash在性能、成本、速度、总用时四个维度上全面优于V4 Pro。当“小模型”在所有关键指标上都超过“大模型”时,继续维护大模型的推理服务就不再有经济合理性。

不过V4.1 Pro仍在计划中,届时V4 Pro的用户可以选择升级到更强大的版本。

五、行业冲击:DeepSeek在下一盘什么棋?

5.1 Token调用量翻倍背后的“智能密度”逻辑

根据OpenRouter平台2026年1-6月的统计数据,DeepSeek的Token调用份额从9%翻倍至18%。斯坦福《2026 AI Index Report》的数据显示,中美头部模型性能差距已缩小至2.7%,叠加显著的价格优势,美企切换至DeepSeek后推理成本可下降30%至95%。

这组数据揭示了一个更深层的趋势:DeepSeek正在追求的,不是单个模型的绝对性能领先,而是“智能密度”的持续提升——即每单位成本所能输出的有效智能量。

当OpenAI将GPT-5.6 Luna的价格下调80%之后,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%。而V4.1 Flash进一步拉大了这个差距。

5.2 国产算力生态的深度绑定

V4.1 Flash延续了V4系列对国产算力的全面适配。DeepSeek在V4发布时已宣布全面适配华为昇腾芯片,这是国产大模型首次在国产芯片上完成从训练到推理的全栈部署。华为昇腾A2、A3及950全系列产品均已适配。

V4.1 Flash的架构特性——特别是KV Cache的大幅压缩和对HBM需求的降低——与国产超节点系统的优势高度契合。这种“模型架构与硬件特性协同设计”的思路,可能比单纯的性能提升更具长期价值。

5.3 对Agent生态的影响

V4.1 Flash的发布,对Agent生态的影响可能是最直接的。

KV Cache压缩到1/4、缓存命中价格降到0.02元/百万token——这两个数字叠加起来,直接改变了Agent类应用的“经济模型”。一个持续运行、频繁调用API的Agent,如果缓存命中率保持在较高水平,其运行成本可能比使用V4 Pro时降低一个数量级。

加上Agent能力的实质性提升(Terminal-Bench 2.1从82.7到90.6),V4.1 Flash让“长时间运行、多步骤执行”的Agent应用变得在经济上可行。

中金公司的研报指出,DeepSeek V4系列的效率优化正在“加速下游Agentic AI需求释放”。中信证券也认为,新一代模型有望“助力千行百业AI Agent落地”。

六、独到见解:从“参数竞赛”到“智能密度竞争”

6.1 大模型行业正在经历范式转换

V4.1 Flash的发布,标志着DeepSeek完成了一次重要的战略转身。

在2023-2024年,大模型行业的主旋律是“参数竞赛”——谁参数多、谁性能强,谁就能占据话语权。但从V4开始,DeepSeek的技术路线明显转向了另一条路:不是追求“更大的模型”,而是追求“更高效的模型”。

mHC让模型可以稳定地堆得更深,混合注意力让长上下文的计算成本可控,Causal-Encoder-Decoder让输入输出不对称以适配真实使用模式,KV Cache压缩让推理的硬件门槛大幅降低。这些技术创新有一个共同指向——在给定硬件条件下,最大化有效输出能力。

6.2 “Flash”这个名字的战略含义

值得注意的是,DeepSeek把V4.1系列的最小尺寸版本命名为“Flash”,而非“Lite”或“Mini”。这暗示了一个判断:在当前的技术范式下,“快”和“便宜”本身就是核心能力,而不是能力的降级版本。

从数据上看也确实如此。V4.1 Flash在Terminal-Bench 2.1上拿到90.6分,在Codeforces上达到3471的Rating——这些成绩放在任何一个“旗舰模型”上都足以自傲。它不是“低配版旗舰”,而是一个“重新定义了旗舰标准的新物种”。

6.3 对行业竞争格局的深层影响

V4.1 Flash的发布,可能会加速大模型行业的“分层”。

上层是追求绝对性能天花板的闭源模型,它们的定价可以维持在高位,服务于对性能极度敏感的场景。下层是追求“够用且极便宜”的开源/开放权重模型,它们以极高的性价比覆盖绝大多数通用场景。

DeepSeek选择把自己锚定在下层,而且不是以“够用就好”的姿态,而是以“性能足够强、价格足够低”的碾压式姿态。这种策略的杀伤力在于:当“便宜模型”在大多数基准上已经和“贵模型”持平甚至超越时,用户还有什么理由为溢价买单?

七、常见问题解答

Q1:V4.1 Flash和V4 Pro是什么关系?V4 Pro会消失吗?

V4.1 Flash是DeepSeek全新模型架构系列中的成员,在性能、速度、费用、总用时等指标上全面超越V4 Pro。DeepSeek计划于2026年9月14日12:00下线V4 Pro服务,届时原V4 Pro请求将自动路由至V4.1 Flash,并按V4.1 Flash的单价计费。V4.1 Pro预计后续推出。

Q2:V4.1 Flash支持哪些模态?

V4.1 Flash具备原生多模态视觉理解能力,支持文本和图像输入。与之前V4-Flash-Vision-Exp“外挂式”多模态不同,V4.1 Flash的多模态能力内建于基础架构中。

Q3:如何使用V4.1 Flash的API?

将模型名称设置为deepseek-flash即可调用最新的V4.1 Flash模型。此前的deepseek-v4-flashdeepseek-v4-flash-vision-exp模型名会被临时路由到V4.1 Flash。

Q4:V4.1 Flash的定价是多少?

空闲时段缓存命中输入0.02元/百万token,缓存未命中输入1.0元/百万token,输出4.0元/百万token。高峰时段为以上价格的两倍。新定价自2026年9月10日12:00起生效。

Q5:V4.1 Flash在Agent任务上的表现如何?

在Terminal-Bench 2.1上得分90.6,较V4-Flash正式版的82.7有大幅提升。在需要视觉理解的Agent任务上,Chartography得分78.9,BabyVision得分89.6(含工具调用)。KV Cache的大幅压缩使得长时间运行的Agent任务成本显著降低。

Q6:V4.1 Flash适配了哪些硬件平台?

V4.1 Flash适配华为昇腾全系列产品(A2、A3、950),同时支持英伟达平台。对HBM的需求降至上一代的1/4,对SSD的需求降至1/8,这使其在国产算力平台上具有更好的部署效率。

Q7:V4.1 Flash和GPT-5、Claude Opus 5相比处于什么水平?

在Terminal-Bench 2.1上得分90.6,进入全球第一梯队。在更严苛的Terminal-Bench 3.0上得分30.0,与Opus 5的43.3分尚有差距。Arena.ai综合评分81.2,高于GPT-5.6 Sol的77.6,低于GPT-6 Astra的82.7。考虑到定价仅为竞品的一小部分,其性价比优势非常突出。

Q8:V4.1 Flash是否开源?

V4.1 Flash已上线DeepSeek API平台。关于模型权重的开源状态,建议关注DeepSeek官方Hugging Face仓库和API文档的最新公告。

以上内容不代表本平台立场,仅供读者参考