DeepSeek正式发布新模型:V4.1 Flash全解读,小尺寸如何碾压旗舰?

2026年9月10日,DeepSeek正式发布新模型V4.1 Flash,这是全新模型架构系列中尺寸最小的成员,却具备原生多模态视觉理解能力。经多方测试,该模型在性能、速度、成本等指标上全面超越上一代V4 Pro。本文将深度解析这次发布的技术逻辑与行业影响。

一、这次发布到底意味着什么?
2026年9月10日,DeepSeek正式发布新模型DeepSeek-V4.1 Flash。消息并不突然——此前一天,DeepSeek官网已预告了这次发布计划。但发布后的信息量,远超大多数人的预期。
这不是一次常规迭代。DeepSeek官方将V4.1 Flash定义为“全新模型结构系列中的最小尺寸模型”,具备原生多模态视觉理解能力。更关键的是,官方明确表示:经内部和外部多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro。
“最小尺寸”碾压“最大旗舰”——这个信号本身就值得深思。
从2025年4月V3首次引发全球关注,到如今V4.1 Flash登场,DeepSeek在大约一年半的时间里完成了从V3到V3.1、V3.2、V4、V4.1的多次跨越。每一次迭代都在回答同一个问题:在算力受限的条件下,如何让模型更聪明、更快、更便宜?
V4.1 Flash给出的答案,可能比之前的任何一次都更有说服力。
二、V4.1 Flash的技术架构拆解
2.1 552B参数的MoE:参数规模背后的取舍逻辑
V4.1 Flash是一个552B参数的混合专家模型,采用了全新的Causal-Encoder-Decoder结构。这个架构最显著的特点是输入和输出不对称——输入激活仅8B参数,输出激活16B参数。
这种不对称设计的意义在于:输入侧的计算量被大幅压缩,而输出侧保留更强的生成能力。对于绝大多数实际使用场景而言,用户输入(prompt)的token数量远小于模型输出(completion)的token数量,这种结构可以让模型在推理时把更多算力用在“生成”而非“理解”上。
对比V4 Pro的1.6万亿参数和V4 Flash的2840亿参数,552B的体量处于中间位置,但激活参数的控制更为激进。这不是简单的“做大”或“做小”,而是在参数效率和能力之间寻找新的平衡点。
2.2 混合注意力架构与KV Cache革命
V4.1 Flash继承了V4系列的混合注意力架构,核心由Compressed Sparse Attention和Heavily Compressed Attention交替叠加构成。CSA负责在稀疏模式下高效筛选关键信息,HCA则对上下文进行极限压缩。两者配合,使得模型在处理百万token级别的长上下文时,单token推理FLOPs和KV cache占用都大幅下降。
但V4.1 Flash在KV Cache上的优化更进一步。官方数据显示,新一代模型大幅减少了KV Cache缓存大小,与上一代模型相比,对HBM的需求减少到1/4,对SSD的需求减少到1/8。
这个数字需要认真对待。在Agent使用场景中,缓存命中的费用往往占比较高。KV Cache压缩意味着同样的硬件可以支撑更多的并发请求,也意味着Agent类任务的使用成本被实质性拉低。
2.3 mHC:让深度模型“不崩”的关键
V4系列引入的Manifold-Constrained Hyper-Connections是容易被忽视但极其重要的创新。
传统残差连接是何恺明2016年在ResNet中提出的,十年来几乎没有根本性变化。但随着模型层数增加和参数规模膨胀,传统残差连接开始暴露问题:信号传递不稳定,训练过程中容易出现梯度爆炸或消失。
mHC的做法是将残差流之间的混合矩阵约束到“双随机矩阵”的流形上。通俗地说,就是让信息在层与层之间传递时,始终保持一种数学上可控的平衡状态。矩阵的谱范数天然不超过1,相当于给残差传播套上了一个硬上限。
这个约束带来两个直接好处:一是训练稳定性大幅提升,模型可以堆得更深而不崩;二是这种矩阵在乘法下是封闭的,堆很多层也不会出现数值漂移。
实测中,mHC带来的额外wall-time开销控制在overlapped pipeline的6.7%以内。用一个很小的计算代价,换来了模型可扩展性的质变。
2.4 原生多模态:不是“外挂”,是“内置”
V4.1 Flash的原生多模态视觉理解能力,是这次发布中最具战略意义的升级。
此前,DeepSeek在2026年8月发布过V4-Flash-Vision-Exp实验性多模态模型,它是在V4-Flash基础上增加了视觉理解能力,文本能力与V4-Flash保持一致。而V4.1 Flash的不同在于:多模态理解能力直接写入了基础架构,而非后期附加。
这意味着文本、图像(以及潜在的视频)在同一个架构中共享底层的表示和推理能力,而不是通过“视觉编码器+文本模型”的拼接方式实现。在实际效果上,V4.1 Flash在需要视觉理解的Agent基准测试中展现了显著优势——Chartography得分78.9(含工具调用),BabyVision(含工具)达到89.6。
三、性能数据:全面对比与深度解读
3.1 V4.1 Flash vs V4 Pro:核心指标横向对比
| 评测维度 | DeepSeek V4.1 Flash | DeepSeek V4 Pro(0813版) | 变化趋势 |
|---|---|---|---|
| 参数总量 | 552B(MoE) | 1.6万亿(MoE) | 大幅缩小 |
| 输入激活参数 | 8B | 远高于8B | 显著降低 |
| 输出激活参数 | 16B | 远高于16B | 显著降低 |
| GPQA Diamond | 90.9 | 约87-88 | 提升 |
| HLE(纯文本) | 36.8 | 约33-35 | 提升 |
| Codeforces Rating | 3471 | 约3200+ | 提升 |
| Terminal-Bench 2.1 | 90.6 | 约82-85 | 大幅提升 |
| KV Cache(HBM需求) | 上一代的1/4 | 基准 | 降低75% |
| KV Cache(SSD需求) | 上一代的1/8 | 基准 | 降低87.5% |
V4.1 Flash在各项核心基准上的表现不仅追平了体量远大于自己的V4 Pro,在部分指标上还实现了明显超越。
Terminal-Bench 2.1从V4-Flash正式版的82.7提升到90.6,意味着在终端操作和Agent任务执行上的能力有了质的飞跃。Codeforces Rating达到3471,这是一个接近人类顶尖竞赛选手水平的数字。
3.2 与全球头部模型的对比
| 评测项目 | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 | GLM-5.3 |
|---|---|---|---|---|
| GPQA Diamond | 90.9 | 约92-93 | 约93-94 | 约88 |
| Terminal-Bench 2.1 | 90.6 | 约88-90 | 约90-92 | — |
| Terminal-Bench 3.0 | 30.0 | 34.4 | 43.3 | — |
| HLE(纯文本) | 36.8 | 约38-40 | 约40-42 | — |
| Agents‘ Last Exam | 31.8 | — | — | — |
| 单MToken价格 | 0.14/0.28美元 | — | — | — |
在Terminal-Bench 2.1上,V4.1 Flash的90.6分已经进入全球第一梯队。但在更严苛的Terminal-Bench 3.0上,30.0分与Opus 5的43.3分仍有明显差距。这个差距值得注意——它说明V4.1 Flash在“标准Agent任务”上表现出色,但在“极端复杂的终端操作”场景中,与顶级闭源模型还有追赶空间。
Arena.ai的评测给出了81.2分(满分100),排名在GPT-6 Astra(82.7)之后,高于GPT-5.6 Sol(77.6)。考虑到V4.1 Flash的参数量和定价,这个排名具有相当的竞争力。
3.3 速度:开发者的第一感受
“更快了”——这是内测阶段开发者反馈中最频繁出现的评价。有开发者提到,同一任务端到端运行,V4.1 Flash全面碾压V4 Flash Vision-Exp,例如SVG代码生成快了6倍,长上下文检索快了5倍多。
速度提升的来源是多方面的:更小的激活参数量、更高效的注意力机制、更紧凑的KV Cache,以及新架构在推理路径上的整体优化。
四、API生态与定价策略:真正的“降维打击”
4.1 定价下调的力度
V4.1 Flash发布的同时,DeepSeek宣布API价格进一步下调。新定价于2026年9月10日12:00生效:
| 计费项目 | 空闲时段 | 高峰时段 |
|---|---|---|
| 缓存命中输入 | 0.02元/百万token | 0.04元/百万token |
| 缓存未命中输入 | 1.0元/百万token | 2.0元/百万token |
| 输出 | 4.0元/百万token | 8.0元/百万token |
缓存命中的输入价格降至0.02元/百万token,这个数字在行业内几乎找不到对标。对于高频调用、多轮对话、Agent工作流等缓存命中率高的场景,这意味着一轮对话的成本可能低到可以忽略不计。
4.2 V4 Pro的有序退役
DeepSeek宣布将于北京时间2026年9月14日12:00下线V4 Pro服务,届时原V4 Pro请求将自动路由至V4.1 Flash,并按V4.1 Flash的单价计费。
这个决策的信号非常明确:在DeepSeek自己的评测中,V4.1 Flash在性能、成本、速度、总用时四个维度上全面优于V4 Pro。当“小模型”在所有关键指标上都超过“大模型”时,继续维护大模型的推理服务就不再有经济合理性。
不过V4.1 Pro仍在计划中,届时V4 Pro的用户可以选择升级到更强大的版本。
五、行业冲击:DeepSeek在下一盘什么棋?
5.1 Token调用量翻倍背后的“智能密度”逻辑
根据OpenRouter平台2026年1-6月的统计数据,DeepSeek的Token调用份额从9%翻倍至18%。斯坦福《2026 AI Index Report》的数据显示,中美头部模型性能差距已缩小至2.7%,叠加显著的价格优势,美企切换至DeepSeek后推理成本可下降30%至95%。
这组数据揭示了一个更深层的趋势:DeepSeek正在追求的,不是单个模型的绝对性能领先,而是“智能密度”的持续提升——即每单位成本所能输出的有效智能量。
当OpenAI将GPT-5.6 Luna的价格下调80%之后,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%。而V4.1 Flash进一步拉大了这个差距。
5.2 国产算力生态的深度绑定
V4.1 Flash延续了V4系列对国产算力的全面适配。DeepSeek在V4发布时已宣布全面适配华为昇腾芯片,这是国产大模型首次在国产芯片上完成从训练到推理的全栈部署。华为昇腾A2、A3及950全系列产品均已适配。
V4.1 Flash的架构特性——特别是KV Cache的大幅压缩和对HBM需求的降低——与国产超节点系统的优势高度契合。这种“模型架构与硬件特性协同设计”的思路,可能比单纯的性能提升更具长期价值。
5.3 对Agent生态的影响
V4.1 Flash的发布,对Agent生态的影响可能是最直接的。
KV Cache压缩到1/4、缓存命中价格降到0.02元/百万token——这两个数字叠加起来,直接改变了Agent类应用的“经济模型”。一个持续运行、频繁调用API的Agent,如果缓存命中率保持在较高水平,其运行成本可能比使用V4 Pro时降低一个数量级。
加上Agent能力的实质性提升(Terminal-Bench 2.1从82.7到90.6),V4.1 Flash让“长时间运行、多步骤执行”的Agent应用变得在经济上可行。
中金公司的研报指出,DeepSeek V4系列的效率优化正在“加速下游Agentic AI需求释放”。中信证券也认为,新一代模型有望“助力千行百业AI Agent落地”。
六、独到见解:从“参数竞赛”到“智能密度竞争”
6.1 大模型行业正在经历范式转换
V4.1 Flash的发布,标志着DeepSeek完成了一次重要的战略转身。
在2023-2024年,大模型行业的主旋律是“参数竞赛”——谁参数多、谁性能强,谁就能占据话语权。但从V4开始,DeepSeek的技术路线明显转向了另一条路:不是追求“更大的模型”,而是追求“更高效的模型”。
mHC让模型可以稳定地堆得更深,混合注意力让长上下文的计算成本可控,Causal-Encoder-Decoder让输入输出不对称以适配真实使用模式,KV Cache压缩让推理的硬件门槛大幅降低。这些技术创新有一个共同指向——在给定硬件条件下,最大化有效输出能力。
6.2 “Flash”这个名字的战略含义
值得注意的是,DeepSeek把V4.1系列的最小尺寸版本命名为“Flash”,而非“Lite”或“Mini”。这暗示了一个判断:在当前的技术范式下,“快”和“便宜”本身就是核心能力,而不是能力的降级版本。
从数据上看也确实如此。V4.1 Flash在Terminal-Bench 2.1上拿到90.6分,在Codeforces上达到3471的Rating——这些成绩放在任何一个“旗舰模型”上都足以自傲。它不是“低配版旗舰”,而是一个“重新定义了旗舰标准的新物种”。
6.3 对行业竞争格局的深层影响
V4.1 Flash的发布,可能会加速大模型行业的“分层”。
上层是追求绝对性能天花板的闭源模型,它们的定价可以维持在高位,服务于对性能极度敏感的场景。下层是追求“够用且极便宜”的开源/开放权重模型,它们以极高的性价比覆盖绝大多数通用场景。
DeepSeek选择把自己锚定在下层,而且不是以“够用就好”的姿态,而是以“性能足够强、价格足够低”的碾压式姿态。这种策略的杀伤力在于:当“便宜模型”在大多数基准上已经和“贵模型”持平甚至超越时,用户还有什么理由为溢价买单?
七、常见问题解答
Q1:V4.1 Flash和V4 Pro是什么关系?V4 Pro会消失吗?
V4.1 Flash是DeepSeek全新模型架构系列中的成员,在性能、速度、费用、总用时等指标上全面超越V4 Pro。DeepSeek计划于2026年9月14日12:00下线V4 Pro服务,届时原V4 Pro请求将自动路由至V4.1 Flash,并按V4.1 Flash的单价计费。V4.1 Pro预计后续推出。
Q2:V4.1 Flash支持哪些模态?
V4.1 Flash具备原生多模态视觉理解能力,支持文本和图像输入。与之前V4-Flash-Vision-Exp“外挂式”多模态不同,V4.1 Flash的多模态能力内建于基础架构中。
Q3:如何使用V4.1 Flash的API?
将模型名称设置为deepseek-flash即可调用最新的V4.1 Flash模型。此前的deepseek-v4-flash和deepseek-v4-flash-vision-exp模型名会被临时路由到V4.1 Flash。
Q4:V4.1 Flash的定价是多少?
空闲时段缓存命中输入0.02元/百万token,缓存未命中输入1.0元/百万token,输出4.0元/百万token。高峰时段为以上价格的两倍。新定价自2026年9月10日12:00起生效。
Q5:V4.1 Flash在Agent任务上的表现如何?
在Terminal-Bench 2.1上得分90.6,较V4-Flash正式版的82.7有大幅提升。在需要视觉理解的Agent任务上,Chartography得分78.9,BabyVision得分89.6(含工具调用)。KV Cache的大幅压缩使得长时间运行的Agent任务成本显著降低。
Q6:V4.1 Flash适配了哪些硬件平台?
V4.1 Flash适配华为昇腾全系列产品(A2、A3、950),同时支持英伟达平台。对HBM的需求降至上一代的1/4,对SSD的需求降至1/8,这使其在国产算力平台上具有更好的部署效率。
Q7:V4.1 Flash和GPT-5、Claude Opus 5相比处于什么水平?
在Terminal-Bench 2.1上得分90.6,进入全球第一梯队。在更严苛的Terminal-Bench 3.0上得分30.0,与Opus 5的43.3分尚有差距。Arena.ai综合评分81.2,高于GPT-5.6 Sol的77.6,低于GPT-6 Astra的82.7。考虑到定价仅为竞品的一小部分,其性价比优势非常突出。
Q8:V4.1 Flash是否开源?
V4.1 Flash已上线DeepSeek API平台。关于模型权重的开源状态,建议关注DeepSeek官方Hugging Face仓库和API文档的最新公告。

