文章摘要
DeepSeek正式推出原生支持多模态理解的DeepSeek V4.1 Flash大模型,该模型采用非对称架构、优化压缩KV缓存,部署使用成本远低于同类模型,性能超越包括DeepSeek V4 Pro在内的多款旗舰模型。目前它已接入官方API,下调后的定价将于2026年9月10日生效,同时开放开源,已有多家合作伙伴接入。

我们正式推出全新的DeepSeek V4.1 Flash模型,作为全新模型结构系列中的最小尺寸成员,它自带原生多模态视觉理解能力。这款新模型的研发初衷,是打造能力上限更高、推理速度更快、吞吐能力更强,同时可轻松扩展到更大参数规模的AI模型。

非对称架构设计,以低成本实现高性能

DeepSeek V4.1 Flash是一款552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder非对称结构,输入和输出的激活参数并不对称:输入激活仅为8B,输出激活则为16B,这让它的部署成本显著低于同尺寸的其他主流模型。此外,该模型使用了全新的预训练方式,并经过了更大规模的强化学习后训练,在基准测试中,其智能水平已经超越了包括DeepSeek V4 Pro在内的多款旗舰级模型。

优化KV缓存,大幅降低使用成本

新一代的V4.1 Flash模型对KV Cache缓存进行了大幅压缩,和上一代模型相比,它对HBM的需求降低到了原来的1/4,对SSD的需求更是缩减到了1/8。在Agent类使用场景中,缓存命中的成本往往占据总费用的较大比例,这次的KV Cache优化直接降低了这类任务的使用成本。根据团队公布的优化进展,相较于初代模型,当前的KV Cache体积已经缩小了437倍。

API调用服务支持

目前DeepSeek V4.1 Flash已经同步接入官方API平台,原生支持多模态能力,开发者只需将模型名称替换为deepseek-flash,即可调用这款最新的V4.1 Flash模型。此前的旧版本模型V4 Flash与V4 Flash Vision Exp已经正式下线,为了保证兼容性,原有的deepseek-v4-flashdeepseek-v4-flash-vision-exp模型名会暂时路由到V4.1 Flash。

同时经过多轮测试验证,V4.1 Flash在性能、使用成本、响应速度以及总耗时等各项指标上都全面超越了V4 Pro,因此团队计划逐步下线V4 Pro模型。从2026年9月14日12:00开始,到未来V4.1 Pro上线之前,所有访问deepseek-v4-pro的请求都会自动路由到V4.1 Flash,并按照V4.1 Flash的单价进行计费。

目前腾讯的WorkBuddy、CodeBuddy以及OpenCode已经作为官方合作伙伴,全量接入了DeepSeek V4.1 Flash,欢迎相关用户体验使用。

API定价策略调整

得益于模型架构的技术创新,V4.1 Flash能够以更低的成本服务更多用户,因此团队相应下调了这款模型的API调用定价。为了更合理地调配服务器资源,平台仍然采用峰谷分时定价机制,闲时段的价格仅为高峰时段的一半,以此鼓励用户根据自身使用需求调整任务执行时间。新的定价方案将从2026年9月10日12:00正式生效。

开源计划与社区支持

团队将全力支持开源社区对V4.1 Flash模型进行推理适配,并通过多种方式扩大模型的部署范围。如果有用户具备大规模部署的需求,且拥有对应的硬件资源,例如2k卡GPU以及存储集群,可以随时联系官方对接相关合作。模型的开源仓库以及技术报告链接如下:

以上内容不代表本平台立场,仅供读者参考