文章摘要
2026年9月8日,DeepSeek开启DeepSeekV4.1‑Flash中间版本限时内测,该模型是DeepSeek首款原生多模态大模型,采用全新架构,在能力、速度维度实现跨越式升级,生成速度达旧版Flash的3-4倍,多类任务速度提升数倍,视觉识别准确率显著提升。

2026年9月8日,DeepSeek正式开启DeepSeek V4.1‑Flash中间版本内测。新模型采用全新模型结构,首次实现原生多模态支持,在能力、速度、成本三个维度同步优化。开发者只需将模型名设置为deepseek-v4.1-flash-expires-on-0910即可调用。内测附带的一份反馈问卷直接询问该模型能否全面替换V4 Pro,揭示了DeepSeek的深层战略意图。

DeepSeek V4.1‑Flash内测开启

第一章:DeepSeek V4.1‑Flash内测:一场没有预告的“闪电战”

1.1 突发上线:从官方群到API的36小时

2026年9月8日下午,DeepSeek在官方交流群内发布了一条简短通知,宣布DeepSeek V4.1‑Flash的中间版本正式开启内测。没有新闻发布会,没有技术报告预热,甚至官方博客和API文档都尚未同步更新。这种低调而突然的发布方式,与DeepSeek此前V4系列正式版上线时的节奏形成鲜明对比。

开发者接入的方式极为简便:保持base_url不变,将模型名设置为deepseek-v4.1-flash-expires-on-0910即可直接调用。当前计费与DeepSeek V4 Flash保持一致,每个账号最多支持20路并发。值得注意的是,模型名称中的“expires-on-0910”明确表明这是一个限时测试版本,将在9月10日自动过期下线——留给开发者的体验窗口仅有两天。

1.2 一份问卷暴露的野心

比模型本身更值得玩味的是随内测一同发布的反馈问卷。DeepSeek直接向内测用户提出了一个极具冲击力的问题:“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”

这一提问的含义远超常规的产品调研。DeepSeek V4.1‑Flash虽然冠以“Flash”之名——在DeepSeek的产品体系中,Flash向来是更快、更经济的轻量版本——但DeepSeek对它的期待显然不是接替上一代Flash,而是在Flash的速度和价格基础上,向V4 Pro的核心能力靠拢。换句话说,DeepSeek V4.1‑Flash瞄准的是一个此前在行业中几乎不存在的定位:用Flash的定价,提供Pro级别的能力

这一战略意图如果实现,将彻底改写大模型市场的竞争规则。在行业普遍将模型按“能力等级”分层定价的格局下,DeepSeek试图用一款产品同时覆盖“高性能”和“高性价比”两个端点。

第二章:原生多模态——从“外挂”到“出厂自带”

2.1 V4 Flash Vision‑Exp的过渡角色

要理解DeepSeek V4.1‑Flash的升级分量,需要先回顾DeepSeek在多模态能力上的演进路径。

2026年8月21日,DeepSeek上线了实验性模型DeepSeek-V4-Flash-Vision-Exp,这是V4 Flash系列第一次正式具备视觉理解能力。该模型支持在文本之外输入图片,能够描述图片、识别截图文字、分析图表等。

然而,Vision‑Exp本质上是一个“外挂式”解决方案。它在V4 Flash 0731纯文本底座之上,外接了一个视觉编码器和一个对齐器(Aligner)。DeepSeek的API文档也将deepseek-v4-flash和deepseek-v4-flash-vision-exp列为两个独立的模型。这种架构虽然实现了多模态功能,但视觉理解与文本理解之间仍存在天然的割裂——模型并非“天生”就懂得如何处理图像与文本的融合信息。

2.2 原生多模态的架构跃迁

DeepSeek V4.1‑Flash的最大技术突破,在于官方明确宣称的“原生多模态支持”和“采用了新的模型结构”。

与Vision‑Exp的外挂式方案不同,DeepSeek V4.1‑Flash是DeepSeek第一款原生多模态模型。这意味着多模态能力在模型训练之初就被整合进基础架构之中,而非事后通过外接模块补足。模型“出厂”就自带图文一体化输入输出的能力,能够同时接受图片和文本输入,并在统一的表示空间中进行推理。

这一区别对实际体验的影响是深远的。在虎嗅的实测中,V4.1 Flash在短视觉任务上的表现尤为突出——一组视觉理解任务中,DeepSeek V4.1‑Flash大约5.7秒就完成了回答,而V4 Flash Vision‑Exp则花了200秒。这种接近两个数量级的差距,正是“原生”与“外挂”之间架构差异的直接体现。

有开发者将一张西装照片发给DeepSeek V4.1‑Flash,模型回答穿的是条纹西装。起初测试者以为又出现了幻觉——就像V4 Flash Vision‑Exp经常出现的那样——结果放大图片仔细一看,图中人穿的就是条纹西装。这个细节说明,DeepSeek V4.1‑Flash的视觉识别准确率已经有了质的提升,不再是“能看懂但经常看错”的半成品状态。

2.3 多模态能力对Agent任务的催化

视觉理解能力的提升,直接影响的是Agent类任务的完成质量。在需要视觉理解的Agent Benchmark上,DeepSeek-V4-Flash-Vision-Exp相比纯文本的V4 Flash已经实现了大幅跃升,多模态Agent能力接近Opus-4.8的水平。而DeepSeek V4.1‑Flash在此基础上更进一步——原生多模态架构使得视觉信息可以直接参与Agent的推理链条,无需经过额外的编码-对齐-融合流程。

这意味着在涉及图表分析、界面理解、图像推理等场景中,DeepSeek V4.1‑Flash的Agent能够以更低的延迟和更高的准确率完成任务。对于需要频繁处理多模态输入的企业级应用而言,这一升级的实际价值甚至超过了单纯的文本能力提升。

第三章:速度——从“快”到“快得离谱”

3.1 实测数据:吞吐量的代际跨越

如果说原生多模态是DeepSeek V4.1‑Flash在“能力”维度的升级,那么速度则是它最容易被感知的标签。

多位开发者的实测数据显示了惊人的提升幅度。在49k超长上下文检索场景下,DeepSeek V4.1‑Flash的处理速度比V4 Flash Vision‑Exp快了5.2倍;在SVG代码生成任务上,快了6.0倍。在经典的Manacher回文算法题解答上,速度提升4.6倍;在大型SQL查询生成与优化上,提升5.0倍。

有开发者让模型创建HTML页面,用SVG绘制一只鹈鹕骑自行车的2D动画,DeepSeek V4.1‑Flash仅用时75.4秒便完成了任务,输出速度达到328 tokens/s。社交平台X上甚至有开发者晒出高达507 tokens/s的输出速度。

在虎嗅的14组任务实测中,DeepSeek V4.1‑Flash的生成速度约为284 Token/s,接近旧版V4 Flash(约97 Token/s)的三倍。而在另一组重度长文本推理测试中,模型生成速度甚至达到420 tokens/s,端到端吞吐达409.5 tokens/s。

在行业内的调侃中,这个吞吐量“直接把别家所谓的极速模式(Highspeed)做成了自己的日常基准”。

3.2 速度背后的技术逻辑

如此大幅度的速度提升,不太可能仅仅来自工程优化。官方明确提到的“新的模型结构”暗示了架构层面的改变。虽然DeepSeek尚未公布V4.1 Flash的技术报告和架构细节,但结合V4系列此前的技术路线可以做一些合理推测。

V4系列采用的是混合专家架构(MoE),V4-Pro有1.6万亿总参数、490亿激活参数,V4-Flash有2840亿总参数、130亿激活参数。MoE架构的核心优势在于每次推理只激活一小部分专家网络,从而在保持大参数规模的同时控制计算成本。

DeepSeek V4.1‑Flash的速度飞跃可能源于几个方向:更高效的专家路由机制、更优化的推测解码策略、或者更大胆的模型稀疏化设计。DeepSeek团队在7月公开的DSpark论文中曾报告,在V4-Flash线上用户流量下,相比MTP-1基线、保持相同吞吐水平时,单用户生成速度提升了60%—85%。V4.1‑Flash很可能是在这一方向上进一步突破的产物。

3.3 “吐字快”不等于“交付快”——一个必须警惕的误区

速度的提升固然令人振奋,但虎嗅的实测揭示了一个容易被忽略的复杂面向:模型生成速度快,但端到端的任务交付未必更快

在复杂任务中,DeepSeek V4.1‑Flash倾向于开启更多的子Agent来验证和细化结果。这意味着虽然每个token的生成速度更快了,但模型会生成更多的token、调用更多的工具、进行更多的验证步骤,最终导致总耗时反而可能比旧版更长。

这一现象的本质是:能力更强的模型倾向于做更多的事情,而不仅仅是更快地做完同样的事情。对于开发者而言,这意味着不能简单地将“生成速度提升X倍”等同于“任务完成速度提升X倍”。在实际应用中,需要根据任务复杂度重新评估端到端的交付效率。

第四章:成本——降价还是“烧钱”?

4.1 官方口径与开发者感知的落差

DeepSeek官方宣称DeepSeek V4.1‑Flash“成本更低”。然而,首批开发者的实际感受却出现了分歧。

有开发者直言“5分钟10块钱”、“瞬间几十块没了”。在虎嗅的实测中,DeepSeek V4.1‑Flash在14组任务中累计消耗了3亿Token,在相同计费标准下,总花费比旧版V4 Flash高出36%。

这一看似矛盾的现象,根源在于单价不变但用量增加。DeepSeek V4.1‑Flash内测期间的计费标准与DeepSeek V4 Flash完全相同:空闲时段每百万Tokens的缓存命中输入、缓存未命中输入和输出价格分别为0.05元、1.5元和4.5元;高峰时段则分别为0.1元、3元和9元。每Token的单价并没有降低。

4.2 “成本更低”的真正含义

那么官方的“成本更低”究竟指什么?

合理的解读是:完成相同任务所需的计算成本或Token数量下降了。也就是说,如果让DeepSeek V4.1‑Flash和旧版V4 Flash完成同一个任务,新模型可能需要的推理步数更少、生成的冗余Token更少,从而在底层推理效率上实现了成本降低。

但问题在于,DeepSeek V4.1‑Flash的能力增强会诱导它在复杂任务中主动做更多的事情——开启更多子Agent、进行更多验证、生成更详细的内容。在虎嗅的测试中,V4.1在游戏和小说任务中累计开启了37个子Agent,仅子任务就消耗了超过1亿Token。

这就形成了一个有趣的悖论:模型越强,越“不满足”于简单完成任务,从而越“烧钱” 。官方的“成本更低”和开发者的“烧钱更快”,可能都是对的——只是站在了不同的视角。前者说的是“单位智能的成本”下降了,后者说的是“完成复杂任务的总支出”上升了。

4.3 降价预告:9月10日的转折

就在内测开启的次日,DeepSeek又宣布了一个重要消息:9月10日中午12点起,Flash系列价格将进行调整,缓存命中输入的单价直接砍掉60%。调整后,空闲时段每百万Token的缓存命中输入降至0.02元,未命中输入降至1元,输出降至4元。

这一降价动作,部分回应了开发者对成本的担忧。但对于那些在复杂任务中大量开启子Agent的场景而言,单价的降低能否抵消Token消耗的增加,仍需要更多实测来验证。

第五章:能力全景——DeepSeek V4.1‑Flash的综合表现

5.1 中文长文写作:从“模板作文”到“有人味”

36氪在实测中使用去年的高考作文题目测试了DeepSeek V4.1‑Flash的中文长文写作能力。结果显示,文章的开头、转折和收束都有明确设计,情绪推进也比较自然。相比一些习惯堆砌名言、强行拔高主题的模型作文,DeepSeek V4.1‑Flash的叙事节奏“要比以前的版本更有一些人味”。

这一评价指向了一个关键进步:大模型写作正在从“辞藻堆砌”走向“叙事流畅”。对于内容创作、营销文案、报告撰写等场景而言,这种“人味”的提升比单纯的词汇丰富度更有价值。

5.2 前端代码生成:速度亮眼,但并非全能

在前端开发能力的测试中,DeepSeek V4.1‑Flash展现出了令人印象深刻的速度和视觉理解能力。

在模拟拍立得相机的测试中,DeepSeek V4.1‑Flash仅耗时5分钟便交付了答案,其对网页视觉层级的理解颇为成熟——相机外壳、镜头、快门及相纸出口的空间关系明确,光影处理得当。

在科幻飞船驾驶舱HUD的测试中,DeepSeek V4.1‑Flash为不同界面层设置了差异化的响应速度——中心准星最灵敏,外围仪表稍慢,背景移动幅度最小——由此制造出驾驶舱玻璃、飞船姿态和远处空间之间的纵深感。这种对交互细节和视觉层次的理解,体现了模型在UI/UX设计方面的进步。

然而,在面对“在一个HTML文件中制作一套类似macOS的网页操作系统”这样的经典高难度任务时,DeepSeek V4.1‑Flash的表现“中规中矩,并未带来太多惊喜”。这说明DeepSeek V4.1‑Flash在极大规模、极复杂的前端项目上仍有提升空间。

5.3 代码质量:快速迭代的优势

多位开发者的反馈显示,DeepSeek V4.1‑Flash在编程场景中的主要优势在于速度而非一次性准确率。有开发者提到代码质量“不太稳定,但基本一轮就能改好”。

这种“快速试错-快速修正”的模式,对于需要频繁迭代的编程场景而言,可能比一次性生成完美代码更有实际价值。在开发流程中,能够以极低延迟生成可用代码、然后根据反馈快速调整,往往比花更长时间生成“可能正确”的代码更高效。

5.4 长上下文:保留优势,但仍存挑战

DeepSeek V4系列的核心优势之一是100万Token的上下文窗口。DeepSeek V4.1‑Flash延续了这一大上下文优势。

然而,虎嗅的实测指出,长上下文的一致性问题仍然突出。在小说生成测试中,出现了章节前后人物特征矛盾、叶片数不一致等问题;在数据报告测试中,年化收益等关键数字不统一。这说明,虽然模型能够“记住”100万Token的内容,但在长文本中保持逻辑一致性、避免“遗忘”关键信息,仍然是一个有待解决的问题。

对于需要处理长篇文档、进行复杂数据分析的场景而言,这一短板可能会限制DeepSeek V4.1‑Flash的实际应用效果。

第六章:横向对比——DeepSeek V4.1‑Flash在行业中的位置

6.1 与V4系列内部对比

对比维度 DeepSeek V4 Flash (0731) DeepSeek V4.1 Flash (内测) 提升幅度
模型架构 V4衍生MoE架构 全新模型结构 架构级升级
多模态支持 外挂Vision Exp(独立模型) 原生多模态支持 从“外挂”到“原生”
生成速度 ~97 Token/s ~284-420 Token/s 约3-4倍
SVG代码生成 基准 快6倍 600%提升
长上下文检索 基准 快5.2倍 520%提升
计费标准 基准 相同(内测期) 单价不变
上下文窗口 100万Token 100万Token 持平

数据来源:

从内部对比来看,DeepSeek V4.1‑Flash在速度和多模态两个维度上实现了跨越式升级,而价格在短期内保持不变——这意味着单位算力的性价比大幅提升。

6.2 与海外主流模型对比

在定价层面,DeepSeek的成本优势极为显著。据行业分析,DeepSeek V4.1 Flash的输入价格约为0.12美元/百万Token,而GPT-5.6约为5美元/百万Token——开源模型的输入定价比闭源模型便宜约42倍。在输出Token层面,DeepSeek V4.1比Claude Opus 4.7便宜约7倍,比GPT-5.5便宜约9倍。

一个典型的10轮Agent编程会话,使用DeepSeek V4.1的成本约为0.003美元,而使用Claude Opus 4.8则约为0.75美元——相差250倍。

在能力层面,根据行业基准测试,Claude Opus 4.8在长程编程上仍是绝对的第一梯队(FrontierSWE约75.4分),DeepSeek V4.1推测在第二梯队(约73-74分),与Gemini 3.1 Pro、GLM-5.2处于同一水平。

这意味着DeepSeek V4.1‑Flash的策略非常清晰:用第二梯队的能力、第一梯队(指成本最低梯队)的价格,在性价比维度建立无可争议的领先地位

6.3 与国内模型对比

在国内市场,根据Artificial Analysis的数据,DeepSeek模型的智能指数为36分,排在榜单第15位,落后于智谱(第7位)和Kimi(第9位)。这一排名与DeepSeek的市场热度之间存在一定落差,也解释了外界对V4.1 Flash的高度期待——它承载着DeepSeek在能力排名上“重回第一梯队”的希望。

第七章:深度洞察——DeepSeek V4.1‑Flash的行业意义

7.1 “Flash的模型,Pro的野心”——定价策略的范式颠覆

DeepSeek V4.1‑Flash最值得关注的,不是它比V4 Flash快了多少倍,而是它试图重新定义“Flash”和“Pro”的含义。

在传统的AI产品体系中,“Flash”意味着轻量、快速、便宜但能力有限;“Pro”意味着强大、全面、昂贵但能力顶尖。这两个定位之间有一条清晰的能力-价格曲线。而DeepSeek V4.1‑Flash试图用Flash的价格打破这条曲线——如果它真能在内测结束后提供接近Pro的能力,那么大模型市场的定价逻辑将被彻底改写。

官方问卷中那句“能否全面替换V4 Pro”,本质上是在试探市场对这一新定位的接受度。DeepSeek在问的不仅是“这个模型好不好用”,更是“如果我用Flash的价格卖Pro的能力,你会怎么想”。

7.2 40天迭代的背后:组织效能的信号

从V4正式版到V4.1 Flash内测,中间只隔了约40天。在这40天里,DeepSeek完成了V4 Flash正式版上线(7月31日)、V4 Pro正式版发布(8月13日)、DeepSeek Harness开源(8月13日)、V4 Flash Vision Exp上线(8月21日)等一系列密集动作。

这种迭代速度本身就是一种信号。它说明DeepSeek的内部研发管线已经具备了极高的运转效率——能够在保持多个产品线并行推进的同时,在短短40天内完成从架构设计到内测部署的全流程。对于一家AI公司而言,这种组织效能可能比单次模型升级更具战略价值。

7.3 “智能密度”的追求

有评论将DeepSeek V4.1‑Flash的升级方向概括为追求极致的“智能密度”——即在单位算力、单位成本内实现尽可能高的智能水平。

这一方向与当前行业主流的“堆参数、堆数据”路线形成了有趣的分化。在参数规模已经达到万亿级别、继续扩大规模的边际收益递减的背景下,如何在现有规模下榨取更高的“智能密度”,可能才是下一阶段竞争的关键。DeepSeek V4.1‑Flash在保持V4系列参数规模(284B总参数/13B激活参数)不变的前提下,通过架构优化实现速度和能力的双重跃升,正是这一思路的实践。

7.4 限时内测的产品策略:测试还是营销?

DeepSeek V4.1‑Flash的“expires-on-0910”命名方式,以及仅有两天的测试窗口,在行业引发了不少讨论。

这种极短周期的限时内测,既是一种产品测试策略,也是一种营销策略。从产品测试的角度,两天时间足以收集到大量开发者的真实反馈和性能数据。从营销的角度,“限时”“内测”“过期即焚”的标签天然具有话题性和紧迫感,能够在短时间内引爆社区讨论。

更深层地看,这种策略也降低了风险——如果模型表现不及预期,它只是一个“两天就过期的中间版本”,不会对DeepSeek的品牌造成长期伤害;如果表现超出预期,则可以为正式版积累口碑和期待。

7.5 开源策略的延续与深化

DeepSeek V4系列的一个重要特点是MIT开源协议。DeepSeek V4.1‑Flash虽然目前仅以内测形式存在,但根据DeepSeek的一贯做法,正式版本很可能会延续开源策略。

开源策略是DeepSeek区别于OpenAI、Anthropic等闭源厂商的核心差异化优势。在开发者社区中,开源模型的可定制性、可审计性和无供应商锁定特性,具有闭源模型无法替代的价值。如果DeepSeek V4.1‑Flash能够以开源的形式提供接近闭源顶尖模型的能力,它将在开发者生态中建立起坚实的壁垒。

第八章:FAQ——关于DeepSeek V4.1‑Flash的常见问题

问:DeepSeek V4.1‑Flash和DeepSeek V4 Flash有什么区别?

答:DeepSeek V4.1‑Flash采用了全新的模型结构,首次实现原生多模态支持(V4 Flash的多模态能力来自外挂的Vision Exp独立模型)。在速度上,DeepSeek V4.1‑Flash的生成速度约为V4 Flash的3-4倍。在具体任务上,SVG代码生成快6倍,长上下文检索快5倍以上。

问:DeepSeek V4.1‑Flash现在能用吗?怎么用?

答:可以。开发者保持base_url不变,将模型名设置为deepseek-v4.1-flash-expires-on-0910即可调用。当前计费与DeepSeek V4 Flash相同,每账号限流20并发。需要注意的是,该版本是限时内测版本,将于9月10日自动过期下线。

问:DeepSeek V4.1‑Flash是免费的吗?

答:不是免费。内测期间计费与DeepSeek V4 Flash相同。空闲时段每百万Tokens缓存命中输入0.05元、缓存未命中输入1.5元、输出4.5元;高峰时段分别为0.1元、3元、9元。9月10日起Flash系列将降价,缓存命中输入单价降低60%。

问:DeepSeek V4.1‑Flash支持哪些功能?

答:支持原生多模态(同时接受图片和文本输入)、100万Token上下文窗口、JSON输出、工具调用(Tool Calling)等功能。支持非思考模式与思考模式。

问:DeepSeek V4.1‑Flash能取代V4 Pro吗?

答:这是DeepSeek在内测问卷中直接询问开发者的问题。目前尚无定论——DeepSeek V4.1‑Flash的速度和效率明显优于V4 Pro,但在复杂任务的处理深度和长文本一致性上是否达到Pro水平,仍需更多验证。从DeepSeek的战略意图来看,他们希望DeepSeek V4.1‑Flash能够接近Pro的能力水平。

问:DeepSeek V4.1‑Flash的开源计划是什么?

答:DeepSeek尚未公布V4.1 Flash的具体开源计划。但V4系列延续了MIT开源协议,如果DeepSeek V4.1‑Flash延续这一做法,正式版很可能会开源。

问:DeepSeek V4.1‑Flash在编程方面的表现如何?

答:DeepSeek V4.1‑Flash在编程场景中的主要优势是速度极快——SVG代码生成比V4 Flash Vision Exp快6倍。前端代码生成能力较强,能够快速交付结构清晰、视觉层次合理的页面。但代码质量有时不够稳定,需要一轮迭代修正。在极大规模、极复杂的前端项目上仍有提升空间。

问:DeepSeek V4.1‑Flash的长文本能力怎么样?

答:DeepSeek V4.1‑Flash延续了100万Token的上下文窗口优势。但在长文本生成中仍存在一致性问题——长篇小说可能出现前后矛盾,数据报告中的关键数字可能不统一。长篇生成和数据报告能力仍需改进。

以上内容不代表本平台立场,仅供读者参考