DeepSeek V4 Vision多模态发布,补齐视觉能力拼图

近期,一款全新的实验性多模态视觉模型正式上线,基于V4 Flash打造的这款模型补齐了此前仅支持文本处理的短板,能够直接理解图片内容,完成从纯文本交互到视觉交互的能力升级。
这款模型的官方名称为deepseek-v4-flash-vision-exp,从命名后缀来看,vision-exp说明它目前仍处于实验阶段。它支持JPEG、PNG、GIF和WebP四种主流图片格式,开发者可以通过Base64编码图片、提供公开访问的图片URL,或者通过Files API上传并引用图片的方式接入视觉内容。
值得一提的是,这款模型兼容OpenAI Chat Completions、Responses API与Anthropic API格式,现有Agent和开发工具不需要重新设计整套接口,仅需要修改模型名称和图片内容块,就能快速接入这款视觉能力。
单次可处理最多600张图片
这款模型的输入能力远超普通的看图问答场景,官方文档显示,单次请求最多可以输入600张图片,图片最长边最高支持8192像素。
- Base64或外部URL方式上传的单张图片最大为32 MiB
- 通过Files API上传的单张图片最大为64 MiB
- 当请求包含file_id的图片时,单次请求的图片总量最高为200 MiB
模型还提供三种不同的图片细节等级选项:low模式会将图片自动缩放至512×512,速度更快且Token消耗更低;original模式保留原图完整细节;auto模式当前等同于原图模式。每张图片在进入模型前会按尺寸换算为Token,单张图片的Token消耗最高为384,这意味着即使输入超高分辨率的图片,整体成本也不会无限增长,非常适合批量截图分析、长文档检查、数据图表理解,以及需要持续观察界面的视觉Agent场景。
多模态Agent能力逼近行业顶尖水平
据官方公布的测试数据,这款新模型在多项Agent Benchmark测试中的表现相比原版V4 Flash有了显著提升,其多模态Agent能力已经接近Claude Opus 4.8。不过该对比数据目前尚未出现在官方公开的模型文档中,仍需要等待更完整的技术说明和第三方独立测试来验证。
真正值得关注的并非单一的测试分数,而是这款模型将视觉理解能力与原有的推理、编程、工具调用能力进行了有机结合。此前的同系列Agent主要依靠文本、网页源码和结构化数据来理解运行环境,现在它可以直接读取软件界面、错误截图、数据图表和图文混排文档,再自主决定下一步需要调用的工具。
定价与原版V4 Flash保持一致
这款视觉模型的调用价格与V4 Flash完全相同,采用高峰、空闲两档计费模式。高峰时段为北京时间9:00—12:00、14:00—18:00,其余时间均为空闲时段。
图片会按照尺寸转换为Token,与文本Token一并计入计费。该模型的并发限制为2500,同样与V4 Flash保持一致。如果后续正式版本继续维持这一定价策略,将会再次大幅压低多模态Agent的使用门槛。
当前已可通过API调用
目前开发者已经可以通过官方API访问这款全新的视觉模型,原有API基础地址保持不变,仅需要将调用的模型名称修改为deepseek-v4-flash-vision-exp即可。
如果使用DeepSeek Harness进行开发,则需要将工具升级至0.1.1-rc.1或更高版本。
需要注意的是,模型名称中的exp后缀代表它仍处于实验阶段,后续可能会调整能力表现、接口限制和模型版本。目前只有这款视觉模型支持图片输入,向普通的V4 Flash或V4 Pro模型传递图片会直接返回错误。此外,视觉版暂不支持FIM补全功能,图片在Chat Completions与Anthropic Messages接口中只能出现在user消息里。
从V4 Flash到V4 Pro,再到今天的视觉版模型,同系列的产品结构正在变得更加完整:Flash主打速度和低成本,Pro面向复杂推理与高规格Agent场景,Vision则负责图像、截图与界面理解,相关的多模态布局终于补齐了关键一环。

