文章摘要
近期,全新实验性多模态视觉模型deepseek-v4-flash-vision-exp上线,补齐此前仅支持文本处理的短板。它支持四种主流图片格式,单次最多可处理600张图片。其多模态Agent能力逼近行业顶尖,调用价格与原版V4Flash一致。目前开发者可通过API调用该模型,同系列多模态布局补齐关键一环。

近期,一款全新的实验性多模态视觉模型正式上线,基于V4 Flash打造的这款模型补齐了此前仅支持文本处理的短板,能够直接理解图片内容,完成从纯文本交互到视觉交互的能力升级。

这款模型的官方名称为deepseek-v4-flash-vision-exp,从命名后缀来看,vision-exp说明它目前仍处于实验阶段。它支持JPEG、PNG、GIF和WebP四种主流图片格式,开发者可以通过Base64编码图片、提供公开访问的图片URL,或者通过Files API上传并引用图片的方式接入视觉内容。

值得一提的是,这款模型兼容OpenAI Chat Completions、Responses API与Anthropic API格式,现有Agent和开发工具不需要重新设计整套接口,仅需要修改模型名称和图片内容块,就能快速接入这款视觉能力。

单次可处理最多600张图片

这款模型的输入能力远超普通的看图问答场景,官方文档显示,单次请求最多可以输入600张图片,图片最长边最高支持8192像素。

  • Base64或外部URL方式上传的单张图片最大为32 MiB
  • 通过Files API上传的单张图片最大为64 MiB
  • 当请求包含file_id的图片时,单次请求的图片总量最高为200 MiB

模型还提供三种不同的图片细节等级选项:low模式会将图片自动缩放至512×512,速度更快且Token消耗更低;original模式保留原图完整细节;auto模式当前等同于原图模式。每张图片在进入模型前会按尺寸换算为Token,单张图片的Token消耗最高为384,这意味着即使输入超高分辨率的图片,整体成本也不会无限增长,非常适合批量截图分析、长文档检查、数据图表理解,以及需要持续观察界面的视觉Agent场景。

多模态Agent能力逼近行业顶尖水平

据官方公布的测试数据,这款新模型在多项Agent Benchmark测试中的表现相比原版V4 Flash有了显著提升,其多模态Agent能力已经接近Claude Opus 4.8。不过该对比数据目前尚未出现在官方公开的模型文档中,仍需要等待更完整的技术说明和第三方独立测试来验证。

真正值得关注的并非单一的测试分数,而是这款模型将视觉理解能力与原有的推理、编程、工具调用能力进行了有机结合。此前的同系列Agent主要依靠文本、网页源码和结构化数据来理解运行环境,现在它可以直接读取软件界面、错误截图、数据图表和图文混排文档,再自主决定下一步需要调用的工具。

定价与原版V4 Flash保持一致

这款视觉模型的调用价格与V4 Flash完全相同,采用高峰、空闲两档计费模式。高峰时段为北京时间9:00—12:00、14:00—18:00,其余时间均为空闲时段。

图片会按照尺寸转换为Token,与文本Token一并计入计费。该模型的并发限制为2500,同样与V4 Flash保持一致。如果后续正式版本继续维持这一定价策略,将会再次大幅压低多模态Agent的使用门槛。

当前已可通过API调用

目前开发者已经可以通过官方API访问这款全新的视觉模型,原有API基础地址保持不变,仅需要将调用的模型名称修改为deepseek-v4-flash-vision-exp即可。

如果使用DeepSeek Harness进行开发,则需要将工具升级至0.1.1-rc.1或更高版本。

需要注意的是,模型名称中的exp后缀代表它仍处于实验阶段,后续可能会调整能力表现、接口限制和模型版本。目前只有这款视觉模型支持图片输入,向普通的V4 Flash或V4 Pro模型传递图片会直接返回错误。此外,视觉版暂不支持FIM补全功能,图片在Chat Completions与Anthropic Messages接口中只能出现在user消息里。

从V4 Flash到V4 Pro,再到今天的视觉版模型,同系列的产品结构正在变得更加完整:Flash主打速度和低成本,Pro面向复杂推理与高规格Agent场景,Vision则负责图像、截图与界面理解,相关的多模态布局终于补齐了关键一环。

以上内容不代表本平台立场,仅供读者参考