文章摘要
DeepSeek首个原生多模态模型DeepSeek-V4-Flash-Vision-Exp(昵称焚诀)已以MIT协议开源,该模型采用混合专家架构,标称305B参数量,实际单次计算仅激活约13B参数,新增视觉模块支持图像理解。本文介绍了API调用及多种本地部署方案的硬件要求与适用场景,指出该模型部署的核心瓶颈为内存容量。

不少开发者在看到这款305B参数量的多模态模型时,第一反应都是“看的过瘾但玩不起”,但实际上通过合理的优化方案,本地部署并非完全不可能。

近期,DeepSeek推出的首个原生多模态模型DeepSeek-V4-Flash-Vision-Exp正式在开源平台开源,采用MIT开源协议,完整权重可供公开下载。这款模型采用混合专家(MoE)架构,内部包含256个路由专家与1个共享专家,每生成一个token仅会激活其中6个专家,实际参与单次计算的参数仅约13B,这意味着用户不需要具备305B参数量级的算力,但需要将完整模型权重加载到内存中。

和纯文本版的DeepSeek V4-Flash相比,这款多模态模型的核心差异在于新增了视觉编码器模块,这也是它支持图像理解能力的关键所在。

该模型的官方完整权重包分为48个文件,总大小约168GB,采用FP4与FP8混合精度存储,这是加载完整模型所需的基础内存容量。社区开发者Unsloth已经推出了该模型的GGUF量化版本,进一步降低了本地运行的门槛。

精度 占用大小
Q4_K_XL(4-bit,推荐) 155 GB
Q8_K_XL(8-bit) 162 GB

由于官方的专家参数本身采用FP4存储,4-bit量化后的模型大小和8-bit版本相差不大,其中Q4_K_XL版本仅需约155GB存储空间,这是个人用户本地运行该模型的基础门槛。


方案一:API调用,无需本地硬件

相较于需要高额硬件投入的本地部署,直接调用官方API是最经济实惠的选择,只要你的使用规模不是特别庞大,这种方式都能满足需求。目前官方开发者平台已经上线了deepseek-v4-flash-vision-exp的API服务,定价和纯文本版的DeepSeek-V4-Flash保持一致。

在经历过一轮调价后,虽然这款模型的性价比不如最初,但凭借高达95%以上的实际缓存命中率,整体使用成本依然可控。API的计费标准分为空闲时段和高峰时段:输入token单价为1.5元/百万到3元/百万,输出token单价为4.5元/百万到9元/百万,高峰时段定义为北京时间周一至周五的9:00-12:00和14:00-18:00。此外,也可以通过OpenRouter平台调用该API。每张图像将按照普通输入token计费,单张图像最多折算为384个输入token。


方案二:Ollama一键本地部署

社区开发者Unsloth推出的GGUF量化包,可以配合Ollama或者llama.cpp实现快速本地部署。使用Ollama的话,只需要执行一条命令即可完成启动:ollama run hf.co/unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF:UD-Q4_K_XL。

如果使用llama.cpp,则可以通过以下命令启动兼容OpenAI接口的本地服务:curl -LsSf https://llama.app/install.sh | sh,随后执行llama serve -hf unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF:UD-Q4_K_XL。

需要注意的是,Q4量化后的模型占用空间约155GB,加上运行时的KV缓存,系统可用内存至少需要170-180GB。符合这个配置的设备包括配备192GB以上内存的Mac Studio M3/M5 Ultra,或者搭载200GB以上系统内存的工作站级PC,普通笔记本和台式机通常无法满足这个要求。GitHub上也有社区开发者推出了基于MLX的原生部署方案,理论上对Apple Silicon设备的优化效果更好,但目前仅适配了纯文本版的DeepSeek-V4-Flash,尚未支持多模态版本。


方案三:单张英伟达显卡+工作站内存

该模型的本地部署思路和GLM-5.3-Flash类似,可以采用KTransformers工具实现:将专家权重放入系统内存由CPU计算,注意力计算则交由GPU处理。这种方式对GPU的要求相对友好,一张RTX 5090(32GB显存)或者RTX 4090(24GB显存)即可满足需求,但系统内存至少需要200GB,同时CPU需要支持AVX2指令集,如果带有AMX加速指令集则能进一步提升运行速度。

根据实测数据,RTX 5090的运行速度约为20+ tokens/s,RTX 4090则约为10-11 tokens/s。需要200GB系统内存的话,通常需要使用支持8条DDR5插槽的工作站级主板。需要注意的是,目前KTransformers的官方文档仅支持纯文本版的DeepSeek V4-Flash,尚未适配多模态版本。


方案四:多卡服务器部署

vLLM已经确认支持DeepSeek-V4-Flash-Vision-Exp模型,并且提供了专门的Docker镜像。如果使用4张H200显卡(单张显存141GB,总显存564GB)或者同等配置的多卡服务器,即可完整部署该模型。启动命令参考如下:docker run --gpus all vllm/vllm-openai:deepseekv4-flash-vision deepseek-ai/DeepSeek-V4-Flash-Vision-Exp --tensor-parallel-size 4 --kv-cache-dtype fp8 --block-size 256 --trust-remote-code。

此外还有一个中间选项,英伟达DGX Spark:单台设备的115GB显存不足以运行完整模型,但两台组网后可以运行4-bit量化版本,纯文本版的DeepSeek-V4-Flash在该平台上的实测速度可达25-41 tokens/s。


最后我们整理一下所有部署方案的对比信息:

部署方案 硬件要求 参考成本 运行速度 适用人群
API调用 仅需API密钥 4.5元/百万token 即时响应 所有用户
Ollama+GGUF ≥170GB系统内存 使用已有设备即可 取决于硬件配置 Mac Studio 192GB+或工作站用户
vLLM多卡服务器 4×H200或同等配置 8-16美元/小时 生产级性能 团队与企业用户
KTransformers RTX 5090+200GB内存 工作站硬件投入 20+ tokens/s PC开发者与爱好者

和GLM-5.3-Flash一样,这款模型本地部署的核心瓶颈依然是内存容量,足够的内存是顺利运行的关键前提。

以上内容不代表本平台立场,仅供读者参考