DeepSeek发布V4-Pro旗舰模型 性能提升并开源基准测试框架调价

近期,DeepSeek正式推出了其第四代旗舰模型的正式版本DeepSeek-V4-Pro-0813,同时同步发布了配套的开源智能体基准测试框架,并同步上调了全系列模型的API调用价格。
模型核心参数与基础信息
本次发布的DeepSeek-V4-Pro-0813具备以下核心特性:
· 输入输出能力:支持最长100万tokens的文本输入,单次文本输出上限为384000tokens,处理速度可达78.1tokens每秒。
· 架构设计:采用混合专家Transformer架构,总参数量达到1.6万亿,每个输入token仅激活490亿参数;可选的推测解码模块DSpark可将检查点参数量提升至1.7万亿。
· 功能特性:支持四级可调推理模式(无、低、高、最高),默认采用高推理模式;内置工具调用能力与上下文缓存机制。
· 性能表现:在第三方智能评测指数中得分53分,位列开源权重模型第三名;在Web开发领域的通用评测榜单中,从115个参评模型中跻身第10位。
· 可用性与定价:可通过官方应用与网站以Expert Mode体验,通过API调用时,高峰时段(UTC 01:00–04:00和06:00–10:00)的输入、缓存、输出tokens单价分别为$1.32、$0.044、$3.96,非高峰时段价格减半。
· 授权许可:模型权重采用MIT许可证,可免费用于商业与非商业场景。
· 未披露信息:官方未公布本次更新的训练数据细节、训练方法优化点以及模型的知识截止日期。
此外,团队还同步推出了开源智能体基准测试框架的开发者预览版,并调整了全模型产品线的API定价。
技术实现细节
DeepSeek-V4-Pro-0813保留了今年4月预览版的参数规模与核心架构,包括此前随预览版发布的推测解码模块DSpark。官方表示本次更新强化了模型的智能体能力,但未公开具体的优化细节。
具体的训练与优化流程如下:
· 首先使用超过32万亿tokens的数据集完成预览版的预训练,随后通过监督学习与强化学习,针对10个独立领域分别对10个模型副本进行微调;最后通过策略内蒸馏(on-policy distillation)将这10个专家模型合并为一个新的学生模型,由其模仿所有专家模型的输出逻辑。
· 模型采用交替式混合注意力机制,两类注意力层都会在处理输入时压缩存储的key与value向量,其中一类注意力还会仅关注筛选后的token子集。针对100万tokens的输入场景,该模型的计算量仅为DeepSeek-V3.2的27%,存储key和value所需的内存仅为后者的10%。
· 模型会在返回最终答案的同时输出完整的推理过程,当请求包含工具调用需求时,后续的API请求必须携带此前的推理轨迹,否则接口会拒绝调用,这一设计可以让推理过程在多次API调用之间持续保留。
· 新推出的DeepSeek Harness将模型、工具、技能、会话、沙箱、存储、循环调度与用户界面都封装为可配置、可替换的插件。框架会完整记录模型接收的所有输入,包括系统提示、推理过程、工具调用及其返回结果、子智能体调度逻辑与上下文注入内容,因此任何会话都可以被恢复、分叉、检索或回放。其最小模式仅为模型提供shell环境与文件编辑器,这也是团队用于编码智能体基准测试的标准配置。该框架基于名为Cordis的插件内核构建,DeepSeek与北京大学曾在学术论文中描述过该内核的设计细节。
· 该API接口兼容OpenAI Responses格式的请求,因此基于OpenAI Codex的编码智能体只需运行简单的配置脚本即可切换使用DeepSeek模型,大幅降低了迁移成本。
实测性能数据
第三方评测结果显示,DeepSeek-V4-Pro-0813相比4月的预览版有显著性能提升,但相较于同系列的轻量化Flash模型仅保持了微弱领先优势。该模型在开源权重模型的综合智能表现榜单中首次跻身前三,但在第三方智能评测指数中距离顶级闭源模型仍有约10分的差距。其最突出的改进体现在编码能力上。
该模型的单任务调用成本仍仅为多数顶级闭源模型的一小部分,但本次调价后,OpenAI的GPT-5.6 Luna的单位任务成本变得更具竞争力,其综合能力与该模型几乎持平。
具体的分项评测数据:
· 在由九项实用型任务组成的综合评测指数中,将推理模式设为最高时,DeepSeek-V4-Pro-0813得分为53分,单任务成本$0.25;相较于预览版同推理模式下的45分(单任务$0.05)提升了8分,同时比同系列的DeepSeek-V4-Flash-0731(52分,单任务$0.11)高出1分。该榜单中共有10个模型得分高于该版本,包括推理模式设为高的Gemini 3.7 Flash(57分,单任务$0.40)。该模型优于推理模式设为最高的GPT-5.6 Luna(52分,单任务$0.05),但GPT-5.6 Luna是少数单任务成本低于调价后的DeepSeek-V4-Pro或Flash模型的竞品。
· 在官方的内部测试中,采用最高推理模式与基准框架的最小配置,DeepSeek-V4-Pro-0813的最大性能提升来自编码智能体任务:在Terminal-Bench 2.1(命令行环境多步任务)上,准确率从72.1%提升至87.9%;在DeepSWE(复杂软件工程问题解决)上,准确率从12.8%提升至62.7%;在CyberGym(软件漏洞发现)上,准确率从52.7%提升至83.3%,小幅领先于带fallback机制的Claude Fable 5(83.1%)。
· 采用其他基准框架进行的独立评测显示,该模型在Terminal-Bench 2.1上的表现略低:使用团队自研评测框架的Vals AI测得得分为54.68,而采用开源Terminus 2框架的第三方平台测得准确率为78.7%。
行业动向补充
近期DeepSeek还推出了支持视觉能力的实验版DeepSeekV4-Flash,但官方暂未公布推出支持多模态能力的DeepSeekV4-Pro版本的具体计划。
开源基准框架的意义
目前公开自家模型基准测试框架的厂商并不多见。智能体的实际性能是模型本身与配套脚手架共同作用的结果,因此公开基准框架的核心价值在于,开发者不再只能依赖官方公布的评测数据,还可以自行复现测试结果。该基准框架同样采用MIT许可证,且与具体模型解耦,可适配其他厂商的模型进行测试。
行业观察与展望
当前智能体基准测试框架的市场正逐渐变得拥挤。尽管本次DeepSeek开源了其基准框架,但部分用户仍会保持谨慎态度——在安全专家完成对该框架的全面评估,以及基于其他厂商模型的基准测试数据公布之前,直接将其用于生产环境仍存在一定风险。我们期待能尽快看到更多第三方的权威测试结果,以及开发者基于该框架进行的实验与定制化修改。

