DeepSeek V4系列更新、Harness框架发布及价格调整

近期,DeepSeek正式推出了更新于8月13日的V4 Pro正式版,此次升级重点围绕Agent能力展开,目前网页、API、APP端均已开放使用。同时,全新的DeepSeek Harness也同步亮相,笔者第一时间对这两款产品进行了实测,其中DeepSeek Harness带来的体验远超预期,是本次更新中最亮眼的部分。
先来看V4 Pro的性能表现:官方公开的跑分数据显示,其整体性能提升并未如V4 Flash版本那般惊艳,但在网络安全能力测试项Cybergym中,V4 Pro实现了对Fable5的超越。
此次更新同时带来了API价格调整,计费标准按每百万Tokens计算,调价分为空闲时段和高峰时段:高峰时段为每日9:00-12:00、14:00-18:00,其余时段均为空闲时段,调价将于2026年8月17日0点正式生效。以下是两款模型的调价详情:
| 模型 | 计费项目 | 涨价前 | 涨价后·空闲时段 | 涨价后·高峰时段 | 高峰时段涨幅 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | 输入(缓存命中) | ¥0.02 | ¥0.05 | ¥0.10 | +400% |
| 输入(缓存未命中) | ¥1 | ¥1.50 | ¥3 | +200% | |
| 输出 | ¥2 | ¥4.50 | ¥9 | +350% | |
| DeepSeek-V4-Pro | 输入(缓存命中) | ¥0.025 | ¥0.15 | ¥0.30 | +1100% |
| 输入(缓存未命中) | ¥3 | ¥4.50 | ¥9 | +200% | |
| 输出 | ¥6 | ¥13.50 | ¥27 | +350% |
笔者使用经典的火星登陆模拟任务进行了实测,要求使用HTML和Three.js实现符合物理规则的逼真模拟过程,统一使用Max档位进行测试。测试结果显示,Kimi K3的表现最为出色,整体耗时约1.5小时。而此次更新的V4 Pro 0813版本耗时约30分钟,但最终效果却不如更早的V4 Flash 0731版本(耗时约20分钟),这一结果有些超出预期。不过单次测试样本量有限,V4 Pro 0813的实际表现还需要更多生产环境下的验证。
接下来重点介绍本次更新的核心亮点——DeepSeek Harness。目前该框架的v0.1版本处于开发者预览阶段,已面向全球开发者开放,并以MIT开源协议开放代码库。
DeepSeek Harness基于Cordis元框架打造,核心设计理念是“一切皆插件”,无论是模型、工具、技能、对话流程、沙箱环境、文件系统还是编排逻辑与UI界面,都可以作为独立插件进行自由组合、替换与扩展。
开发者可通过以下地址试用该框架:https://github.com/deepseek-ai/deepseek-harness
笔者使用DeepSeek Harness重新进行了火星登陆模拟测试,本次使用的是官方官宣后的全新API密钥,确认为正式版V4 Pro。测试过程中发现了非常有趣的特性:当Agent执行任务时如果缺少某项能力,可以自动识别缺失的功能,并自主完成开发、安装与调用,这一特性与其核心设计高度契合,仿佛具备了初步的自我进化能力。
此外,DeepSeek Harness还提供了轨迹模式,可以完整展示Agent的工作全流程:包括具体的思考步骤、工具调用记录、工具返回结果等都清晰可见,并且会通过不同颜色区分各类内容——例如橙色代表工具调用,绿色代表上下文信息,整体展示形式类似操作轨迹条悬浮在界面顶部。在对话界面下方,还可以实时查看工具调用情况、缓存命中状态、Token处理速度以及输入输出Token数量等数据。
本次测试最终耗时约1.5小时,最终结果中物理过程的实现存在一定瑕疵,但整体设计与审美表现仍在线,考虑到这只是0.1版本的早期体验,已经具备了不错的潜力。
DeepSeek同步发布了一篇关于DeepSeek Harness设计的80页学术论文,相关内容值得深入研究,论文地址为:https://github.com/cordiverse/paper/blob/main/paper.pdf
整体来看,DeepSeek对DeepSeek Harness的投入力度极大,其定位远超普通的Agent框架,更像是AI时代的操作系统雏形,自我进化与开源特性是其核心亮点。

