文章摘要
近期,DeepSeek推出8月13日更新的V4 Pro正式版,围绕Agent能力升级,网页、API、APP端均已开放。同时亮相全新DeepSeek Harness框架,v0.1版本处于开发者预览阶段,以MIT开源协议开放代码库。还公布API价格调整,2026年8月17日生效。实测显示,V4 Pro和Harness各有表现,后者潜力较大,官方还发布相关学术论文。

近期,DeepSeek正式推出了更新于8月13日的V4 Pro正式版,此次升级重点围绕Agent能力展开,目前网页、API、APP端均已开放使用。同时,全新的DeepSeek Harness也同步亮相,笔者第一时间对这两款产品进行了实测,其中DeepSeek Harness带来的体验远超预期,是本次更新中最亮眼的部分。

先来看V4 Pro的性能表现:官方公开的跑分数据显示,其整体性能提升并未如V4 Flash版本那般惊艳,但在网络安全能力测试项Cybergym中,V4 Pro实现了对Fable5的超越。

此次更新同时带来了API价格调整,计费标准按每百万Tokens计算,调价分为空闲时段和高峰时段:高峰时段为每日9:00-12:00、14:00-18:00,其余时段均为空闲时段,调价将于2026年8月17日0点正式生效。以下是两款模型的调价详情:

模型 计费项目 涨价前 涨价后·空闲时段 涨价后·高峰时段 高峰时段涨幅
DeepSeek-V4-Flash 输入(缓存命中) ¥0.02 ¥0.05 ¥0.10 +400%
输入(缓存未命中) ¥1 ¥1.50 ¥3 +200%
输出 ¥2 ¥4.50 ¥9 +350%
DeepSeek-V4-Pro 输入(缓存命中) ¥0.025 ¥0.15 ¥0.30 +1100%
输入(缓存未命中) ¥3 ¥4.50 ¥9 +200%
输出 ¥6 ¥13.50 ¥27 +350%

笔者使用经典的火星登陆模拟任务进行了实测,要求使用HTML和Three.js实现符合物理规则的逼真模拟过程,统一使用Max档位进行测试。测试结果显示,Kimi K3的表现最为出色,整体耗时约1.5小时。而此次更新的V4 Pro 0813版本耗时约30分钟,但最终效果却不如更早的V4 Flash 0731版本(耗时约20分钟),这一结果有些超出预期。不过单次测试样本量有限,V4 Pro 0813的实际表现还需要更多生产环境下的验证。

接下来重点介绍本次更新的核心亮点——DeepSeek Harness。目前该框架的v0.1版本处于开发者预览阶段,已面向全球开发者开放,并以MIT开源协议开放代码库。

DeepSeek Harness基于Cordis元框架打造,核心设计理念是“一切皆插件”,无论是模型、工具、技能、对话流程、沙箱环境、文件系统还是编排逻辑与UI界面,都可以作为独立插件进行自由组合、替换与扩展。

开发者可通过以下地址试用该框架:https://github.com/deepseek-ai/deepseek-harness

笔者使用DeepSeek Harness重新进行了火星登陆模拟测试,本次使用的是官方官宣后的全新API密钥,确认为正式版V4 Pro。测试过程中发现了非常有趣的特性:当Agent执行任务时如果缺少某项能力,可以自动识别缺失的功能,并自主完成开发、安装与调用,这一特性与其核心设计高度契合,仿佛具备了初步的自我进化能力。

此外,DeepSeek Harness还提供了轨迹模式,可以完整展示Agent的工作全流程:包括具体的思考步骤、工具调用记录、工具返回结果等都清晰可见,并且会通过不同颜色区分各类内容——例如橙色代表工具调用,绿色代表上下文信息,整体展示形式类似操作轨迹条悬浮在界面顶部。在对话界面下方,还可以实时查看工具调用情况、缓存命中状态、Token处理速度以及输入输出Token数量等数据。

本次测试最终耗时约1.5小时,最终结果中物理过程的实现存在一定瑕疵,但整体设计与审美表现仍在线,考虑到这只是0.1版本的早期体验,已经具备了不错的潜力。

DeepSeek同步发布了一篇关于DeepSeek Harness设计的80页学术论文,相关内容值得深入研究,论文地址为:https://github.com/cordiverse/paper/blob/main/paper.pdf

整体来看,DeepSeek对DeepSeek Harness的投入力度极大,其定位远超普通的Agent框架,更像是AI时代的操作系统雏形,自我进化与开源特性是其核心亮点。

以上内容不代表本平台立场,仅供读者参考