文章摘要
DeepSeek Harness是一款一切皆插件的Agent调度系统,虽处v0.1开发者预览版,但架构思路极具颠覆性。它本质是智能体框架,提供两种上手方式。有标准、PTC等四大工作模式。其架构将智能体拆解为插件组件,实测表现出色但也有问题。核心设计体现在四方面,不过V4 API将涨价。它有望成为Agent生态基础框架,值得关注。

DeepSeek Harness的发布,可能是今年AI Agent领域最具颠覆性的进展之一。尽管还处于v0.1的开发者预览版,但其架构思路已经展现出远超同类工具的野心。就在不久前的一个晚间,这款产品正式上线并开源,同步推出的还有新一代旗舰模型V4 Pro,两者结合带来的体验,彻底刷新了人们对AI智能体的认知。

很多人第一眼会把DeepSeek Harness当成又一个类似Claude Code的编码工具,但它的本质其实是一套智能体框架。按照官方的定义,智能体的核心是Model + Harness = Agent:模型负责推理思考,就像人的大脑;而Harness则是连接模型与真实世界的桥梁,负责对接文件系统、终端命令、浏览器等外部环境。简单来说,DSh(后文统一简称)不是一个单一的模型产品,而是一套可以让模型真正落地执行任务的外围系统。

如何快速上手DeepSeek Harness

想要体验这款工具,有两种简单的方式,覆盖了普通用户和开发者群体:

对于大多数普通用户来说,最便捷的方式是通过终端命令一键启动:只需要在命令行输入`npx @deepseek-ai/dsh web`,随后在浏览器中访问本地地址`http://127.0.0.1:3080`,输入对应的API密钥即可进入主界面。需要注意的是,与其他同类工具不同,DSh需要先配置模型密钥才能使用,主界面带有“探索未至之境”的标语,右上角标注了“预览版”的标识。

如果是有定制需求的开发者,则可以选择下载源码进行本地安装,根据自身需求进行个性化调整。

四大工作模式,适配不同使用场景

进入主界面后,首先需要选择工作目录和工作模式,官方预装了四种预设模式,对应不同的使用需求:

  1. 标准模式:功能最全面的编码智能体,支持文件编辑、终端命令、信息检索、技能调用、任务规划、子代理管理等全功能,对标Claude Code和Codex,也是大多数用户日常使用的默认模式。
  2. PTC模式:全称Programmatic Tool Calling,也就是程序化工具调用。这是四种模式中最特殊的一个,它将所有工具包装成TypeScript API,让模型可以一次性编写完整的程序来完成多步操作,中间数据直接在执行环境中处理,不会进入模型上下文,大幅节省Token成本。这种模式适合将智能体作为批处理工具的重度用户,以及需要自动化流程的开发者,普通用户基本用不到。
  3. 极简模式:仅提供持久Bash和文件替换编辑器两个工具。官方的设计思路是,足够强大的模型只需要基础的终端和文件操作能力,就能完成绝大多数编码任务,不需要复杂的脚手架。这种模式适合想要纯粹测试模型本体编码能力,不受Harness额外功能干扰的用户。
  4. 创造模式:用于创建自定义的智能体预设,具备标准模式的全部能力,同时提供运行时检查、插件实验和预设创作指导,可以理解为“制作模式的模式”,专门面向插件开发者和高级用户。

需要明确的是,切换不同的工作模式并不是切换模型的能力,而是调整智能体可以使用的工具集合和运行规则,针对不同的场景选择最合适的配置即可。

核心理念:一切皆插件的底层革命

很多人初次体验DSh的时候,会觉得它的界面和操作逻辑和其他同类工具没有太大区别:左侧是会话历史,中间是对话窗口,需要选择工作目录和模式。但这只是产品外壳的暂时表现,其背后的架构思路才是真正的颠覆性所在。

官方反复强调的“Everything is a Plugin(一切皆插件)”,并不是简单地给智能体安装额外的工具插件,而是将整个智能体拆解为可自由组合、替换的插件组件。也就是说,DSh本身就是由各种插件拼接而成的,而不是一个固定的产品。

举个简单的例子,如果你觉得默认的Agent Loop逻辑不符合你的需求,可以直接替换;如果不想使用官方默认的模型接口,可以更换模型适配器插件;甚至连模型适配器本身都是可配置的插件,这意味着DSh在设计上并不绑定DeepSeek自家的模型。如果你希望将任务提交到远程沙箱而非本地终端,只需要更换文件系统和子进程的提供插件即可;如果你想要自定义会话的持久化、分支和恢复逻辑,也可以直接替换对应的组件。

更灵活的是,DSh还暴露了完整的生命周期节点作为扩展点,包括agent/pre-step、agent/request、tools/pre-execute、tools/execute、tools/post-execute、agent/turn-stopping等,你可以在不修改核心Agent Loop的情况下,插入自定义的审查逻辑或其他处理流程。

这意味着DSh的架构逻辑完全不同于其他同类工具:Codex和Claude Code本质上是先做好一个固定的Agent产品,再允许用户添加额外的插件扩展;而DSh则是先提供一套可组装的框架,再由用户通过插件组合出具体的智能体。

社区已经开始基于这套架构进行创新,比如开源的皮肤合集,只需要通过命令就能安装切换,不会影响核心的会话、模型和工具功能,用户可以根据自己的喜好定制界面外观。

实测体验:颠覆认知的智能体表现

为了验证DSh的真实能力,作者进行了多轮测试,其中几个案例带来的冲击远超预期。

首先尝试了一个创作类任务:要求生成一篇10万字的小说,设定为宗门废柴弟子在杂役房扫地十年,扫出上古大能道场,掌门跪求出关却被拒绝的故事。作者选择了创造模式进行测试,模型并没有直接开始写作,而是先补全了提示词,将简单的需求拆解为完整的项目流程:先设计世界观、人物关系和章节大纲,再拆分为40章,每章约2500字,完成所有章节后统一合并,检查字数、人物一致性和AI生成痕迹。

更令人惊讶的是,模型直接启动了40个子Agent,每个子Agent负责撰写一个章节,并且全部并发运行。主界面的标题栏显示了“40个子代理”的按钮,点击后可以看到完整的任务列表,每一项都标注了对应的Token消耗和运行时长,还可以进入详情页查看当前计划、执行步骤和上下文使用情况。主界面底部还有实时状态栏,展示系统整体的运行状态,信息密度远超同类工具的前端展示。

值得注意的是,尽管V4 Pro本身并不擅长主动汇报进度,但DSh通过前端界面将整个执行过程完全透明化,让用户可以清晰看到每个子Agent的工作状态,不需要依赖模型主动输出信息。

小说完成后,作者通读了全文,发现整体主线连贯,核心人物形象立得住,40个章节并没有变成各自独立的片段,说明DSh在管理全局大纲、核心设定和主线目标时,记忆控制能力非常出色。但在阅读到二三十章后,也发现了一些细节偏差,比如同一规则在前后章节的设定不一致,存在一定的拼接感,说明其在局部细节的连续性把控上还有提升空间。

除了创作任务,作者还测试了多人FPS游戏开发任务,同样使用V4 Pro模型,结果显示完成度比之前在同类工具中的测试结果要高很多,甚至可以完成基础的BOSS击杀流程,尽管还达不到商业游戏的水准,但进步非常明显。这也修正了作者之前对V4 Pro的评价:并非模型本身能力不足,而是之前的工具没有完全发挥出其潜力。

不过,当前的预览版也存在不少问题:比如在测试股票策略回测任务时,虽然成功生成了报告和图表,但界面上的“点击查看”按钮无法正常打开图片,属于前端界面的细节bug;另外,Harness的工作链几乎全为英文,包括Think、Read、Bash、Tool Call等提示,对于中文用户来说长期使用会有一定的阅读负担。

核心设计细节,重新定义Agent的底层逻辑

同样的V4 Pro模型,在DSh中的表现远超同类工具,背后的核心设计思路才是关键,主要体现在四个方面:

一切皆插件的架构思路

正如前文所述,DSh的核心是将所有智能体组件拆分为可替换的插件,包括模型适配器、工具注册表、会话日志、Agent Loop本身等,都可以通过配置进行替换。这种设计彻底打破了传统智能体产品的固化逻辑,让用户可以根据自身需求定制完整的智能体架构。

对比来看,Codex的核心逻辑是固定的,用户只能在现有基础上添加MCP、Skills等扩展,无法修改核心的Agent Loop和会话管理机制;Claude Code虽然开放度更高,但也只是提供了插件扩展能力,其核心架构依然是固定的。而DSh则是先提供框架,再由插件组成具体的智能体,这是二者最本质的区别。

工具归一化的高效设计

传统的智能体在调用工具时,每调用一次工具就需要一次完整的模型往返,比如查询十个文件就需要十个来回,并且每次的原始数据都需要放入上下文,既浪费Token又增加延迟。而DSh的设计非常巧妙:它只向模型提供一个名为run_code的工具,将所有可用的工具自动打包为一套TypeScript SDK,让模型可以一次性编写完整的程序来完成多步操作,所有中间数据都在执行环境中处理,不会进入模型上下文,大幅减少了Token消耗和往返次数,同时依然保留了权限、审计和超时控制等安全机制。

事件可溯源的会话管理

DSh将会话设计为追加式的事件日志,模型的输出、用户的取消操作、子Agent的创建和销毁等每一个步骤都被完整记录,并且支持重放。这种设计带来了两个核心优势:一是即使Code Mode模式返回的内容出现问题,系统也可以通过事件日志恢复状态;二是支持跨会话引用,用户可以直接复用之前的会话结果,解决了同类工具中模型过度依赖旧会话结论的问题。

Agent统帅的调度能力

DSh内置了官方Codex和Claude Code的子Agent后端,并非只是兼容配置格式,而是可以直接拉起本地安装的官方工具,将独立任务提交给它们执行,只获取最终的结果。这意味着DSh的定位不仅仅是一个智能体工具,更是一个Agent调度操作系统,可以将用户手中已有的各种智能体工具作为执行单元,实现真正的跨工具调度。

不得不提的坏消息:V4 API涨价

在体验完DSh的优秀表现后,还有一个需要提醒的重要变化:从8月17日00:00起,V4系列模型的API将执行新的定价规则,并且区分高峰和空闲时段。高峰时段为北京时间9:00-12:00和14:00-18:00,其余时间为空闲时段。

具体的涨价幅度为:缓存命中的输入Token费用上涨150%至1100%,未命中输入Token费用上涨50%至200%,输出Token费用上涨125%至350%。此前“便宜到敢让模型随便试错”的心态,在8月17日之后需要重新计算成本了。

未来展望:Agent世界的Linux?

官方的架构文档中提到,一个运行中的DSh其实就是一棵“plugin tree”:最基础的dsh-base包含模型适配器、工具、持久化、沙箱、审批策略等核心组件;如果需要Web界面,可以叠加dsh-web-app;如果只需要运行一次任务,则可以使用dsh-headless。

如果用一个形象的比喻来区分,Codex和Claude Code更像是已经预装好了软件的Mac电脑,用户只能在现有基础上安装额外的软件和插件;而DSh则更像是一台可以自由更换主板、显卡、操作系统和外壳的PC,用户可以根据自身需求定制完整的硬件和软件架构。

此前大家在讨论智能体插件时,更多的是思考“我能给现有的智能体增加什么能力”,比如添加浏览器、数据库等工具;而DSh的出现,则让社区开始思考“我能不能直接替换智能体的某个核心组件”,比如替换上下文压缩模块、专门的代码Agent Loop、浏览器Agent Loop、激进的子Agent调度器、企业级审批和沙箱等。

DSh目前还处于开发者预览版,官方也提到未来会有 breaking changes,但它真正的价值不在于当前版本的功能完整性,而在于开启了Agent生态的下一个层次。如果这套架构能够发展壮大,未来的智能体将不再是单一的产品,而是由社区自由组合的个性化组件集合,就像Linux操作系统一样,成为整个Agent生态的基础框架。

尽管还处于早期阶段,但DeepSeek Harness已经展现出了改变整个AI Agent领域的潜力,值得所有关注智能体技术的用户持续关注。

以上内容不代表本平台立场,仅供读者参考