Agent时代的安卓:DeepSeek Harness开源自进化框架

DeepSeek Harness这款工具终于正式发布,并且同步开源了完整源代码。作为提前参与内测近半个月的用户,现在终于可以和大家分享这款产品的完整体验了。内测期间,为了充分验证这款工具的实用性,我已经将自己所有的Vibe Coding开发项目从Codex迁移到了黑鲸——也就是这款工具的黑标版本。
经过这段时间的深度体验,并且仔细研读了官方仓库的全部文档后,我最深的感触是:这完全是一套为「自主进化」和「自定义改造」而生的开发工具。内测社区里已经有不少开发者对其进行了个性化改造,实现了丰富的扩展功能。
事实上,DSH的所有组成部分——包括模型调用、工具链、运行策略、存储系统、上下文管理等——都采用了可插拔的模块化设计。这意味着你可以完全自主地对系统进行改造,或者针对特定的业务场景定制专属的运行环境。目前官方已经内置了超过一百个插件,后续社区也会贡献更多的扩展模块。
Agent时代的开放生态,已经到来。
在深入讲解底层技术架构之前,我们先聊聊这款产品的实际使用体验。
官方提供了两种快速部署方式:如果你已经搭建好了Node.js开发环境,可以直接通过npx命令一键启动Web界面:
npx @deepseek-ai/dsh web
如果需要完整的源码定制,可以克隆官方仓库后按照文档完成安装:
git clone https://github.com/deepseek-ai/deepseek-harness
当然你也可以直接将仓库链接交给AI助手,让它帮你完成全套部署流程。不过目前官方还没有推出Electron客户端,启动服务后需要通过浏览器访问Web UI来使用。
首次登录页面时,系统会提示你填入大模型的API密钥,你可以选择使用官方平台的服务,也可以接入其他第三方模型。不过平台方表示,相关API将在近期大幅调整计费标准,尤其是缓存相关的调用费用。
登录完成后就能进入黑鲸的主界面,整体风格和官方的网页版大模型界面相似,但对话列表被替换为本地项目管理面板。
和主流的Agent工具相比,DSH的使用流程有一些独特的设计。在开启新会话前,你需要先选择工作目录,同时还可以选择官方预设的Agent运行模式,目前官方提供了四类预设方案:
- 标准模式:功能完整的编码Agent,涵盖文件编辑、Shell命令执行、文件与网页检索、技能调用、计划模式、目标追踪、子代理和工作流等全套能力
- PTC模式:在标准模式的基础上,额外开放了Code Mode SDK,允许模型通过编写TypeScript代码来组合多步操作流程
- 极简模式:仅保留bash和str_replace_editor两个基础工具,适合用于基准测试和最小化场景复现
- 创造模式:则在标准模式的基础上,增加了运行时检查、插件实验和预设创作指导功能,方便开发者自定义专属的Agent预设
除此之外,平台也支持用户自行创建自定义的Agent预设。
这也是DSH最吸引极客开发者的地方:它完全围绕开发者的自定义需求设计,很多核心功能都遵循了模块化的第一性原理。
比如其中的「轨迹」监控功能。在传统的Agent交互中,随着会话时长增加、工具调用复杂度提升,对话历史会逐渐变成难以追溯的黑盒,你很难清晰了解模型在后台到底执行了哪些操作。而DSH的轨迹功能提供了完整的会话回放窗口,和经过润色的对话视图不同,它可以直接展示原始的事件级执行记录,你可以随时暂停、回放整个会话流程,清晰查看模型在每个环节的具体操作,也能直观定位任务出错的位置,统计每个步骤的资源消耗情况。
官方仓库中还内置了多款专为开发场景设计的技能工具,比如:
- dsh-code-review:用于代码PR审查,按照仓库规范检查代码中不易发现的问题
- dsh-find-simplifications:自动识别代码中可以优化简化的部分,并将优化思路整理为Agent笔记
- dsh-doc-standards:用于编写和审核文档,规范文档层级、区分教程和参考内容,去除冗余的文档话术
- dsh-prose-standard:负责全仓库的文字质量把控,涵盖Markdown、JSDoc、代码注释、提示词、CLI/UI文案等各类文本的格式和内容规范
- ……
不过作为非重度开发者,我日常使用这些专业工具的场景并不多,但在多轮交互中,我发现了一个非常贴心的细节设计:即便是没有开启计划模式,当用户的指令不够明确时,黑鲸也会主动发起提问来澄清需求,而不是直接执行模糊的任务。
和Codex不同,黑鲸会主动引导用户补充信息,同时提供多个可选的执行方向,这能帮用户节省大量的思考成本。当然你也可以跳过预设选项,直接通过语音输入补充更多上下文信息。
除此之外,DSH的使用逻辑和Codex并没有太大区别。你可以通过输入「/」来快速调用上下文压缩、目标设置、计划模式等功能,也可以直接调用内置的各类技能工具,任务清单管理功能也已经集成在界面中。
不过目前产品还有一些细节有待完善,比如经典Agent界面的右侧侧边栏功能尚未完成,使用起来还是有些不便。相比之下,Codex已经内置了浏览器、文件管理、内容预览等功能,甚至支持在对话中直接播放视频,在UI和交互细节上还有不小的优化空间,相信后续的版本更新会逐步完善这些体验。
黑鲸支持上传图片作为对话附件,但基础的V4模型不具备视觉理解能力,需要搭配多模态大模型才能使用该功能。
最后我们聊聊Token消耗的管理。平台还在界面底部集成了Token消耗统计面板,你可以随时查看当前会话的Token使用量和缓存命中率,避免因为调用次数过多导致费用超支。在实际使用中,缓存命中率大多维持在99%左右,部分场景甚至能达到100%,当然也有少数情况会降到60%-70%。不过内测期间平台的计费非常优惠,我几乎没有关注过这个统计面板。
接下来我们通过实际测试来看看黑鲸的实际表现。我使用V4 Flash模型分别在Codex和DSH中运行了多个测试Demo,所有测试的模型参数和推理强度都保持一致。
第一个测试是经典的鹈鹕自行车生成,两者的表现差距不大,甚至Codex的视觉审美效果更好。但在猪八戒3D白模的测试中,结果差异非常明显:同样只输入了一句简单的「生成猪八戒3D白模」,没有额外的提示词,Codex生成的结果完全不像一个生物,甚至有些诡异。而DSH驱动的模型则完成度更高。
我个人认为,这是因为在DSH的加持下,模型的长程任务执行能力得到了显著提升。以猪八戒测试为例,DSH驱动的模型连续运行了20分钟才完成任务,而Codex仅用了6分钟就结束了流程,且几乎没有返工,甚至一开始还误以为需要生成图片,向我索要GPT-Image-2的API密钥。社区用户的反馈也印证了这一点,有开发者表示自己最长的会话运行了10小时。
我的实际体验也类似,只要用自然语言清晰描述需求,几乎不需要额外编写复杂的提示词,模型就能独立完成完整的开发任务,很少交付半成品。比如我曾让它开发第一人称射击游戏,没有提供任何额外的提示词,模型就自主实现了下蹲、换弹、瞄准、NPC交互等全套功能。我也建议大家不要让AI先生成提示词再执行任务,直接通过语音或自然语言描述需求即可,过于详细的预设反而会限制模型的发挥。
这里还有一个黑鲸自主生成的「思考」动图,大家可以直接用作表情包素材。
那么,在使用官方API的情况下,应该选择DSH还是Codex?结论非常明确:自家的大模型优先搭配官方的Harness工具,这也是DeepSeek推出这款产品的核心目的之一。
实测的部分就先到这里,我们主要聊了产品设计上的细节。至于大模型本身的能力,市面上已经有太多相关的演示案例,这里就不再赘述。接下来我们聊聊这款工具背后的技术架构。
打开官方仓库的README,你会发现一个反复出现的关键词——Cordis。简单来说,Cordis就像是乐高积木的底板,开发者可以在这个基础底板上拼接各种独立的功能模块。在设计DSH的Agent框架时,团队将整个系统拆解为一个个可独立运行的插件,每个插件各司其职,这样可以最大程度避免重复造轮子。
如果开发者有定制化的需求,只需要按照规范编写新的插件,就可以直接接入系统;如果对现有插件不满意,也可以随时替换或移除。这种设计思路是非常典型的AI-Native架构。要知道,传统的Skill更多属于Prompt Engineering的范畴,而Cordis插件系统则允许用户完全自定义整个Agent的运行时环境。正如官方架构文档中所说:「它采用了一切皆插件的架构。」
这种设计和主流的Agent框架有很大的不同。以Codex的Harness为例,虽然它也开源了,但整体架构更接近闭源的系统:核心部分使用Rust编写,通过「外部挂件」的方式提供扩展能力,各类工具、钩子、技能都挂载在核心之外,用户无法随意修改核心代码。这种架构的优势也很明显:Rust可以直接控制内存和并发,性能比插件化框架的抽象层更高;一体化的封装也让整体的可控性更强。但缺点同样突出:系统的封闭性较强,社区开发者很难深度参与定制。
而DSH更像是Agent时代的开放系统:它以Cordis为核心,打造了一套完全开放的生态。官方仓库的文档文件夹中提供了从零开始构建插件并接入官方Harness的完整教程,甚至还内置了一个用于修改Cordis的专属技能。
这意味着任何用户在遇到问题或需要新功能时,都可以自行开发并开源插件,其他用户遇到类似需求时,也可以直接安装社区分享的插件,就像在《我的世界》中安装模组一样。比如之前提到的侧边栏功能,社区中就有开发者已经完成了相关插件的开发。目前官方已经内置了100多个插件,同时也预留了官方插件商店的位置。
官方团队也呼吁全球开发者加入DSH的插件生态:
我们期待与全球开发者一起,在开源、开放、可复用、可组合的基础设施之上,共同探索智能上限。欢迎全球Harness开发者加入DSH插件生态。
我认为DeepSeek正在布局一套长远的生态战略。自从相关行业博客发布了关于AI自主进化的内容之后,行业内一直在讨论AI的自主进化,但始终缺乏清晰的落地路径。而DSH的这套架构,是目前我见过的最具可行性的实现方案:普通用户也可以参与到AI的自进化过程中。
在Cordis协议的支持下,模型可以在不中断当前任务的前提下,自主编写插件并安装到系统中。结合庞大的用户生态,我们可以想象这样的场景:从成百上千万的Agent实例中筛选出经过优化的优质插件,再将这些插件整合到主线版本中,整个系统的能力将实现快速迭代和提升。
不过,也有用户会问:这套Cordis架构对普通用户的体验到底有什么实际帮助?根据社区的反馈,目前来说对普通用户的直接帮助并不大,毕竟这是一个依赖生态的功能,只有当大量高质量的插件被开发并沉淀之后,才能显现出差异化的优势。当然,如果你是极客开发者,非常欢迎你参与到生态建设中,为后续的用户创造更好的体验。
你可以通过以下链接获取DeepSeek Harness的源码:https://github.com/deepseek-ai/deepseek-harness

