PenguinHarness:Agent自进化的开源框架

当大模型微调的门槛被LlamaFactory大幅降低后,面向智能体的自动化开发与进化工具成为了新的行业焦点。近日,LlamaFactory的核心开发者推出了全新开源项目PenguinHarness,这款被称为「企鹅驾驭师」的工具,将智能体开发从手动调优推向了自我迭代的新阶段。
PenguinHarness是一款原生支持自我进化的智能体开发框架,主打轻量、开源、易用的特性,基于原创的智能体内核,可以稳定适配包括GPT-5.6、DeepSeekV4在内的多款主流大模型。
项目的初衷与2026年行业热议的AI4AI、递归自我进化(RSI)等方向高度契合。此前,Meta前研究总监田渊栋创立的Recursive团队已证明智能体可以训练模型、优化GPU算子;MSRA前副院长边江创立的XYZ AI Lab也探索出通过数百个智能体完成深度研究模型后训练的路径。而PenguinHarness则致力于打造最易用的开源框架,让智能体自进化能力开箱即用,无需手动反复调优。
开源地址:https://github.com/Prism-Shadow/penguin-harness
项目主页:https://penguin.ooo
让智能体自动构建智能体
PenguinHarness的核心能力之一,就是让智能体自动生成另一个可用的智能体。我们以最经典的RAG应用开发场景为例,对比了PenguinHarness与OpenAI Codex的实际表现:要求AI生成一个支持分块检索、流式返回通俗易懂且带来源引用答案的RAG工具。
实际测试结果显示,PenguinHarness不仅耗时远低于Codex,成本仅为后者的几十分之一,还直接产出了可直接落地的RAG智能体应用。生成的结果语言流畅自然,自带流式输出和完整的来源引用,而Codex的输出则存在中英混杂、缺少流式输出的问题。
过去开发这类智能体应用,需要经历框架选型、模型部署、工具接入、提示词编写、反复测试修改等多个环节,几乎从零开始搭建,往往需要一个团队花费数周的精力。即使有Claude Code这类开发工具,也因为对现有智能体框架不够熟悉,难以做到像开发前端网页那样便捷。
而PenguinHarness从诞生之初就内置了所有必要的选项,用户只需要清晰描述需求,它就能自动完成脚手架生成、提示词编写、技能安装、前端搭建等全流程,最终交付一个完整可运行的智能体应用,整个过程仅需花费0.2元的Token成本和一杯咖啡的时间。
据项目开发者介绍,PenguinHarness以文件系统作为唯一的真相来源:智能体本身是文件、提示词是文件、对话历史同样是文件,文件是人与智能体最自然的协作方式。框架仅负责将文件拼装为可运行的智能体对象,创建新的智能体本质上就是文件的复制粘贴。在运行时,PenguinMessage作为统一的消息协议,如同网络数据报文一样在模型、环境和用户之间交换,这种轻量统一的接口让PenguinHarness可以轻松接入任意代码场景。
可以说,PenguinHarness既是一个智能体框架,也是一个智能体实体,对自身的运作逻辑有着最清晰的理解。
本地可复现的智能体自进化闭环
让智能体自动构建智能体只是PenguinHarness的第一步,项目更长远的目标是让每个人都能在本地拥有可自主进化的智能体。构建智能体是从0到1的突破,而优化智能体则是从1到100的跨越,这一过程需要克服诸多挑战。
开发者曾在相关讨论中提出:「修改智能体很容易,但让它变得更好却很难。」大模型本身就是带有随机性的概率函数,而智能体更是充满不确定性的自主系统。要实现可靠的智能体自进化,必须要有一套可靠的评估系统作为衡量标准。正如ReAct论文作者姚顺雨所言,评估是大模型的下半场,对于智能体自进化来说,一套优质的评估基准更是进化的根本。
为了探索准确的评估方式,团队花费了半年多的时间。当前主流的评估大多仅包含测试集,缺少训练集,如果直接在测试集上进行自进化,很难区分智能体是真正掌握了能力,还是仅仅背会了答案。为此,团队专门开发了一套全新的评估基准GDPevo,专门用于测试智能体的自进化能力,覆盖医疗、金融、法律等六大真实场景,通过划分训练集和测试集,确保智能体在进化过程中不会「偷看答案」。
PenguinHarness吸纳了GDPevo的核心思想,将智能体的评估和优化封装为开箱即用的技能模块。调用这些技能后,框架会启动多个智能体协同完成调优流程,实现真正的自进化。
举个实际的例子:如果我们需要一个能更准确预测球赛、提出投资策略或处理电商售后的智能体,但初始版本的准确率并不高。过去需要手动调整提示词、搭建工作流来提升精度,而现在PenguinHarness可以自动完成智能体的调优。
测试数据显示,PenguinHarness经过多次迭代后,智能体的评分从优化前的53分提升到了95分,使用DeepSeek V4 Flash正式版完成整个流程仅花费了0.5元的Token成本。
这一过程背后是一套多智能体协作的闭环流程:首先,框架会生成一个负责出题的Benchmark Builder,围绕目标能力生成一系列题目和答案对,并通过反复测试校准题目难度。进入优化阶段后,三个承担不同角色的智能体会组成自进化闭环,反复执行以下四个步骤:
- 组织评测:优化智能体按照题目数量和运行次数,组织多个评估智能体并行开展评测;
- 独立打分:每个评估智能体启动一个独立的被测智能体解答题目,并根据仅评估智能体可见的评分标准进行打分,将结果返回给优化智能体;
- 分析优化:优化智能体汇总评测结果,通过分析运行轨迹定位失分原因,修改被测智能体的提示词、技能或配置,生成候选的下一版被测智能体;
- 验证迭代:评估智能体对候选版本重新评测,优化智能体根据结果决定是否接受候选版本,随后进入下一轮迭代。
在整个优化过程中,只有当候选版本取得严格更高的分数时才会被接受,如果得分持平或下降,框架会自动回退到上一个版本。从一次性交付到持续进化,这正是PenguinHarness为下一代智能体框架给出的答案。
安全可控的进化边界:自进化的契约机制
为了让智能体自进化能够稳定运行,PenguinHarness设计了一套框架必须遵守的「契约」,明确了自进化的边界范围。其中几项核心规则包括:
- 限定智能体的修改范围仅为提示词和技能模块,不得触及框架内核,防止进化过程中出现安全风险,比如破坏原有权限审计规则,确保智能体的进化建立在安全的基础之上;
- 智能体自进化必须支持快照和回滚能力,当优化产生负面效果时,框架可以将智能体版本回退到之前的稳定状态;
- 被测智能体在进化过程中只能看到题目本身,无法看到评分标准,防止智能体通过背会答案或迎合评分器来获取高分,避免Reward Hacking现象;
- 所有优化流程都需要形成完整的文件记录,用户有权审计整个优化过程,确保自进化的可解释性。
这套契约已经被PenguinHarness整理为「CONTRACT.md」文件,方便用户复制和分发。
丰富的扩展能力与落地实践
团队在探索智能体自动构建范式的同时,也为PenguinHarness添加了一系列实用的扩展能力:
首先,框架内置了LlamaFactory、vLLM、Ollama等与模型训练、部署相关的技能模块,用户可以通过类似Vibe Coding的方式快速启动模型训练和部署流程。
其次,PenguinHarness集成了统一的模型网关,支持接入超过1000种在线和本地模型,已经完成了与Kimi K3、Gemini 3.6、Ling 3.0 Flash等最新模型的适配。
此外,PenguinHarness还为DeepSeek模型增加了视觉支持能力。用户可以配置一个带有视觉模态的代理模型,实现以DeepSeek为主驾驶、视觉代理模型为副驾驶的开发模式,让DeepSeek能够「看到」自己生成的网页和PPT,并基于视觉反馈进行调整优化。
框架本身还支持细粒度的行为轨迹分析,用户可以通过查看时间线来分析智能体的性能卡点,快速定位优化方向。
除此之外,用户还可以将PenguinHarness作为类似Pi Agent的空白智能体样板使用。框架内置的智能体采用极简设计,以Shell作为通用接口,仅使用极少的工具完成任务,将Subagent等功能作为核心性能目标进行了优化,系统提示词仅为Claude Code的十分之一(1300 vs 15000)。
在严谨的评估基准加持下,PenguinHarness配合DeepSeek模型取得了优异的表现,成本仅为其他同类产品的几十分之一。
PenguinHarness的表现不仅停留在理论层面,在开发过程中团队已经将其部署到了两个真实生产场景中:某体检机构使用该框架生成了与医学专家能力相当的报告核查智能体,原本需要30分钟才能完成的报告核查工作,现在仅需几十秒即可完成;某制造企业将PenguinHarness构建的多个智能体应用到流水线巡检场景中,实现全天候监控设备状态并自动恢复异常,产线停机时间减少了65%,整体产出提升了近2倍。
PenguinHarness采用Apache2.0协议开源,支持Linux、Mac、Windows系统一键安装,既可以部署在本地机器,也可以部署在服务器上通过浏览器远程访问,支持多用户隔离和团队协同使用,既可以作为智能体自动构建平台,也可以作为OpenAI Codex的本地平替,以更低的成本完成各类开发任务。
项目背后的团队
PenguinHarness由PrismShadow团队开源,该团队成立于2025年,专注于打造能够在真实业务场景中持续学习的智能体基础平台,帮助企业将自身知识、工作流程和业务反馈转化为可部署、可评测、可持续优化的智能体应用。
PrismShadow的创始团队成员包括:
- 郑耀威:LlamaFactory开源框架的核心作者,该项目在GitHub上获得了7万星标,郑耀威长期致力于打造更易用的模型与智能体基础设施;
- 钱步月:加州大学戴维斯分校博士,曾任IBM TJ Watson高级研究员,还曾担任复旦大学教授、博士生导师;
- 吴雪军:前百度NLP部门创始成员,曾任阿里巴巴高级总监和京东数科副总裁;
- 胡俊豪:北京大学博士生,提出了位置无关缓存技术,曾参与MiMo V2模型、Hy3系列模型的研发工作;
- 陈溪:美国纽约大学商学院教授,卡耐基梅隆大学博士,曾任亚马逊首席科学家。
从LlamaFactory到PenguinHarness,团队始终坚持的使命是:将复杂的AI能力转化为真正易用、可靠且高效的大众化工具,让更多人能够享受到人工智能带来的生产力提升。


