PenguinHarness:AI Agent自动化创建与自我进化平台

当前开发智能Agent时,开发者常常面临一系列繁琐的问题:从搭建基础框架、配置工具链,到管理系统提示词中的规则,每一步都需要手动调试,而且随着项目迭代,规则的修改轨迹很难追溯,版本管理也容易混乱。针对这些痛点,知名开源项目LlamaFactory的维护团队近期在GitHub上推出了PenguinHarness,一款能够让Agent自主创建并调优其他Agent的自动化构建平台。
早在几年前,LlamaFactory就将模型微调过程中零散的脚本整合为统一工具箱,让首次接触模型微调的开发者无需反复折腾,只需通过一份YAML配置就能快速启动任务。而PenguinHarness则瞄准了另一个日益复杂的开发场景:规模化搭建和优化智能Agent。
让Agent自主创建Agent
PenguinHarness的核心定位非常直接:让Agent来创建并优化Agent。用户只需要明确提出需要的Agent能力,平台就会自动完成创建项目目录、编写工作手册、配置所需工具等一系列工作,随后调用刚生成的新Agent完成第一项测试任务。如果测试结果不理想,系统会自动回溯失败记录,修改对应的工作手册,再用同一套测试题让新Agent重新考核。
快速构建Git提交信息生成Agent
项目内置了一个轻量化的本地示例,当默认Agent接收到“创建一个能根据代码改动生成Git提交信息”的需求时,会自动在项目中生成commit-helper目录,编写好AGENTS.md和system_config.yaml文件,并安装对应的技能模块。
文件生成完成后,脚本会自动调用这个新创建的Agent,让它读取代码改动并生成符合Conventional Commits规范的提交信息。这个示例通过Ollama调用本地的qwen3.6:35b模型,所有数据都不会离开本地机器。项目文档也提前提醒,模型偶尔会出现YAML转义错误,生成完成后最好先进行核对。
项目首页还展示了一个更复杂的案例:用户只需要一句话需求,要求收集Claude Code文档并构建一个能回答配置问题且附带原文引用的RAG应用。PenguinHarness会自动补全脚手架代码、运行说明等内容,最终生成一个可直接运行的网页应用,整个过程使用DeepSeek V4 Pro模型,仅花费0.2元。
从4.8分到9.8分的迭代之路
当新的Agent创建完成后,PenguinHarness会自动安排固定测试来验证其能力。在自我改进的示例中,新Agent被要求将会议笔记整理为符合公司内部格式的团队报告,需要撰写两句概述和三条事实,同时严格遵循公司的格式规范。
问题的关键在于“内部格式”的细节:报告需要的标题、密级和页脚等规则,都只记录在团队的工作手册中。初始的AGENTS.md文件是空白的,新Agent完全没有参考依据,连续五次测试的得分分别为5、4、5、5、5,平均分为4.80/10。
当系统向Agent提供一份合格的报告作为参考后,Agent从范例中摸索出了大致的结构,并将新规则写入自己的AGENTS.md文件,第二轮测试的平均分提升到6.60/10。当拥有三份合格报告作为参考后,Agent成功识别出了固定的项目标记和签名等常量内容,并将其补充到工作手册中,第三轮测试的平均分达到了9.80/10。
其中最简单的演示脚本self-improve.ts通过硬编码写入规则,只展示了“考试、修改、重考”的闭环流程;而self-evolve.ts和递归版本则将寻找规则、修改手册的工作完全交给Agent自主完成。每一轮修改前,系统都会为当前版本创建快照,只有在同一套测试题中得分有所提升的新版本才能被保留,如果成绩没有上涨,则直接回退到上一版本。值得注意的是,整个迭代过程并没有重新训练模型,模型的权重始终保持不变,所有的变化都记录在模型之外的Agent State中,包括工作手册、技能模块和运行配置。
Harness for RSI的设计思路
在传统的Agent开发中,大量的规则都混杂在一段长长的系统提示词中,随着时间推移,开发者很难说清楚每一次修改的原因、修改的内容以及上一个版本存在的问题。PenguinHarness将这些零散的规则转化为可版本化的文件和可追溯的记录:工作手册可以纳入版本管理,测试拥有固定的题目,每一轮执行的轨迹都可以查看,即使修改出现问题也可以快速回退到之前的版本。
目前PenguinHarness已经提供了桌面端、CLI、Web和SDK多种使用方式,将Agent、技能模块、模型、用量统计、执行轨迹和评估结果都整合在同一个工作台中。平台兼容所有遵循OpenAI协议的在线模型,同时也支持通过Ollama或vLLM调用本地模型。
这个开发路线被称为Harness for RSI,当前的实现方式非常简洁:让Agent读取失败的测试记录,修改自己的工作手册,再重新参加同一套测试。整个过程没有改变模型的权重,只是在工程层面增加了一层可版本化、可回放、可回滚的记忆层。这一思路和DeepSeek Harness的设计方向有不少相似之处。
参考链接
-
PenguinHarness:https://github.com/Prism-Shadow/penguin-harness
-
PenguinHarness 中文文档:https://github.com/Prism-Shadow/penguin-harness/blob/main/README.zh.md
-
LlamaFactory:https://github.com/hiyouga/LLaMA-Factory
-
Agent 创建 Skill:https://github.com/Prism-Shadow/penguin-harness/blob/main/packages/skills/skills/agent-creation/SKILL.md
-
用一个 Agent 构建另一个 Agent 示例:https://github.com/Prism-Shadow/penguin-harness/tree/main/examples/build-agent-with-agent
-
自我改进 Agent 示例:https://github.com/Prism-Shadow/penguin-harness/tree/main/examples/self-improving-agent
-
Agent 优化 Skill:https://github.com/Prism-Shadow/penguin-harness/blob/main/packages/skills/skills/agent-optimization/SKILL.md
-
拆完这篇88页论文,看懂DeepSeek Harness:https://mp.weixin.qq.com/s?__biz=MjM5ODkzMzMwMQ==&mid=2650453472&idx=1&sn=d3f00102b31590a3e1dbe59fed704079&scene=21#wechat_redirect

