Hyra:AI Research Agent的多领域创新探索

近期,Hyra-1.0正式发布,这是一款具备递归自我改进能力的智能体,专门针对高性能导向的研究与工程任务打造。作为Hyra项目的首个正式版本,它能够将智能与算力转化为切实可用的研究与工程成果。
过去一年间,递归自我改进与自动化研究成为人工智能领域最受关注的前沿方向之一。从Google DeepMind的AlphaEvolve仅用48次标量乘法完成4×4复数矩阵相乘,到Together AI让多智能体协作将11维kissing number的已知下界从593推进至604,再到Andrej Karpathy的autoresearch展示的模型训练自主循环,一系列进化型系统不断涌现,证明智能体正在突破封闭基准测试的限制,在开放的科学发现场景中实现超越人类的突破。
Hyra的核心设计遵循“The Bitter Lesson”的原则:保持框架轻量简洁,同时拓展智能体的动作空间。基于任务描述,Hyra会持续运行迭代循环,依托历史探索经验不断生成更优的解决方案。历史经验库包含过往方案的运行日志、评估反馈、源代码等完整信息,循环会持续到智能体主动终止或资源预算耗尽,最终返回历史表现最优的方案。
这套通用的Hyra Harness包含两个核心组件:
- Context Agent:负责维护经验库(Experience Bank, EB),将探索过程中生成的解决方案及其评估结果存入库中,并从经验库中整合提炼出多份“灵感上下文”,送入任务队列用于启发新的方案生成。这些灵感上下文可以是代码、文件、产出物或运行日志等多种形式的历史经验,为后续探索提供方向性指引。
- 多个Proposal Agent:每个智能体每次从任务队列中领取一份灵感上下文,基于对历史经验的反思生成全新的解决方案——一个以solve.sh作为入口的完整方案文件夹。生成后,该方案会在独立沙箱环境中运行并接受评估,最终结果会被提交回经验库。Context Agent会确保提供的灵感上下文足够多样化,让Proposal Agent能够从多个方向展开探索。
对于没有现成评估器的任务,Hyra会将单层循环升级为双层循环:首先根据任务描述设计初始评估器,内层循环基于该评估器反复优化解决方案;当内层循环结束后,Hyra会结合经验库中的历史数据进一步优化评估器,比如提升评估效率、减少奖励欺骗风险、细化评估粒度等,再使用升级后的评估器开启新一轮循环。例如在设计国际象棋AI的任务中,初始评估器可能是由随机AI组成的天梯,以Elo分数作为评估指标;随着循环推进,评估器中的对手会逐步替换为经验库中的更强方案,实现评估器与解决方案的共同进化。
AI for AI:加速模型研发全流程
基础模型研发包含大量可执行、可评估、可迭代的研究循环,是智能体最自然的应用场景,也是实现递归自我改进的现实起点。从训练配方、数据策略、训练推理系统、底层算子到评估体系,每一个环节都需要研究者不断提出假设、实现方案、运行实验并迭代优化。智能体则可以将每一次成功与失败沉淀为经验,在远超人工实验频率的搜索空间中持续探索。
我们在Recursive自动化AI研究系统的三项标准任务上测试了Hyra-1.0,分别是NanoChat Autoresearch、NanoGPT Speedrun和SOL-ExecBench,覆盖固定预算训练、训练速度优化和GPU kernel优化三个方向。为保证可比性,我们复用了Recursive的公开设置,包括相同的任务定义、评测协议和初始解决方案。测试结果显示,Hyra-1.0在三项任务上均超越了Recursive报告的最优结果:
- 在NanoChat Autoresearch任务中,Hyra需要在固定预算内平衡模型结构、优化器、学习率策略、数据流和执行效率,最终将Validation BPB降至0.9015。
- 在经过长期社区优化的NanoGPT Speedrun任务中,Hyra将达到3.28 validation loss的时间缩短至76.4秒。
- 在SOL-ExecBench任务中,Hyra针对235个kernel进行联合优化,当前Mean SOL达到0.771。
这三项结果覆盖了训练算法、训练系统和底层算子三个不同维度,证明同一套研究循环可以迁移到多种反馈环境中,并持续产生可执行、可验证的改进。同时我们也观察到,更强的搜索能力会更快触及评估器的边界:部分方案会通过泄漏未来token、缓存输出等方式异常降低指标分数,却没有真正完成任务。这说明自动化研究不能只关注最终分数,评估器本身也需要成为研究循环的一部分。随着解决方案的搜索能力不断增强,评估器与验证流程也需要同步进化,才能真正区分真实进步与奖励欺骗。对于AI for AI场景而言,更强的研究智能体能够加速模型、训练系统和基础设施的研发,而升级后的AI系统又会反过来增强下一代研究智能体,形成正向循环。
AI for Science:突破科学发现边界
我们从EinsteinArena、Erich's packing center等数据库中收集了55个数学开放问题,其中许多问题数十年间都没有取得实质性进展。Hyra在其中29个问题上刷新了历史最优结果,展现出进行大规模数学发现的潜力,所有详细结果都已开源共享。
除了数学领域,Hyra还可以从各类实验数据中挖掘规律。例如我们向Hyra提供了1749年至1932年的逐月太阳黑子数据,它成功发现了一个用于预测太阳黑子数量的递推公式,并在1932-2026年的近百年样本外数据上取得了R²=0.77的预测精度。类似地,Hyra还可以通过分析AI模型的训练日志,发现模型的缩放定律,指导训练配方的优化设计。
除了从数据中发现规律,Hyra还可以直接设计科学与工程产物,以下是三个代表性案例:
- Hyra设计出仅含15个可训练参数即可完成10位数加法的Transformer,相比Adderboard公开记录中的36个参数减少了58.3%。这一结果不仅刷新了参数规模上限,也证明Hyra能够在严格资源约束下联合搜索模型结构与计算机制,为研究神经网络能力边界、实现极致性能的模型压缩提供了新的思路。
- 在量子计算领域,逻辑量子比特需要映射到真实芯片有限的耦合拓扑上,不相邻量子比特之间的操作通常需要插入SWAP门,带来额外的双比特门开销与噪声。Hyra设计的量子比特路由算法在IBM Q20芯片上相比经典SABRE算法将路由效率提升了44.4%,更少的双比特门意味着更短的执行时间和更低的累计误差,为受噪声限制的量子设备提供了更高效的电路执行路径。
- PARP1是DNA损伤修复的关键蛋白酶,因其与同源重组修复缺陷的肿瘤细胞产生“合成致死”效应,成为精准抗癌的重要靶点。我们向Hyra提供PARP1靶点口袋,要求生成结合稳定且成药性好的候选分子,最终得到的候选分子在结合-成药联合评分上显著超过已上市的PARP抑制剂olaparib。这一结果展示了Hyra在多目标药物设计中的潜力,需要说明的是,当前结果仍为初步模拟筛选结果,后续还需要经过更严格的模拟、合成与湿实验验证。
AI for Fun:开放场景的创意探索
除了模型研发与科学发现,Hyra还可以在游戏、设计和内容创作等开放场景中,通过自博弈、自评价和用户反馈持续迭代策略产物。与固定基准任务不同,这类场景通常不存在唯一正确答案,智能体不仅需要搜索解决方案,还需要将模糊的主观目标转化为可迭代的反馈信号。
我们进行了三个颇具趣味性的实验:
- 黑白棋AI进化:我们让Hyra通过自对弈持续设计和优化黑白棋对弈bot。评估器采用双循环比赛机制:新生成的方案与经验库中的高分bot对战,根据Elo分数保留top-k选手,形成随搜索过程不断增强的对手池。Hyra的策略从初始的MinMax搜索,逐步演化到结合AlphaZero式PUCT与MCTS的混合方案。最终生成的bot在Botzone的730个参赛程序(多数由计算机专业学生设计)中排名第3。
- 3D建模优化:我们让Hyra仅根据一张2D参考图像设计物体的三维结构并生成可渲染的3D模型。我们使用基于rubrics的VLM judge,从轮廓、比例、结构完整性、材质和视觉相似度等维度评价生成结果。Hyra在多轮探索中持续修改建模代码和渲染参数,相比使用Claude Code goal模式生成的模型,最终结果更接近参考图像,也更符合人类审美。
- 和声创作迭代:我们向Hyra提供一段旋律,要求为多种乐器编写完整和声。内层循环使用固定规则的评估器检查和声、和弦进行、节奏密度、音域冲突等;外层循环则根据用户反馈调整评估器,让系统逐渐理解用户难以预先形式化的偏好。经过7轮进化,同一段旋律从最初的四声部同乐器、十六分音符泛用、充满大三和弦进行的保守颂歌式和声,逐步发展为多乐器、带有减和弦、六和弦、灵活节奏和丰富色彩的完整配器。
这些实验证明,研究智能体的价值并不局限于求解具有单一标量指标的问题。当反馈来自对手、视觉模型或真实用户时,Hyra仍然可以将模糊目标转化为可迭代的搜索过程;而当现有评估标准不足时,解决方案与评估器也可以在双层循环中共同进化。
未来发展方向
我们相信,简单高效的Hyra拥有无限的发展潜力。当前展示的仍只是Hyra非常初步的demo版本,接下来我们将定义更多有价值且可持续迭代的任务场景。除了公开基准测试之外,各类产品系统、真实的AI研发流水线、自然科学研究与工业场景,都可以拆解为可执行、可验证、带有明确反馈的研究问题。
我们希望通过Hyra转动“scaffold–data–model”的进化循环:更优质的 scaffold 产出更好的数据与经验,锻造更强的模型,而更强的模型又会驱动更高效的 scaffold 与更多新发现。新一代Hy模型乃至部分产品,都将与Hyra实现持续共进化。
如果你对Hyra感兴趣,无论是希望开展学术合作、申请实习求职,还是提出宝贵建议,都欢迎填写下方问卷。如果这正是你愿意投身的事业,欢迎加入我们!
- 问卷地址:https://wj.qq.com/s2/27312301/dba4/(也可点击文末阅读原文跳转直接填写)。
- 相关开源项目及更多信息,可关注相关技术社区获取,地址:https://github.com/Tencent-Hunyuan/hyra-results


