文章摘要
针对大语言模型训练中人工整理训练数据成本高、供给跟不上模型学习进度的痛点,Ornith团队推出Ornith-1.5开源模型,创新实现AI自主造题、搭建解题框架、完成训练的完整自主优化闭环,其大尺寸模型自测成绩超闭源旗舰Claude Opus 4.8,但该成绩未获官方核验,与官方榜单成绩不具可比性,该训练模式开辟了开源模型性能提升的新方向。

当大语言模型不再依赖人工整理的训练数据集,反而能自主生成高质量训练任务、搭建解题框架、完成完整训练闭环,这种突破正在改变智能体模型的训练逻辑。近期推出的Ornith-1.5模型,就将这种“自给自足”的训练方式推向了新的高度。

训练一款能够完成复杂任务的智能体模型,最大的成本从来不是显卡算力,而是配套的训练数据与测试环境。尤其是在编码、多轮交互这类高复杂度任务场景中,仅仅有题目和答案远远不够:需要搭建可运行的任务环境,设计精准的对错判定标准,还要防止模型通过重复提交旧答案来刷取分数。

题目难度的把控同样是关键难题。如果题目过于简单,模型可以轻松完成,无法获得有效的学习经验;如果难度过高,模型完全无法解答,同样无法积累正向的训练反馈,只会浪费宝贵的算力资源。而要凑齐足够多的高质量训练题,过去一直依靠人工整理,不仅效率低下、成本高昂,更重要的是供给速度远远跟不上模型的学习进度,往往刚整理完一批训练数据,模型就已经完成了学习。

既然人工出题的瓶颈难以突破,那能否让模型自己为自己生成训练任务?Ornith团队给出了肯定的答案。今年8月,该团队一口气推出了397B MoE、35B MoE和9B Dense三款不同规模的模型权重,其核心创新在于训练流程中加入了全新的自主循环环节:模型自主生成训练任务、搭建专属解题脚手架、完成解题轨迹生成,这三个环节的结果共同进入强化学习流程进行优化。

这种全新的训练模式很快带来了显著的性能提升。在Terminal-Bench 2.1测试中,Ornith-1.5的397B模型取得了86.1分的成绩,而两个月前的Ornith-1.0版本仅为77.5分,短短两个月内提升了8.6个百分点。更值得关注的是,在同一份测试结果中,Ornith给出的Claude Opus 4.8成绩为85.0分,这意味着这款可免费下载的MIT许可模型,性能已经超越了闭源旗舰模型。

从学会解题到自主出题的迭代路径

早在今年6月推出的Ornith-1.0版本,就已经完成了一项突破性的改进:将智能体解题的脚手架(也就是模型执行任务时的工作台)变成了可学习的对象。传统的智能体训练中,人类工程师会为特定类型的任务预设固定的脚手架,包括工具调用方式、任务拆解逻辑、错误重试机制等,模型只能在这个固定框架内反复训练。而Ornith-1.0打破了这种限制,将脚手架的优化交给模型自主完成。

该版本的强化学习步骤分为两个阶段:首先根据当前任务和上一轮使用的脚手架,生成优化后的新脚手架;再在新脚手架上运行解题轨迹,最终将奖励同时回传给脚手架生成和解题两个环节,让模型同时学习如何搭建更有效的解题框架,以及如何利用框架完成任务。

不过Ornith-1.0并没有解决训练任务的来源问题,出题的工作仍然由人类完成。到了Ornith-1.5版本,这一环节也被纳入了自主循环当中。

Ornith-1.5的完整闭环分为三个步骤:首先基于给定的代码库、任务类型的高层描述,以及模型自身的历史解题记录,生成一批难度略高于当前模型能力的训练题,精准填补模型的能力缺口;其次针对每道新生成的题目,模型自主生成或优化专属的解题脚手架,包括任务指令、工具调用规则、执行逻辑等;最后在任务和脚手架的双重约束下,运行解题轨迹并收集反馈。

最终,解题轨迹的奖励会反向回传给任务生成、脚手架优化和解题执行三个环节,通过GRPO算法进行统一优化。值得注意的是,出题环节本身也会被打分:如果生成的题目质量不佳,出题环节同样会获得负向反馈。至此,出题、搭台、解题三个环节形成了完整的自主优化闭环。

在这个闭环中,模型的解题能力越强,生成的题目就越有难度和信息量;脚手架的优化越完善,就越能充分发挥模型的潜力;而解题轨迹的质量越高,就能为模型提供更有效的学习信号,形成正向循环。过去两年,开源智能体模型追赶闭源旗舰的主要路径是堆参数量、复刻现有训练配方,而Ornith则跳出了这种思路,转向让AI自主生成训练数据。

如何避免生成无效的训练题

让模型自主出题听上去很美好,但很容易出现一个漏洞:模型可能会为了刷取高分而生成过于简单的送分题,比如基础算术题这类问题,虽然能轻松获得满分,但无法提供有效的训练信号。Ornith团队针对这个问题设计了三重评价指标,通过相乘的方式计算题目奖励,确保只有同时满足三个条件的题目才能获得有效奖励。

第一个指标是有效性,用于判断题目是否具备可执行性:包括脚手架能否正常运行、是否存在高置信度的正确解、错误解能否被正确判定、判分逻辑是否与任务描述匹配。团队将有效性作为硬门槛,只要有一项不达标,该题的整体奖励就会直接归零,直接过滤掉那些看起来复杂但实际上无法判定对错的无效题目。

第二个指标是前沿难度,也是整个设计的核心亮点。系统会对每道题目采样多条解题轨迹,计算模型的经验成功率,当成功率接近0.2(也就是十次尝试中成功两次)时,题目会获得最高的奖励。这意味着一道优质的训练题,应该刚好处于模型“跳一跳够得到”的难度区间:如果成功率超过0.8,说明模型已经掌握了这类题目,没有训练价值;如果成功率接近0,模型完全无法完成,同样无法积累有效的学习经验。

更巧妙的是,这个难度阈值会随着模型的能力动态调整:当模型在某类题目上的成功率提升后,该类题目的奖励会自动降低,出题环节必须继续提升题目的难度才能获得高分,整个训练的难度曲线会自动爬升,无需人工干预调整。

第三个指标是新颖性,优先级最低,仅负责避免重复生成同类题目的变体,减少训练数据的冗余,并不会刻意追求怪异的题目类型。

通过这三重指标的协同作用,Ornith-1.5实现了训练课程的自主演进,整个流程仅发生在模型的训练阶段,当用户从开源平台下载最终的模型权重后,该模型并不会在本地运行时继续自主修改自身。

测试成绩背后的差异

需要注意的是,Ornith-1.5在Terminal-Bench 2.1上的86.1分,是团队在自建环境中使用自定义配置跑出来的结果,官网说明为五次独立运行的平均值。而Terminal-Bench 2.1本身有官方验证榜单,所有上榜结果都经过了榜单团队的复现和核验。截至2026年8月19日,官方榜单的17个项目中并没有Ornith-1.5的身影。

对比双方的成绩同样存在差异:Ornith给出的Claude Opus 4.8成绩为85.0分,是使用Terminus-2框架自测的结果;而官方榜单中,Anthropic提交的Claude Code加Opus 4.8的成绩为78.9%,排名第五,榜首的成绩为Claude Code加Fable 5的83.8%。同一模型在两份榜单中相差了6.1分,核心原因在于测试环境、配置和规则的不同。

Terminal-Bench这类智能体基准测试,衡量的是模型、脚手架、超时设置、上下文窗口和资源配置的综合性能,更换任何一项配置都会改变最终的测试结果。因此官方榜单明确规定,参赛方不得修改超时和资源配置,防止通过调整参数刷取分数。而Ornith团队披露的自测配置为4小时超时、32核CPU、48GB内存,已经改动了官方锁定的部分配置参数,这意味着项目自测成绩与官方验证榜单的成绩不具备直接可比性。

另外,Ornith仅开放了模型权重的MIT许可,目前公开的代码仓库仅包含基础说明和许可文件,并没有完整的训练实现代码、训练任务集和可复现的评测脚本,开放权重并不等于全套开源。

被忽视的中小尺寸模型价值

大尺寸模型往往更容易获得关注,但真正决定模型普及程度的是中小尺寸版本。Ornith-1.5发布的35B MoE和9B Dense两款模型,就展现了出色的实用价值。

35B MoE模型每个token仅激活约3B参数,属于轻量级的混合专家模型。在Terminal-Bench 2.1测试中取得了67.8分,远超同级别稠密模型的表现;在SWE-bench Verified测试中取得了79.0分,对比同类模型的52.0分提升明显,是本次发布中性价比最高的一款模型。

9B Dense模型则面向端侧部署场景,压缩后体积小巧,还提供了多平台适配的版本。该模型在多项测试中表现亮眼,但在多轮工具调用类任务上存在短板,这类任务需要更长的上下文和更大的容量,9B模型的参数体量无法支撑这类复杂任务,而编码和推理类任务可以通过训练方法弥补体量差距,工具调用的短板则难以通过训练优化完全弥补。

智能体训练的新赛道:自主生成题库

Ornith-1.0在两个月内将Terminal-Bench自测成绩从77.5提升到86.1,提升幅度超过11%,比单纯的分数提升更重要的是其背后的训练逻辑变化。从Ornith-1.0学习“如何解题”,到Ornith-1.5学习“该练什么”,数据生产的整个环节被纳入了强化学习的闭环当中。

高质量的智能体训练任务一直是稀缺资源,人工整理的速度已经远远跟不上模型的学习需求,Ornith的方案正是针对这一具体的工程痛点提出的解决方案。开源智能体模型追赶闭源旗舰的路径正在发生变化,除了堆参数量和复刻训练配方之外,自主生成高质量训练题库正在成为新的竞争方向,谁能够持续生成优质的训练任务,谁就能掌握模型持续进化的核心燃料。

未来,智能体模型的性能上限不仅取决于算力规模,更取决于其自主生成训练数据的能力。当出题、搭台、解题都可以由模型自主完成时,人类在这个闭环中的角色也将发生转变,从直接参与训练数据生产,转向提供更高层级的任务定义和规则约束。

以上内容不代表本平台立场,仅供读者参考