文章摘要
2026年9月22日杭州云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯分享提出,大模型产业将长期处于多模型异构共存、算力多源供给格局,模型调度与应用反馈迭代是行业亟待解决的新课题。基元律动已推出相关调度框架、开源项目与RSI反馈迭代机制,验证了方案可行性,联合合作伙伴推出验证成果NeoHorse-1系列模型。

9月22日,在2026杭州举办的云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯带来了主题为《从Harness到RSI飞轮》的分享。他在演讲中提出,多模型长期异构共存、算力资源多源供给,将是大模型产业发展的长期格局;而随着Agent需要处理的任务复杂度不断提升,如何合理调度不同模型,并将实际应用中产生的反馈转化为模型迭代的优化依据,正成为行业亟待解决的新课题。

据行业相关监管部门披露,2026年3月国内日均Token调用量已突破140万亿,相比2024年初的规模增长超过千倍。韩凯在分享中提到,一项复杂的Agent任务通常需要十余次甚至数十次模型调用才能完成,任务最终的完成效果不仅依赖单个模型的能力,更取决于支撑任务运行的整套系统能力,其中涵盖模型选择、工具调用以及上下文管理等多个环节。

Harness是支撑Agent完成任务的核心运行框架,而模型路由则是其中的关键能力之一。韩凯表示,不同模型在能力覆盖范围、使用成本以及响应速度上各有优劣,面对复杂任务时,需要根据每一步的具体需求挑选适配的模型;同时,模型的异构适配以及算力的异构调度,也需要专业的技术能力作为支撑。

基元律动通过开源项目OpenSquilla对这一方向进行了探索。根据该公司公开的端到端Agent评测结果,在特定的测试配置下,OpenSquilla保留了旗舰模型基线99.96%的任务完成质量,同时将整体使用成本降低了88.9%。在另一组DRACO深度研究评测中,采用多模型协同配置的方案,最终得分超过了该组实验中表现最强的单模型基线,而成本仅为其约三分之一,这些数据充分证明了模型调度在特定任务场景下的成本控制与效果提升优势。

“路由层的价值,在于让每一步任务用对模型、用得起模型。”韩凯说。

在模型调度之外,韩凯还进一步介绍了面向RSI(递归式自我改进)的反馈闭环机制:以实际场景中的能力需求为导向,通过系统评测识别当前模型与调度策略的优化方向,开展针对性的迭代优化,再将升级后的能力放回场景中验证效果。这一机制将模型的实际应用、效果评测以及后续的迭代优化串联起来,探索让Agent在持续验证与优化中不断提升任务表现的路径。

今年9月发布的NeoHorse-1系列模型,正是这一探索路径的初步验证成果。该系列模型基于通义Qwen3.5底座进行了后续的定制训练。根据其初版技术报告的数据,在十项基准评测中,4B版本的宏平均得分从58.94提升至64.87,9B版本则从65.60提升至69.04;其中4B的后训练版本,在VitaBench、τ²-Bench、PinchBench、QwenClawBench以及HumanEval这五项评测中,表现超过了Qwen3.5-9B的底座模型,整体平均得分也进一步接近9B底座的水平,这一结果初步证明了利用Agent运行过程中的经验来改进模型的可行性。

在合作生态方面,韩凯介绍,基元律动与阿里云围绕Qwen系列模型展开了多维度的合作,包括场景测试、效果评测以及应用验证等工作;团队在自身的Harness与Agent产品中持续使用相关模型,积累了大量真实场景下的运行反馈,并推动新版本接入TokenRhythm路由平台。在基础设施层面,阿里云为相关业务的稳定运行提供了云服务支持,无问芯穹则为NeoHorse-1的训练和推理环节提供了算力支持以及基础设施优化方案。

从Harness框架到RSI递归自我改进飞轮,基元律动希望能够将模型调度与模型迭代有机结合起来:一方面让现有的模型能够在适配的任务场景中充分发挥自身优势,另一方面让任务执行过程中积累的真实运行经验能够反哺后续的模型训练与评测,逐步探索出Agent持续进化的可行路径。

以上内容不代表本平台立场,仅供读者参考