Pyromind:打通Agent后训练闭环,实现持续学习

如今,AI Agent正快速走进企业日常办公场景,从撰写周报、处理工单到数据分析,越来越多重复性工作被交由Agent完成。但在这场热潮背后,一个核心问题常被忽略:那些每日稳定运行、反复执行同类任务的Agent,真能在实践中变得更顺手吗?
答案往往是否定的。这也将话题引向了AI领域当下最受关注的方向之一:持续学习。
即便是性能顶尖的基座模型,在训练结束、参数冻结并部署上线后,便会停止成长。但AI行业显然不希望模型停留在“一次性”状态,让AI像人类一样“活到老学到老”,正成为整个领域的核心探索方向。
不少头部玩家和顶尖学者都在布局这一赛道:智谱在GLM-5.2的技术规划中明确将记忆、持续学习和自我评判列为下一步攻坚重点;年初从OpenAI离职的推理模型专家Jerry Tworek创立Core Automation,聚焦持续学习方向;就连图灵奖得主、强化学习之父Richard Sutton也亲自创业,成立Oak Lab,致力于打造能从自身经验中持续学习进化的AI系统。持续学习,正从少数人的小众探索演变为行业共识。
那么,到底该如何实现Agent的持续学习?放眼这条快速升温的赛道,成立于2025年10月的创业公司Pyromind(火思动力)已经给出了自己的答案:这家企业率先将Agent后训练产品化,通过AutoRL技术打通了从任务反馈到模型更新的完整闭环,并用多项落地成果验证了自身的价值,成为该赛道的先行者之一。
Pyromind的核心定位是专注于持续学习与进化的RLaaS(强化学习即服务)公司,其核心判断清晰且坚定:Agent的下一轮能力提升,必然来自于过往运行积累的反馈与经验。而选择将后训练产品化作为切入点,正是因为持续学习虽概念诱人,落地却充满挑战。
要让Agent从任务中实现持续学习,至少需要回答几个环环相扣的核心问题:哪些真实反馈值得模型学习?如何避免学习新技能时破坏原有能力(即灾难性遗忘)?如何将散落在日志、执行轨迹、效果评估中的经验转化为有效的模型更新?又如何让整套流程在企业的算力和成本约束下稳定、可验证地运行?
目前业界针对这些问题给出了五花八门的解决方案:有的通过外挂记忆模块和外部技能库拓展能力,有的在推理阶段通过test-time training进行微调,还有的直接将后训练(尤其是强化学习)部署到上线后阶段,让真实任务的反馈直接接入训练闭环。尽管路线各异,但所有方案的最终目标高度一致:将实践中的“经验”沉淀为可复用的“能力”。
要实现这一目标,需要将算法、分布式工程、算力调度、效果验证等分散的环节,整合为一套能在生产环境稳定运行的完整闭环。而这正是Pyromind正在攻克并落地的核心方向。
Agent行业的关键转折点
要理解Pyromind的技术路径和产品设计,首先需要看清Agent行业正在经历的关键转折点。
Agent的使用方式正在发生根本性变化。当Agent还停留在Demo阶段时,衡量其价值的标准很简单:能否完成一项任务。但当Agent进入真实业务场景、长期运行并反复执行同类任务时,评价标准就发生了转变:能否在运行中持续优化,稳定性、适应性和长期使用成本能否满足业务需求。
这个转变并不轻松。就在近期,IT服务巨头Cognizant宣布成立专门的EMEA(欧洲、中东、非洲)AI部门,其核心目标正是解决困扰整个行业的普遍难题:太多企业的Agent项目卡在了从演示走向量产的阶段。
根据AI可观测性公司Fiddler AI的生产可靠性研究,不少在受控演示环境中表现优异的企业Agent,单次运行成功率约为60%,但一旦投入生产环境连续运行8次,成功率就会暴跌至25%。普林斯顿大学的研究者对14款Agent进行评测后也发现,尽管过去18个月里模型的通用能力突飞猛进,但可靠性的提升却微乎其微。
演示环境的表现之所以更理想,是因为其往往使用干净的数据集、接口文档清晰、流程约束明确;而真实的企业环境往往难以同时满足这些条件。从演示环境到真实生产环境的转变,也带来了三个全新的产业条件:
-
模型的使用方式从单次调用转变为长期运行。Agent会在生产环境中持续运转、反复处理任务,因此稳定性、对业务变化的适应能力和长期调用成本,都从抽象的技术指标变成了实打实的生产问题。
-
生产环境开始产生可利用的反馈数据。真实任务每日都会产生成功、失败、人工修正和业务反馈,这些原本被丢弃的数据,恰恰是优化模型能力最直接的原料。
-
优化对象发生了变化。企业不再只关注通用模型的通用能力强弱,而是更在意Agent能否贴合自身业务场景,并在使用过程中持续提升表现。
我们可以将Agent类比为一名职场新人:大模型为其提供了基础知识和能力起点,Prompt和工作流明确了单次任务的执行方式;而一名员工真正的价值,在于将每一次工作的经验沉淀为长期能力,越做越好。目前绝大多数Agent恰恰缺少这最后一环。
现有方案的局限性
要让Agent从任务中实现持续学习,业界已经尝试了多种路径,但这些方案各有侧重,且在生产环境中都存在明确的局限:
-
预训练决定了模型的通用智力和知识底座,赋予Agent基础的理解与表达能力。但预训练成本极其高昂,且面向通用预测场景,无法直接解决特定企业复杂业务流中的精准决策问题。
-
上下文工程约束的是Agent单次执行的具体操作方式;记忆机制可以让模型记住上下文中的偏好,但更多是“调取”而非“内化”,如果切换到新的类似场景,模型的核心能力并不会自动提升。
-
SFT(监督微调)可以让模型快速学会复制标准流程与动作,但它高度依赖静态的高质量专家轨迹数据,不仅标注成本极高,面对真实业务中多步决策的动态报错、延迟反馈和长尾场景时,缺乏自纠错与自我探索的泛化能力。
这些方案都有其应用价值,但都难以针对长期、多步、动态变化的真实业务场景实现持续优化。即便一个Agent执行了海量任务,如果这些任务中的成功与失败没有进入训练和验证环节,模型也不会自动变得更好。
在Pyromind看来,自进化和持续学习才是解决这一问题的核心路径。以强化学习(RL)为代表的后训练技术,可以将真实任务中的成功、失败和业务反馈转化为奖励信号,通过持续训练提升模型在单次执行、多步决策和复杂目标上的稳定表现。可以说,预训练决定了Agent能力的起点,而后训练则决定了Agent最终能走多远。
这一判断也得到了行业头部团队的认同。无论是智谱将持续学习写入GLM-5.2的技术规划,还是Richard Sutton通过Oak Lab追求“从运行时经验中实时学习”,抑或是Core Automation希望让模型在生产环境中直接更新权重,所有玩家的共识都清晰一致:静态部署的时代正在过去,真正的AI进步必然来自于模型上线后的持续运行与迭代。而这条路线的核心难点在于:如何将AI变成一套能持续运行的系统。
Pyromind给出的答案,是将后训练拆解为一条可以持续运转的闭环链路。在其设计中,Agent在真实工作中产生的成功、失败、人工修正和业务反馈,会依次经过采集、分析、奖励生成、模型训练、效果验证和模型更新,最终重新应用回实际任务。并且,这条链路可以自动运行、反复迭代,将原本分散在不同工具和系统中的后训练环节,整合为一套完整的学习闭环。
这背后的工程挑战,正是制约行业落地的最大瓶颈。强化学习开源项目AReaL团队曾坦言,自进化Agent的关键瓶颈不仅在于模型性能和算法先进性,更在于缺少一套能服务真实Agent的在线强化学习基础设施。该团队还披露过一个细节:在搜索类Agent的训练中,单条轨迹的最长探索时间可能长达一到两小时,这种长尾任务会拖慢整批数据的处理速度,造成大量GPU资源闲置,导致训练效率急剧下降。而将这样一条链路工程化,并让它稳定持续地运转,正是Pyromind想要跨越的核心门槛。
Pyromind的产品化路径
一套能持续运转的后训练闭环听起来前景广阔,但真正落地到产品中时,却绕不开一个现实问题:强化学习的技术门槛极高。算法、分布式训练、算力调度、奖励设计、效果验证……每一个环节都需要专业团队和大量试错成本。大多数企业都希望让Agent实现持续学习,但却被这条链路的复杂度挡在了门外。
Pyromind的产品设计正是为了简化这一过程。其将面向开发者和企业的一系列能力,归纳为一个核心关键词:AutoRL(自动强化学习)。其目标可以用一句话概括:将复杂的强化学习过程自动化,让任何团队都能像搭乐高积木一样轻松开展后训练,而不必从零开始搭建整套系统。这也呼应了其官网的标语“RL For Everyone Not Only Experts”:不只是领域专家,任何人都能开展强化学习相关工作。
具体而言,针对“Agent持续学习”这一核心任务,Pyromind将产品能力划分为三层,从底层基础设施到上层体验层层递进:
-
后训练基础设施层:核心目标是简化训练流程。Pyromind打造了可视化的拖拽式工具,用户只需将核心组件拖拽到画布上,进行简单配置即可搭建一条可编辑的训练管线,支持SFT、GRPO、DPO等多种训练方式,还可以联动机器人仿真沙箱,实时查看训练轨迹、奖励值等关键指标。原本分散在代码和环境配置中的工作,被整合为清晰、可复用的标准化流程。
-
后训练奖励构建层:奖励信号是强化学习的“方向盘”,直接决定模型的学习方向。Pyromind在这一层提供了生成式的奖励构建能力,既可以支持面向准确性的奖励生成建模,也可以面向偏好建模,帮助企业针对不同任务目标,更高效地设计出适配的奖励机制。
-
无感持续训练层:这是最核心的一层,目标是将“训练”和“上线”的过程隐藏在用户视野之外。系统会在日常使用中自动收集会话信息、学习用户习惯,并在后台完成持续训练;训练完成的模型会自动发布为推理端点,通过灰度切流平滑地接管线上Agent。用户只需要设定预算上限,就能在预算范围内坐享Agent效果的持续提升。
在这三层能力之外,Pyromind还配套了一套完整的基础设施,包括弹性开发环境、安全仿真沙箱、高性能推理部署和统一存储底座,确保数据、模型和训练任务能在整个平台中顺畅流动。
也正是在这个意义上,Pyromind成为了最早将Agent后训练产品化的企业之一。其核心交付的是一个开箱即用的后训练平台框架,企业不需要自建强化学习团队、不需要反复趟坑,就能让Agent在上线后实现持续学习和改进。
这也是Pyromind与赛道上其他玩家的核心差异所在:传统云厂商和MaaS平台主要提供算力、推理服务或轻量微调工具,Agent开发框架则帮助组织和执行任务,它们解决的是“如何把Agent跑起来”的问题;而Pyromind聚焦的是RL训练的全链路工程化与持续自进化,想要解决的是“如何让Agent跑起来之后越用越好”的核心问题。
从更长远的视角来看,Pyromind的愿景是让每一个Agent都拥有从任务中持续学习和进化的能力,让每一次任务执行都成为下一次能力提升的基础。
技术落地成果
“持续学习”的判断是否成立,最终需要靠落地实践来验证。Pyromind近期已经陆续推出了多项成果,为其技术路线提供了初步的验证:
其中一项核心成果是PyroDash,这是一套全新的范式,可以将小模型的低成本优势与大模型的高性能表现结合在一起。长期以来,行业普遍认为模型的性能和成本难以兼得,但PyroDash证明,通过精准的后训练与模型协同优化,完全可以在极低成本下实现甚至超越大模型的表现。
在五项数学推理基准测试中,PyroDash不仅将平均准确率提升至超过纯大模型的基线水平,还大幅压低了推理成本;在偏重成本的配置下,总成本可以降低九成以上。对于需要长期高频调用大模型的Agent场景来说,这意味着一条更经济、更可持续的技术路径。目前PyroDash的模型、数据集与测试代码均已开源。在这一新范式下,大小模型不再是互斥关系,而是可以协同进化;随着落地场景的逐步扩展,后训练也将自然延伸并演进为Agent的持续学习。
另一项成果R2VLA,则将“从经验中学习”的思路延伸到了物理世界。机器人AI进入真实产线的第一步,往往不是直接部署模型,而是需要先获取一批可用于后训练的高质量真机动作数据。过去这类数据主要依靠人工遥操作采集,不仅效率低下且成本高昂。
R2VLA的解决方案是让产线上已有的规则系统充当“老师”,在真实设备上自动生成动作轨迹,再经过时间对齐、自动打标、质量筛选和后训练,形成一条自驱动的数据管线。据介绍,这条管线可以连续24小时零人工运行,将整体数据采集时间降低50%以上。本质上来说,R2VLA将传统规则系统转化为了AI的“数据工厂”。
更关键的是,当模型上线后,产线仍会持续产生新数据并回流到训练环节,实现下一轮的能力成长。这正是“持续学习”在物理世界中的具体印证。
从数字世界的推理成本优化,到物理世界的数据生产革新,PyroDash和R2VLA指向的核心逻辑高度一致:无论是屏幕中的数字Agent,还是产线中的物理Agent,都可以被纳入同一套“持续学习”的框架中,从每一次运行中获得成长。
这背后也体现了Pyromind更深层的愿景和对下一代Agent的长期判断:持续学习不该是某一类Agent的专属能力,而应该是所有Agent的通用底座。数字世界和物理世界的形态或许迥异,但“让Agent从经验中变强”的核心逻辑,可以共享同一套技术方法论。
这些成果,正是Pyromind将这一宏大愿景逐步落地的开端。
支撑这些成果的是一支小而资深的团队。据了解,Pyromind的核心成员来自阿里云、字节等大厂的资深工程师团队,成立至今已完成千万级美元融资,投资方包括高瓴创投、百度风投、蓝驰创投、Atypical Ventures和HyperCompute等多家机构。
在技术能力验证方面,团队在ICRA 2026全球具身智能挑战赛中获得第7名,是国内唯一以“大模型微调+强化学习后训练”为核心技术路线进入该赛道全球前十的团队。在场景落地方面,Pyromind已经与优必选、欢网、华秋智联等多家客户完成合作签约,覆盖具身VLA、端侧GUI Agent和电路EDA等多个场景。
结语
AI Agent正在从演示阶段走向真实生产场景,行业竞争的重点也随之从“能否完成任务”转向“能否在任务中持续学习和提升”。这是一个仍在展开的行业命题,也是Pyromind从成立之初就锚定的核心方向。
总结来看,Pyromind是一家专注于Agent持续学习与后训练基础设施的AI公司,它通过AutoRL平台,将“让Agent从每一次任务中成长”的能力,变成了企业可以开箱即用的服务。其核心验证的判断非常简单:如果真实任务中的轨迹、结果和反馈能够顺畅地进入训练、验证与模型更新环节,那么任务经验就能稳定地转化为新的模型能力。
如果这一判断成立,那么衡量一个Agent的标准,或许就该从“它完成了多少任务”,转变为“它从这些任务中学到了多少”。而Pyromind想要做的,正是让每一个Agent都拥有这种从工作中持续成长的能力。一个AI持续进化的未来,似乎正在我们眼前徐徐展开。

