文章摘要
当前主流大模型存在核心局限,完成预训练后呈静态状态,无法持续学习,在企业级场景会带来成本损失。Mind Lab团队推出的Macaron V1围绕持续学习设计,采用LoRA强化学习技术,落地Mixture of LoRA架构。该产品发布后营收增速快,改变售卖逻辑。持续学习是大模型赛道的核心方向,Mind Lab已取得领先。

当前主流大模型普遍存在一个核心局限:完成预训练后就进入静态状态,此前学习到的内容无法在后续交互中留存,每一次调用都像是从零开始。无论是个人用户还是企业客户,反复和同一个模型API交互一年,第一千次调用和第一次没有任何区别,模型不会记住历史对话,也不会随着合作加深更理解用户的专属需求。随着Agent技术的普及,这个问题愈发凸显,持续学习已经成为大模型下一个必须突破的关键瓶颈。

「AI现在不缺品位和直觉,它缺的是持续学习的能力。」行业内的这句评价,精准点出了当前大模型的核心痛点。而有一家团队已经在这条赛道上迈出了扎实的步伐,他们推出的Macaron V1,整套架构完全围绕让模型在使用过程中自主学习、迭代升级设计,将理想化的持续学习理念变成了可落地的商业化产品。

静态模型的普遍困境

这种静态调用的模式,在个人使用场景中或许只是略显不便,但在企业级场景中则会带来实实在在的成本损失。科研团队、复杂流程的工业企业,往往掌握着大量专业领域的核心数据,通用大模型很难天然适配这些细分任务的需求。但这些企业又不愿意将核心数据交给第三方基座厂商进行重新训练,既要承担数据泄露的风险,又要支付高额的训练成本,这个市场缺口长期以来都没有得到有效的填补。

聚焦持续学习的技术选择

Mind Lab的核心思路非常直接:大模型不应该是训练完成就定型的静态工具,而应该在实际使用过程中不断学习,越用越贴合用户的专属场景需求。支撑这一思路的核心技术路线是LoRA强化学习,简单来说,这种技术可以用极低的算力成本,实现接近全参数微调的训练效果,无需每次都对整个模型进行全量更新。

这条技术路线并非Mind Lab一家在探索。OpenAI联合创始人、PPO算法的提出者John Schulman,现任Thinking Machines Lab首席科学家,曾在公开文章中指出,在绝大多数后训练场景中,LoRA的样本效率和最终效果与全量微调几乎没有差异,打破了大家对LoRA只是“低成本替代方案”的固有印象,他将这种情况称为“低遗憾区间”,认为其覆盖了绝大多数实际的后训练任务。目前全球顶尖的模型托管平台也都在向这个方向靠拢:Fireworks AI估值175亿美元,支持在单个基座模型上同时挂载数百个LoRA适配器,根据每次请求动态调用;Together AI完成8亿美元C轮融资后,已经将LoRA设为默认的微调方式。全球行业头部玩家的布局,证明了这条技术路线的可行性。

从理念到产品的落地实践

技术理念的可行性只是第一步,将其转化为成熟产品需要扎实的技术积累。Macaron V1采用了Mixture of LoRA架构,基座模型选用GLM-5.2,原生支持200万token的超长上下文。其旗舰版本Venti,基于744B的基座模型,搭配四个独立的10亿参数LoRA专家模块,分别负责对话交互、工具调用、代码生成和界面生成四大场景。

这样的拆分设计有着明确的逻辑:聊天、写代码等不同任务背后的思维模式差异巨大,如果强行将所有能力塞进同一组参数中训练,会出现能力互相干扰的问题,这边能力提升的同时另一边会出现退化。将能力拆分为独立的LoRA模块后,后续如果需要添加新的功能,只需要训练新的LoRA适配器插入即可,完全不需要改动已经训练成熟的模块,这正是持续学习在架构层面的直观体现。

能够将这套架构落地,离不开团队多年的技术积累。2025年12月,团队仅用十分之一的算力就完成了万亿参数模型的强化学习后训练,这项能力当时全球仅有两家团队实现,另一家正是John Schulman所在的Thinking Machines Lab。今年7月推出的LongStraw技术,在固定算力条件下,将强化学习训练的上下文窗口提升到了200万token,解决了此前推理可以支持百万级token、但训练只能卡在二十多万token的行业难题。再加上底层的MinT平台,执行器和学习器之间只传输LoRA适配器,无需搬运整个模型的权重,才能够支撑百万级的适配器目录管理。这些分散的技术成果,最终都服务于持续学习这一核心目标。

另外,国内成熟的开源模型生态也为项目提供了重要的助攻。Macaron-V1-Preview基于GLM-5.1,本次推出的Venti版本采用了最新的GLM-5.2,轻量版Tall则基于通义千问3.6。海外不少团队因为坚持自主开发开源基座,消耗了大量精力,反而拖累了模型能力的提升。而国内的开源模型在近两年已经达到了全球顶尖水平,站在这样的基础上开发LoRA强化学习方案,相当于省去了从零搭建基座的时间,可以将全部精力投入到持续学习的核心研发中。

市场给出的积极反馈

无论技术理念多么先进,最终都需要接受市场的检验。Macaron V1在今年6月底正式发布,7月启动商业化,仅用两周时间就达到了千万美元级的年化营收,成为当前模型API赛道中营收增速最快的企业之一。这个数字本身已经足够亮眼,但更值得关注的是其落地的速度——仅仅两周,就证明了持续学习这条技术路线在商业上是完全可行的,并非停留在论文中的概念。

更重要的是,Mind Lab正在改变大模型的售卖逻辑:客户不再只是购买token调用量,而是同时购买模型在自身专属场景中持续学习和迭代的能力。这恰好解决了文章开头提到的静态模型痛点,将一次性的调用交易,转变为持续升级的长期合作关系。目前团队已经与头部手机厂商、耳机品牌韶音、AI硬件初创公司Odyss建立了合作关系。团队内部曾提到,他们希望让模型训练这件事,最终变得和调用模型一样简单,让会使用token的用户,就能轻松完成模型的定制训练。

行业趋势的印证

提到持续学习,不得不提到强化学习之父Richard Sutton的经典文章《经验时代》,他指出下一阶段AI的能力提升,不会主要依赖于吸收人类已有的标注数据,而是来自智能体在真实环境中的长期行动、反馈和持续学习。这几乎完美契合了Mind Lab的技术路线。有意思的是,近期Richard Sutton也传出了创业的消息,他的新公司Oak Lab,同样聚焦于低成本、高效率的持续学习模型。

一位年近七十的理论奠基人选择在这个时间点入局创业,本身就足以说明问题:静态模型的壁垒正在被打破,持续学习将成为大模型赛道的下一个核心方向。而Mind Lab已经在这条路上跑出了看得见的领先距离。

以上内容不代表本平台立场,仅供读者参考