LoRA赋能持续学习,Mind Lab推动AI模型“最后几公里”落地

仅通过修改4B参数完成后训练,Macaron-V1不仅实现了对基座模型的反超,还在12项基准测试中拿下6个SOTA成绩。这款由团队推出的模型,商业化落地仅两周就实现了1000万美元的ARR,展现出极强的市场潜力。
Macaron的背后是一支深耕AI领域的创业团队。其创始人是连续创业者,曾从顶尖高校休学,先后打造过AI互动故事平台与Personal Agent应用,后者上线当天便登顶海外应用榜单。2025年10月,团队正式成立,规模约30余人,核心成员来自全球顶尖企业与高校,联合创始人曾与合作者共同发表过行业标志性论文,团队的技术路线与图灵奖得主、强化学习之父提出的经验驱动型AI方向高度契合。
成立以来,团队母公司累计获得6000万美元融资。2026年初,团队完成由一线战投领投的近5000万美元A轮融资,多家专业机构与老股东追加跟投,投资方涵盖国内顶尖科技与投资机构。
早在2023年,团队核心成员就埋下了技术路线的伏笔——当时他们提出,想要提升智能体的任务表现,与其依赖复杂的提示词工程,不如将针对性数据直接融入模型训练。这一思路最终导向了对持续学习与后训练的专注,而这一方向也成为当前AI行业的核心共识之一。
当前通用大模型普遍存在适配场景有限的问题:模型训练完成后参数固定,无法针对具体场景动态调整,而全参数微调的成本又极高。如果仅通过复杂的任务框架适配不同场景,又会消耗大量Token,导致推理速度变慢,无法从根本上解决垂直场景的适配需求。
基于信息论的强化学习范式,当模型参数足够大且足够稀疏时,在垂直领域使用LoRA进行训练,就能达到接近全参数训练的效果。2025年底,团队在万亿参数MoE模型上完成了端到端LoRA强化学习训练,仅用64张专业显卡就实现了接近全参数训练的效果,GPU消耗仅为传统方案的10%左右。这一成果让团队成为国内首家在万亿参数规模上跑通LoRA-RL的团队,全球范围内仅少数海外团队具备类似能力。
实现万亿参数的强化学习并非易事:强化学习对基础设施精度要求极高,若训练与推理精度不一致,会导致偏差漂移,最终无法收敛。为此,团队设计了一套混合协同并行引擎,整合多种并行技术,让LoRA能够在复杂架构上稳定运行;同时引入特殊采样方法修正分布差异,解决了训练与推理不匹配的问题。
随着后训练的重要性不断提升,团队在2026年初推出了LoRA训推基础设施平台,为客户提供大模型后训练全流程解决方案。该平台不仅能提供算力支持,还支持用户训练自有LoRA,可管理上百万个LoRA模型,在训练、评估、部署与回滚过程中仅传输轻量的适配器文件,实时加载速度提升近十倍。
Macaron系列预览版率先验证了技术路径:在主流基座模型上挂载多个小参数LoRA专家模块,仅通过预览版模型就实现了对基座模型的反超,性能领先一众前沿模型。2026年中,团队正式发布并开源正式版本,推出两个适配不同场景的模型:旗舰版基于顶级基座做后训练,总参数规模接近750B,其中仅4B为可调整的LoRA参数,分别负责四类核心能力;轻量版则面向本地部署场景,基于另一主流基座优化,总参数仅50B。两个版本均原生支持超长上下文。
正式版模型均采用多LoRA协作的设计,团队通过实验发现,单一LoRA无法全面提升模型的所有能力,但多个LoRA协同工作时,整体性能会大幅提升。团队曾使用数百份不同数据分别训练多个LoRA,将其挂载在同一模型上协作完成任务,结果显示:参与协作的LoRA数量越多,模型任务表现呈对数线性增长;数百个LoRA协作的效果比单个LoRA提升约四分之一。这一发现让团队确认,混合LoRA架构是突破智能上限的有效路径,后续团队还将持续探索LoRA协作的最优数量、分工机制与触发条件。
团队负责人表示,现阶段持续学习主要有四类解决方案:一是利用对话上下文,让模型在对话窗口内反复理解用户意图;二是通过外挂知识库构建记忆,但随着记忆量增加,数据库会快速膨胀,模型能力直接依赖检索效率;三是使用复杂的任务框架,但这类方案会消耗大量Token,导致速度变慢;四是直接修改模型参数适配场景,从底层打造垂直模型,LoRA就属于这一类别。“只有明确场景需要额外学习时,我们才会启用LoRA模式。”负责人解释道。
目前团队的业务主要分为三部分:一是持续推进基础设施系统与后训练前沿研究;二是迭代C端产品,这款生活场景个人Agent支持用户通过自然语言生成专属小应用,基于长记忆与日常对话提供生活辅助与情感陪伴,积累的用户交互数据也能反哺模型训练;三是B端客户服务,团队为多家云服务商部署更具性价比的训练基础设施,同时提供训练平台与持续学习LoRA模型服务。其中智能硬件场景是持续学习落地的天然场景,不同用户积累的差异化数据,能够帮助模型实现垂直领域的个性化持续学习。
在基础模型调用服务之外,团队未来还将为客户提供“持续学习”选项:勾选后,模型在使用过程中表现优异的交互数据会沉淀为专属LoRA,持续训练出更适配客户使用场景、输出正确率更高的模型,LoRA甚至可以实现每天更新一个版本,精准匹配用户需求与场景。
尽管商业化已经取得初步成果,但团队表示,商业化只是现阶段对技术落地的验证,并非核心目标。目前团队的ARR已经达到千万美元级别,仍有很大增长空间,但团队不会将所有算力都投入订单,而是将重点放在研究上。团队目前有三十余名成员专注于基础架构与前沿研究,负责人表示:“推动LoRA的进步是我们想要扮演的角色,我们要解决模型预训练完成后的最后几公里问题。”LoRA作为一个技术方向,仍有很多待探索的细节,比如线性注意力优化、上下文拓展、LoRA协作机制等,都需要持续深耕。


