开源Macaron-V1:多模块协作推动大模型群体智能演进

当前主流的大模型在部署上线后往往面临一个现实困境:经过训练定型的模型很难自主吸收线上交互产生的新经验,用户反复纠正的偏好、智能体重复遇到的失败场景,都无法自然转化为模型的新能力。若要让模型更新能力,最直接的全量重训方式,对于千亿甚至万亿参数的模型来说,成本高到无法频繁执行。
近期开源的Macaron-V1,正是针对这一痛点推出的解决方案:通过冻结庞大的基座模型,仅训练极小的附加模块,结合强化学习技术让模型能够在部署后持续将交互经验写入参数,实现低成本的能力迭代。
该项目由研究实验室Mind Lab推出,团队在智能体领域已有深厚积累。早在2023年,团队核心成员就参与开发了FireAct,首次探索了通过监督微调将智能体行为轨迹写入模型参数的路径,而Macaron-V1正是这一思路的延续升级——将一次性的监督微调替换为可持续的强化学习更新,并且将技术边界拓展到了万亿参数规模的模型上。目前全球能在万亿参数模型上跑通LoRA强化学习的团队屈指可数,Mind Lab正是其中之一,另一家则是前OpenAI CTO创立的知名团队。
Macaron-V1面向个人智能体场景推出了两个版本:旗舰版Venti总参约7480亿,基于744B的GLM-5.2基座,搭配四个各10亿参数的LoRA专家模块,原生支持200万token的上下文长度;轻量版Tall基于通义千问3.6,参数规模350亿,专为本地部署场景优化。此前团队还发布了预览版Macaron-V1-Preview,参数规模749B,搭载五个LoRA专家,正式版对模块结构做了优化整合。
核心设计:不重训基座,让小模块承载持续学习能力
让模型在部署后持续学习,主要有两类技术路径:一类是将经验存储在模型外部,通过提示词、上下文检索等方式加载,优点是灵活但成本随经验积累上升,且无法真正将知识内化;另一类则是将经验直接写入模型参数,让能力真正固化在模型内部,避免重复加载的开销。Macaron-V1选择了第二条路径。
为了避免全量重训的高成本,团队采用了低秩适配(LoRA)技术:在冻结的基座模型旁挂载参数量极小的可训练模块,其规模仅为基座的百分之一左右,训练过程中仅更新这些附加模块。在这里,LoRA不再是早期省显存的妥协方案,而是被重新定义为承载模型个性化、持续演化记忆的载体——基座提供通用基础能力,LoRA模块则负责存储特定场景下的用户偏好、专业技能和工具使用习惯。
经验转化为训练信号的过程通过强化学习实现:模型执行任务并获取反馈后,会根据结果调整LoRA模块的参数,让模型能够从每一次交互中持续学习,而非在部署后能力定格。Macaron-V1的Mixture-of-LoRA架构正是这一思路的落地:在冻结的GLM-5.2基座上,四个LoRA专家模块分别负责不同的任务场景:L0 Chat处理对话与指令遵循,L1 Agent负责长程复杂智能体任务,L2 Coding承担代码理解与软件工程工作,L3 UI则专注于界面渲染与界面驱动操作。新能力可以以插件式的LoRA模块形式加入,不会破坏原有模型的知识储备,不同模块还可以根据场景需求灵活组合。
实际测试效果:极简训练实现高质量产出
为了验证Macaron-V1的实际能力,测试团队在开发环境中配置了旗舰版Venti,并要求其生成一个3D世界。仅通过一句自然语言提示:「用Three.js从零造一个巧克力工厂花园世界:巧克力河、焦糖瀑布、糖果园、传送带、微缩工人,全部程序化生成,不许用外部素材,工人还要有真实的任务队列和路径网络」,十几分钟后就得到了一个可直接运行的完整3D网页。
生成的场景包含黄昏下的糖果小镇、冒烟的工厂、旋转的摩天轮,六个微缩工人沿着预设路网领取任务、搬运糖料、照看篝火,所有元素均由模型自主生成,无需额外补充提示或素材。这一成果证明,仅通过训练极小比例的LoRA参数,就能实现高质量的复杂任务产出。
低成本底气:万亿参数模型上算力仅为全量训练的十分之一
LoRA技术本身并非新鲜事物,早期多用于低成本的监督微调,但其能否支撑强化学习这种更复杂的训练任务,此前学界尚未有定论。2025年,前OpenAI CTO创立的团队通过研究证实:只要LoRA覆盖模型的前馈层和专家层且不超出容量限制,其在监督微调和强化学习场景下的效果都能追平全参数微调,且强化学习对LoRA秩的要求极低。
研发团队将这一技术拓展到了万亿参数模型上:在总参约1.04万亿、单次激活约326亿的稀疏专家模型上,团队成功端到端跑通了LoRA强化学习,算力开销仅为全参数强化学习的十分之一,且训练曲线平稳,未出现灾难性发散。团队还发现,通过配套的初始化方法,即使将可训练模块的秩压到极低,也能实现稳定训练。
这一技术路径的可行性不仅有官方研究支撑,相关训练框架的补丁已经并入多个主流开源训练项目的上游,配套基础设施也以开源形式对外发布,可供外部验证。对于Macaron-V1来说,这一低成本特性让持续学习从偶发的重活变成了常规操作,打开了全新的应用可能。
多模块协作:一个基座就能孵化群体智能
由于单次训练LoRA模块的成本极低,单个基座模型可以挂载多个独立的LoRA模块,每个模块学习不同的场景能力,再通过协作整合实现整体能力的提升,这就是群体智能的落地路径。
研发团队曾通过对照实验验证这一思路:从同一套300亿参数的开源模型出发,仅通过调整数据顺序和训练细节,训练出近200个独立的LoRA模块。在数学基准AIME24的测试中,单个模块的准确率为36.4%,而198个模块通过多数投票整合后,准确率提升至48.7%,显著高于单个模块反复采样的上限(约43.3%),也高于基线模型的37.3%。
Macaron-V1的正式版正是这一思路的产品化:预览版的五个LoRA专家模块被优化整合为四个,将特定场景的模块并入通用Agent专家,整体结构更简洁高效。团队还开发了专属基础设施,用于统一管理海量LoRA模块的训练、评估、部署和回滚,设计目标可支持百万级别的模块目录,让群体智能的规模化落地成为可能。
写在最后:持续学习是下一代AI的核心竞争力
Macaron-V1通过LoRA承载个性化记忆、强化学习实现持续经验写入、规模化模块管理实现群体智能,为大模型部署后的持续学习提供了完整且低成本的实现路径,所有关键环节都有公开研究和开源代码支撑。
当前大模型领域仍面临多个公认的挑战:如何在模糊反馈下稳定获取可靠的学习信号、如何避免新经验覆盖旧有知识、如何将大量模块的多样性转化为群体层面的能力。这些问题仍是整个行业的研究方向,但Macaron-V1已经给出了目前最完整的公开解决方案。
对于从业者来说,这一技术路线也带来了诸多启发:将适配模块视为可训练的持久状态而非单纯的显存优化手段、通过多专业化模块分工而非单纯放大单一模型规模实现能力提升、将模块的版本管理和回滚作为基础设施进行搭建。近期行业内多位专家也提到,当前AI不缺品味和直觉,真正缺失的是持续学习的能力,能让模型持续学习才算得上下一代模型。这与研发团队的判断高度一致——下一代智能的核心不再是单纯放大单一模型规模,而是通过递归自我改进实现持续后训练,以及通过多智能体协作实现专业化能力的组合。Macaron-V1正是这一方向的重要里程碑。


