马卡龙发布Mint Recursive 企业级模型后训练推理平台

当前企业在使用大模型的过程中,普遍需要适配自身业务标准且能够持续更新的模型版本,围绕模型训练、部署和迭代的持续服务需求也愈发凸显。针对这一市场需求,马卡龙(Mind Lab)正式发布了Mint Recursive平台,这是一款面向企业的模型后训练与推理托管服务。
- 从大模型后训练研究入手,开发了MinT等底层训练系统
- 依托这套系统完成了Macaron V1.1模型的训练与迭代优化
- 将内部成熟的训练链路整理为Mint Recursive平台,面向企业开放服务
从业务需求出发搭建底层训练系统
马卡龙的核心团队最初是为了给自有产品提供更好的长期记忆能力,围绕模型的后训练和部署开展了一系列研发工作。早在2025年,团队就针对Kimi K2等大模型开展后训练工作,完成了基础设施搭建,在64张H800显卡上实现了万亿参数模型的LoRA强化学习落地,相关实践还被行业关注报道。
在这个过程中,团队需要解决多GPU分片、通信优化和显存管理的难题,同时还要让不同训练任务共享算力资源又互不干扰。为此开发的MinT等底层系统,可以对不同任务的LoRA参数、梯度、优化器状态和模型版本进行隔离管理,同时共享常驻基座算力。
在同等资源配置下,原本需要依次执行的三个独立Qwen3-4B强化学习任务,改为并发共享资源后,总耗时从约3081秒缩短至1736秒,峰值显存保持不变。这一优化大幅提升了资源利用率,为后续按用量提供共享常驻基座的小批量LoRA训练服务打下了工程基础。
打造Macaron V1.1模型实践
Macaron V1.1以744B参数的GLM-5.3作为基座,针对聊天、智能代理、代码开发和生成式UI四个场景分别训练了2B参数的LoRA专家模块,最终模型总尺寸达到752B。
在模型训练过程中,数据处理、模型训练、效果测试和部署上线被整合为自动化流程,由Mint Recursive支撑,并构建了闭环的模型自迭代管线:从初始模型π₀开始,经过「观测表现→归因问题→生成优化方案→验证效果」的多轮循环,最终迭代到πₙ。
举个实际的发票核对场景为例:最初的邮件中标注的金额是12340.50美元,后续财务负责人在Slack中更正为11340.50美元,但旧模型没有识别到这条更正,仍按照原金额入账。模型复盘执行轨迹后,将失败原因归结为写入金额前缺少校验步骤。团队先通过规则测试验证了这一判断,随后生成了「查证更正内容→写入明细金额→核对汇总结果」的示范训练数据。升级后的V1.1模型可以准确识别到更正信息并更新入账记录,最终验证效果以实际入账结果为准。
这类问题归因的思路也被应用到通用场景优化中。比如在聊天模式中,用户明确表示想要先暂停交互,但模型仍继续追问,团队便将「及时终止对话」作为具体的训练目标。在生成式UI场景中,供应商对比页面虽然正确计算了价格,但没有直观展示低单价与高起订量之间的权衡关系,模型据此生成了更清晰的对比页面样本,优化后的版本改用并排图表展示对比信息。
在完成一系列后训练优化后,在同一组60道UI4A任务测试中,原始的GLM-5.3模型首次交付成功43道题目,而Macaron V1.1则成功完成了58道。这说明在既定任务和评测标准下,模型的首次交付表现有了明显提升,但新任务场景下的持续迭代能力还需要进一步验证。
将内部能力开放给企业
从马卡龙自身的长期记忆功能需求出发,团队已经将模型评测、数据处理、后训练和部署上线整合到了同一套系统中。Macaron V1.1正是这套系统的最新内部实践成果,而此次发布的Mint Recursive,则是将这套内部能力整理为企业可直接使用的托管服务。
据团队观察,不少企业都有类似的需求:先定义符合自身业务的基准测试标准,再整理或生成专属训练数据,开展后训练,对比优化前后的模型效果,部署新版本,并将线上用户反馈接入下一轮迭代流程。Mint Recursive将这些步骤全部整合在同一个平台中。
目前该平台支持GLM、Qwen、DeepSeek、Kimi、MiniMax等多款开源基座模型,同时覆盖监督微调、强化学习、全参数训练和LoRA训练等多种训练方式。企业可以通过API、Python SDK自主控制训练数据和训练方法,也可以与团队专家共同开展定制训练,或是在设定好训练目标、预算和约束条件后,交由平台自动完成迭代流程。所有训练记录、模型版本和推理部署都统一留存,便于后续对比、上线和回滚操作。
这里所说的「拥有」并非要求每家企业都自研基座模型,而是指企业可以拥有自己的业务专属数据、评测标准和基座上的LoRA版本,让业务经验在多轮模型训练中不断沉淀下来。
结语
马卡龙始终能够提前捕捉行业趋势,在非共识的方向布局,因此行业中流传着「质疑马卡龙,理解马卡龙,成为马卡龙,超越马卡龙」的说法。Macaron V1.1展示了这套系统训练优化模型的实际效果,而Mint Recursive则将这一能力开放给更多企业,帮助各个团队持续迭代适配自身业务的专属大模型。

