Macaron模型:320字/秒速度+多专家协同能力展示

近期大模型领域的后训练优化赛道迎来新的突破,一支专注于基座模型优化的团队推出了全新的Macaron V1系列模型,通过针对性的后训练方案,让GLM5.2基座的能力得到了全方位的升级。
这支团队成立于去年12月,是国内少数完成对GLM-5.1/5.2系列基座进行全流程后训练的外部团队,此前就凭借高效的参数微调方案验证了技术可行性。
技术路线与模型架构
团队最初采用的是抽取约0.5%核心参数进行LoRA训练的轻量化微调路径,在早期项目中就实现了用64张H800显卡完成万亿参数模型的强化学习训练,证明了这套方案的高效性。
传统后训练容易出现能力冲突的问题,比如对话、编程、工具调用等能力一起训练时往往顾此失彼,团队因此独创了Mixture-of-LoRA(MoL)架构,在冻结的基座模型上挂载多个独立的LoRA专家模块,每个专家专注于单一能力方向,在隔离的适配空间中进行优化,彻底避免了不同能力之间的互相干扰。这套方案首先在GLM-5.1上推出了预览版Macaron-v1-Preview,正式版则将基座升级为GLM 5.2。
Macaron V1系列提供两款适配不同场景的变体:
- 旗舰 Venti(748B):基于原生支持1M上下文的GLM-5.2构建,通过4个1B规模的LoRA专家分别覆盖对话、智能体、编程、UI交互四大核心方向,能力切换由显式Router Tool控制,后续如果需要新增能力,只需要挂载新的LoRA模块即可快速扩展。
- 轻量 Tall(35B):基于Qwen 3.6进行后训练优化,专门针对本地部署场景做了适配优化。
除了核心的模型架构优化,团队还自研了LongStraw技术,将GLM 5.2的上下文窗口扩展到了2M,同时通过将共享提示词复用为常驻状态的方式,大幅降低了长序列推理的资源开销。
除了模型本体,团队还同步打造了三个关键配套工具,与模型联合训练形成完整的能力生态:
- UI4A:通用生成式UI架构,支持模型渲染交互式视图而非仅输出文本,不依赖特定基座,即使是未经微调的模型也可以通过该架构驱动交互界面,独立于Macaron系列模型的通用底座。
- REPL Harness:为模型提供持久的Python运行环境,模型可以通过save_tool自行编写自定义工具,再通过promote_tool将工具升级为跨会话可用的全局工具。
- MinT后训练平台:团队自研的训练基础设施,核心设计是Actor与Learner之间仅传递Adapter参数而非完整模型权重,完美适配MoL架构,支持百万级Adapter目录管理,可以端到端覆盖万亿参数规模的模型训练任务。
模型评测与实际表现
团队的核心目标是让模型能够在真实生活中切实提供帮助,实现长期的价值创造,为此他们自建了两套专属评测基准:
- Macaron ChatBench:针对智能体的基础能力设计,用于评测智能体在长上下文场景下是否能够对用户保持诚实,避免出现“先搞砸任务再道歉”的情况。
- Macaron LivingBench:模拟真实生活的沙盒环境,包含动态噪声、动态生存环境、动态用户三种相互关联的动态机制,用于评测模型是否能够持续理解用户需求、验证信息准确性、重新规划任务路径,在用户保持耐心的前提下完成任务,最终实现“完成任务并提供优质体验”的目标。
除了自建基准,团队也通过常规评测套件验证了模型的综合能力,实际测试中,这款处于内测阶段的模型推理速度非常出色,实测可以达到320字/秒的生成速度,团队相关负责人表示确实做了针对性的性能优化,但考虑到不同使用场景下的体验差异,没有过度强调这一指标。
在实际使用中,这款模型展现出了强大的落地能力,比如帮助用户快速迭代产品项目,完成UX优化和bug修复,还能实现多种创意开发场景:
- 编程场景:使用Three.js构建夜航船3D网页,实现第一人称乘船视角,两侧河灯随靠近时浮现对应诗句的效果,对比其他模型的同款prompt输出,Macaron V1的实现效果更为完整流畅。
- 智能体场景:从零构建混沌磁摆模拟器,模拟小球在重力、阻尼和三枚磁铁作用下的运动轨迹,并实时渲染分形运动区域。
- UI交互场景:支持可交互的3D魔方带步骤演示、数字绘画笔刷、3D可扫描二维码等功能,还可以解答关于3D二维码维度的专业问题。
测试UI4A架构可以通过官方推出的Claude Code插件Macaron Artifacts来实现,项目仓库地址为github.com/mindverse-ltd/macaron-artifacts。
接入Claude Code的配置方法
如果想要在Claude Code中调用Macaron V1,可以按照以下步骤配置:
- 打开CC Switch工具,选择顶部的Claude Code图标,点击右上角的加号,选择“手动添加”。
- Name字段可以自定义填写,比如Macaron-V1,Base URL、API Key、Model字段暂时留空,核心配置JSON如下:
{
"env": {
"ANTHROPIC_BASE_URL": "https://mintcn.macaron.xin",
"ANTHROPIC_AUTH_TOKEN": "sk-xxxx",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
},
"model": "macaron-v1-coding-venti"
}
团队理念与总结
从团队成立到跑通MoL架构,再到正式推出Macaron V1,这支团队始终坚持通过针对性后训练让模型持续变强,通过多专家协同的架构实现能力的灵活生长,为大模型的轻量化优化和能力扩展提供了新的可行思路。


