文章摘要
文章介绍了Macaron V1模型,它基于GLM5.2做后训练,将原生上下文扩展到2M。其核心设计MoL框架解决了“能力跷跷板”问题。经多场景测试,表现出色。技术上,LongStraw突破上下文瓶颈,还有MindForge及递归自我改进闭环。性能佳,推理快,但按API收费成本高,值得关注后续。

当市面上的新模型都在反复强调榜单分数、推理速度和参数规模时,我反而越来越看重另一个特质:稳定性。毕竟哪怕不是全能的水桶机型,只要能在高频使用场景里稳定输出,就远比反复切换免费模型要省心得多。

正赶上热门模型的额度迟迟不重置,我在刷到了这款刚公开的Macaron V1——它基于GLM5.2做后训练,主打超强的前端生成能力,还把原生上下文扩展到了2M,这也是我第一次见到公开的GLM5.2衍生模型。

MoL框架:解决能力冲突的新思路

这款模型最核心的设计是提出了MoL框架,本质上就是冻结基座模型的全部参数,所有的后训练都在LoRA空间里完成。换个通俗的说法,就像同一个公司的不同岗位员工共用一套基础知识库,但客服、项目经理、程序员和设计师各自保留了专属的专业能力。

这样做的好处非常明显:让相近的任务能力互相强化,而差异较大的任务则互不干扰,解决了之前模型常见的“能力跷跷板”问题——比如代码能力提升了,对话情商就会下降,反过来也是一样。之前我还一直怀念GPT5.4的均衡表现,直到看到了Macaron V1的设计思路。不管是日常对话、智能体调度、代码编写还是UI设计,每个场景的能力都能得到针对性的优化,不会互相拖累。

实际测试:从网页到多智能体聊天室

为了直观感受它的前端能力,我让它直接生成一个专业的模型介绍网页,没有额外限定技术栈,也没有调用额外工具辅助。仅仅十分钟左右,一个具备模块化设计、可视化图表,几乎没有AI生成痕迹的成品网站就完成了,完全可以直接部署上线。网站里的动画特效没有喧宾夺主,还嵌入了集成Agent的聊天对话UI,这是我在其他模型上用同样提示词从未见过的效果。

借着这个聊天UI的思路,我又尝试让它生成一个多智能体聊天室,只需要简单的三行提示词,要求搭建一个围绕AI未来讨论的“AI议会”。十几分钟后,结果就出来了:不同角色的智能体各司其职,统筹者、研究员、教育家和工程师都加入了对话,发言完全符合各自的人设,每轮讨论结束后还会自动生成总结供参考。看着这些AI角色互相辩论的场面,比自己单独和单个模型对话要有趣得多。

工程能力测试:从物理实验室到2048游戏

接下来我想测试它的工程能力和知识储备,让它创建一个引力粒子实验室的单页交互应用,要求只用原生HTML/CSS/JS,不依赖任何外部库。最终生成的项目完美实现了所有要求:画布上有100到300个动态粒子,中心有可拖拽的引力源,支持吸引和排斥模式,粒子碰到边界会柔和反弹,还限制了最大速度防止动画失控。哪怕没有调用任何额外工具,它还主动添加了内测功能,整体表现非常稳定。

为了进一步测试它的编码严谨性,我选择了经典的2048游戏作为测试项目——这个游戏看起来简单,但实际有很多容易踩坑的细节,比如连续四个相同数字的合并规则、单轮移动只能合并一次、无效移动不生成新方块等等。我直接给出了要求完整实现所有游戏功能的提示词,最终生成的游戏完全符合要求,支持键盘和触屏操作,有流畅的移动合并动画,还包含分数统计、最高分保存、游戏结束和胜利提示等完整功能,直接就能游玩。

大型项目重构:AI学习网站升级

最后的测试是让它重构我们一直在维护的AI学习网站LearnPrompt,要求把原本偏内容型的页面改成带有3D特效、可交互且能清晰展示课程体系的展示网站,允许它调用合适的工具辅助。它没有直接套用常见的科技网站模板,而是先读取了现有内容和项目规则,主动选择了Taste Skill作为视觉和交互的参考规范。

最终生成的页面用了大量展开、收缩和空间层级变化,把原本平面的内容组织成可探索的课程地图,浏览时有种逐层深入学习的过渡感,完成度远超我的预期。

技术细节:突破上下文瓶颈的LongStraw

聊完实际测试的体验,再说说它的技术亮点。Macaron V1的2M原生上下文是怎么实现的?团队推出了名为LongStraw的训练方法。目前强化学习训练的瓶颈通常卡在256Ktoken,因为模型需要同时记住当前的计算过程、对比多个候选答案、再整合经验更新参数,同时处理这三件事很容易耗尽显卡内存。

LongStraw的核心思路很直观:题目只读取一次并保存快照,后续只重播解题过程,把节省下来的内存全部用来支持更长的上下文。实际测试中,8张H20显卡就能把27B模型训练到2.1M token,32张H20显卡甚至能让GLM-5.2这种78层256路MoE的大模型跑通2.1M的上下文。

另外一个容易被忽略的亮点是他们的MindForge训练框架,把上线后使用的整套Agent环境完整搬到了训练流程中,不管是路由分发、工具调用还是内存管理,训练和上线的环境完全一致,这解决了长期以来训练环境和真实部署环境不一致导致模型上线后性能下降的老问题。

更有意思的是,他们还搭建了递归自我改进的闭环:模型自己出题、自己解题、审计解题轨迹、优化训练配置,再用优化后的数据集更新自身,更新后的模型又能生成更难的题目,形成了一个正向循环的迭代系统,这简直是左脚踩右脚起飞的正向循环。

性能与使用体验

从基准测试的结果来看,Macaron Venti在大部分赛道上都能和Opus 4.8、GPT5.5、Gemini 3.1 Pro打得有来有回,而且作为开源权重模型,用户可以自行部署。更难得的是,他们部署的GLM-5.2推理速度比官方版本还要快,这一点我在实际测试中也有体感。

不过目前它还是按API调用收费,长期使用的成本还是有点高,我已经在期待它推出订阅制的使用计划了,到时候肯定会第一时间订阅。

总的来说,Macaron V1是一款兼顾了能力上限和使用稳定性的模型,尤其是它的前端生成能力和多智能体交互表现,给我留下了很深的印象,值得关注后续的更新和定价策略。

以上内容不代表本平台立场,仅供读者参考