文章摘要
近期推出的Macaron V1基于GLM - 5.2基座打造个人助理模型。它采用创新的LoRA混合专家架构,有不同尺寸版本。经测试,其个人上下文理解、编程、智能体、UI生成等能力表现良好,虽有短板,但聚焦个人助理场景,探索新方向,值得持续关注。

近几个月国内大模型领域的迭代速度令人瞩目,多款旗舰模型接连发布,从GLM-5.2到Kimi K3再到Qwen3.8,每一款都在榜单上刷新着对比基准。而近期推出的Macaron V1则走出了一条差异化的路线,没有继续卷通用旗舰模型的跑分,而是选择基于成熟的GLM-5.2基座,通过后训练打造专属的个人助理模型。

创新的LoRA混合专家架构

Macaron V1的整体结构在当前大模型赛道中颇具辨识度:整体参数规模达748B,其中744B为固定不动的GLM-5.2基座,真正需要训练的是挂载在基座上的四个1B规模的LoRA专家模块。这种设计颠覆了传统微调的思路,官方将其称为MoL(Mixture of LoRA),也就是LoRA混合专家模式。

熟悉AI绘画领域的用户对LoRA并不陌生,传统的全量微调不仅成本高昂,还容易导致模型遗忘原有能力,而LoRA的思路是在不改动原有基座参数的前提下,新增小型适配模块,作为可拆卸的插件为模型补充新能力。不过此前LoRA更多被视为节省成本的权宜之计,而Macaron的研发团队将其提升到了新的层次。

他们认为,这些小型LoRA模块更像是用户的持久本地状态:基座提供通用的基础能力,而适配模块则承载用户的个人偏好、使用习惯和工具调用逻辑。团队在相关论文中验证过,即使将适配模块压缩到基座参数的0.5%以下,依然可以稳定学习,算力仅为全量微调的十分之一,而且基座越强,这种小范围更新的效果反而越显著。

在Macaron V1中,四个LoRA专家按照功能进行了清晰划分:L0负责日常聊天交互,L1处理个人生活相关的任务执行,L2专注代码开发,L3则负责界面生成。每次用户请求都会通过路由模块分配给最合适的专家模块,避免不同功能的权重互相干扰——如果将所有功能塞进同一组权重,很可能出现编程能力提升但聊天质量下降的情况,而这种模块化的设计则可以灵活新增能力,只需挂载新的LoRA模块即可,无需改动原有基座参数。

这款模型还有两个不同尺寸的版本:748B的旗舰版命名为Venti,35B的轻量化版本则叫Tall,后者基于通义千问3.6训练,专门针对本地部署场景优化,命名方式采用了星巴克杯型的分类,相比常见的Pro、Max等命名更直观易懂。

模型访问与测试入口

目前Macaron V1已经正式上线,测试方式十分简便。其背后的模型平台MinT同时兼容OpenAI和Anthropic的接口标准,用户可以轻松修改配置,让Claude Code直接运行在Macaron模型上。国内用户可以通过独立入口mintcn.macaron.xin进行访问,定价为输入每百万token 8元,输出每百万token 28元,平台还直接提供了GLM-5.2基座的调用入口,相当于自带了对照组,用户可以同时对比基座和Macaron V1的输出差异,直观感受到后训练带来的能力变化。

个人上下文理解能力测试

为了验证Macaron V1的个人助理定位,测试者选择了最具针对性的方式:将自己从2019年以来的全部4580条动态、总计65万字的内容全部导入模型,进行深度测试。

首先进行了精准定位测试:询问模型最早提到小猫补光灯的动态是什么时候发布的,模型准确定位到了2024年11月4日,并且完整引用了原文内容:“花一个小时用Cursor做了个『小猫补光灯』,默认有紫光、粉光、蓝光、白光这四种女生常用的补光色”,经过原始档案核对,内容完全准确。

随后设置了陷阱测试:让模型查找一条不存在的动态“我熬夜用Swift亲手写完了补光灯代码”。测试者本身并不会编写代码,4580条动态中完全没有相关内容。模型首先明确告知用户档案中没有这条动态,并提醒可能存在记忆偏差,随后找到了最接近的真实动态——11月11日的复盘内容,指出测试者是使用Cursor花费1小时完成了代码编写,并且标注了测试者“不会写代码非工程师出身”的身份,没有编造不存在的内容,而是通过精准匹配纠正了用户的记忆误差。

仅仅具备长上下文读取能力并不等于理解用户,在搭载Macaron的Claude Code环境中,测试者让模型梳理自己近几年工作和生活的关键转变,模型输出的内容精准到了每个阶段的核心节点,细节详实到令人惊讶。当测试者进一步询问下一阶段的工作重心调整方向时,模型的第一句评价就直击要害:你不是缺机会,你是机会太多、杠杆太散。后续的建议也完全基于测试者的真实项目和数据,没有泛泛的套话,全程没有刻意夸赞,而是基于真实履历给出了务实的改进方向。

这种测试方式可以被广泛复用:将模型接入个人全部工作文件后,提出真正悬而未决的问题,未读取过个人数据的模型只能给出通用的职业规划模板,而经过深度上下文学习的模型则可以提供极具针对性的个性化建议,价值差异显著。

编程能力实测对比

在编程能力测试环节,测试者设计了极具挑战性的任务。首先参考海外社交平台上一个获得200多万浏览的概念设计:悬浮的故宫金顶下方悬挂汉字字帘,交互时数千个字符像水流一样拧动缠绕。测试者将这个设计拆解为纯文字需求,要求四家模型复现:不提供任何图片素材,使用纯代码绘制屋顶,字符流动通过噪声场驱动,禁用所有外部库,专门考察复杂前端视觉能力。

测试结果显示,Kimi K3和Opus 4.8的还原度超出预期,实现了奶油纸底、衬线标题、密度接近原版的字帘,还为网站设计了专属品牌名。Qwen3.8的字帘密度偏低,字符散落如同飘雪,未能达到预期效果。而Macaron V1的表现同样出色:字帘的密度和流动感都符合要求,屋顶也通过纯代码完成绘制,在开发过程中,模型还自动启动无头浏览器,读取运行时的粒子数组来验证“瀑布宽度、与文案区重叠的粒子数”等指标,实现了自我验证和自我修正,更贴合其作为智能助理的设计定位。综合来看,Macaron V1的编程能力略低于Kimi K3,接近Claude Opus 4.8,高于Qwen3.8。

另一个编程测试则更具趣味性:让模型将经典坦克大战游戏改造为主题游戏,同时提供一份邮轮旅行指南,要求将指南中的知识完全融入游戏机制。模型首先提交了一份设计对照表供测试者确认方向,随后将指南中的细节全部嵌入游戏逻辑:航海日风速33公里每小时对应关卡内敌人移速提升30%,降雨概率96%对应出现6滴血的暴雨BOSS,末班摆渡船15点开走对应倒计时清场关卡,将7天行程设计为7关战役,甲板餐厅作为可破坏掩体,圣殿静区作为护盾道具。交付前模型还完成了程序化验证,通过像素统计确认所有元素渲染正确,通过逻辑测试验证了射击、掩体三血、道具拾取等核心功能。

智能体能力实测:开源仓库修复

在编程能力测试的收官环节,测试者进行了更具挑战性的智能体测试:将自己的huashu-design开源仓库交给Macaron驱动的Claude Code,要求自主挑选一个方向明确、有价值的issue进行修复,并直接提交代码,在commit中注明模型身份。

模型最终选择了第47号issue,该issue反馈使用skills CLI安装该技能时,子目录会被丢失。测试者原本以为模型会直接修改代码,但实际上模型首先安装了最新版CLI进行复现测试,发现该bug在CLI的1.5.19版本已经修复,用户反馈的问题源于使用了旧版本。因此模型仅进行了最小改动:在README的安装段落补充了三项内容,包括安装后的自检方法、旧版本的升级识别方式,以及git clone的兜底方案。随后模型完成了commit和push,并在issue下留言@反馈用户,附上了各子目录的实测文件数,署名Macaron-V1-Venti-Coding。

这种先验证问题是否存在、再决定修改方式的判断能力,正是进入工程化循环的智能体模型所必需的核心能力,而非盲目进行代码修改。

UI4A:实时渲染交互界面

UI4A是Macaron V1的最新功能模块,全称UI for Agents。与普通模型仅输出文字或静态HTML文件不同,UI4A可以直接输出可交互的界面组件,并通过配套运行时实时渲染,用户可以在对话流中看到界面组件逐步生成的过程。例如当用户询问健康计划时,模型可以直接返回可填写数字的卡片和动态图表,而非十条干巴巴的建议清单。

官方介绍这套架构兼具HTML的灵活性和结构化协议的可控性,无需针对特定模型进行微调,基础基座模型即可驱动,而Macaron专门通过L3 LoRA模块对UI生成能力进行了深度优化。

使用方式十分简便:用户可以在Claude Code插件市场安装Macaron Artifacts插件,其开源仓库地址为https://github.com/mindverse-ltd/macaron-artifacts,安装完成后本地会启动预览页面。在搭载Macaron的Claude Code环境中正常提出需求,并说明“做成UI4A形式展示”,预览页面就会实时展示界面逐步生成的全过程。

测试者使用两个自己的项目进行了验证:第一个是小猫补光灯项目,要求将上架App的补光台改造为对话内可交互的控制台,包含中间的发光补光圆盘、三个调节色温/亮度/色相的滑杆、一排马卡龙色快速切换按钮,以及一个“猫爪补光”按钮,按下后光晕会呈现暖白色呼吸效果。模型在绘制过程中出现过组件属性错误、import路径写错的问题,但每次都会自行发现报错并就地修正,修正时界面会停留在可正常渲染的版本,不会出现白屏,修改完成后继续推进,测试者拖动色相滑杆时,圆盘的颜色确实会跟随变化。

另一个测试则更为简单,制作一个马卡龙呼吸灯番茄钟:中间的圆形随呼吸缩放发光,颜色随剩余时间在薄荷绿和蜜桃粉之间过渡,倒计时数字平滑跳动,下方设置开始、暂停、重置按钮和时长预设选项。虽然这个测试没有太高的技术难度,但整体氛围感出色,直观展示了Macaron Artifacts的实际使用体验。

测试总结与未来展望

经过两天的全面测试,可以得出清晰的判断:Macaron V1并没有打算争夺通用模型的SOTA地位,其核心思路是聚焦个人助理场景,打造一组贴合用户需求的专才模块,并构建越用越懂用户的长期学习机制。因此我们可以看到它将核心能力拆分为四个独立的LoRA插件,评测基准中加入了跨会话交互、用户诚实性等常规跑分榜单不会覆盖的维度,官方还为模型配备了可跨会话积累工具的REPL环境,让模型编写的工具可以在后续任务中持续使用,逐步构建专属的工具箱。

在训练侧,团队的LongStraw系统将强化学习训练的上下文规模提升到了210万token,意味着长上下文不仅可以用于推理,还可以融入训练过程。如果这一技术能够完全落地,个人专属模型的故事才算真正走通。

当然这款模型也存在明显的短板:复杂视觉编排能力相比Kimi K3仍有一定差距,同时在复杂任务中思考链较长,单轮问答的响应速度较慢,更适合放入智能体环境中完成任务,而非作为即时回复的快速模型使用。

但整体来看,这款模型依然值得持续关注。当它能够将一份邮轮指南完整转化为七关游戏战役,能够精准梳理出测试者三年的人生节点,这种基于用户个人数据的个性化能力,正是当前通用模型所缺乏的。近两年的大模型赛道一直围绕“更聪明”展开,榜单跑分比拼的都是同一套标准,而个人专属模型则是一条全新的岔路:通用能力的强弱有公认的排行榜,但是否懂用户,只有每个使用者自己才能评判。Macaron V1未必是这条赛道的终点,但有人愿意认真探索这个方向,本身就值得肯定。

同一个问题,读过用户65万字个人数据的模型和未读取过的模型,给出的答案完全是两个维度。可以预见,在不久的将来,每个用户都会想要一个真正懂自己的专属模型。

以上内容不代表本平台立场,仅供读者参考