文章摘要
时隔16个月,Meta创始人扎克伯格公布30B稠密模型Muse Glimmer权重开放,可本地运行,后续还将开放Muse Spark 1.2权重。此次开源含完整权重、量化版本及加速组件。该模型开发围绕硬件适配,总参数量约296亿,经4-bit量化可在消费级设备运行,有性能损失。其搭载加速组件提升解码速度,并与其他模型对比评测,相关资源已上线供开发测试。

时隔16个月,Meta再次推出开源大模型动作。创始人扎克伯格亲自在社交平台公布了30B稠密模型Muse Glimmer的权重开放消息,明确表示这款模型可以在本地设备上运行。他同时预告,后续还将开放Muse Spark 1.2的模型权重,并在分享中点名了Alexandr Wang与MSL团队。

此次开源的内容包含Muse Glimmer的完整权重、两套4-bit量化版本以及配套的加速组件,整体采用Apache 2.0开源许可证。两套量化版本分别针对24GB和32GB的消费级硬件设计,其中适配24GB设备的版本采用了压缩率更高的K-Quant-17GB量化方案。

从训练路线来看,Muse Glimmer的开发全程围绕硬件适配展开,目标是将大模型的智能体能力整合进30B规模的稠密模型中,同时优化本地运行时的体积与延迟。预训练阶段,团队以Muse Spark的输出作为logit蒸馏的基础;中期训练阶段补充了更长上下文窗口、更密集的智能体任务以及更丰富的推理轨迹数据;后训练阶段则结合了监督微调、在线蒸馏与强化学习,让模型覆盖通用推理、代码编写与智能体任务三大核心场景。

这款模型总参数量约为296亿,内置一套专用的感知编码器,上下文窗口长度超过13万token。它支持将文字与图片交错输入,能够处理截图、图表与各类文档;在长任务执行过程中,可以自主维持执行计划、连续调用工具,并且在某一步执行失败后自动进行重试。

如果以BF16全精度运行这款30B模型,需要超过55GB的内存空间,想要部署到消费级设备上,量化是必经之路。经过4-bit量化后,模型的语言权重可以压缩到20GB以下,再加上KV缓存、感知编码器以及加速组件DFlash drafter,刚好可以满足24GB和32GB设备的运行需求。

量化方案也带来了可感知的性能损失:32GB版本的K-Quant-Dynamic在15项常见基准测试中的平均性能损失仅为0.2%,而24GB版本的K-Quant-17GB平均损失约为1%。

DFlash drafter加速方案

为了进一步优化本地运行速度,Muse Glimmer搭载了DFlash drafter加速组件。与传统模型逐字生成、每次仅预测一个token的逻辑不同,这套组件会先通过一个轻量模型一次性预测后续16个token,再由主模型进行批量审核,保留预测正确的结果,修正出现错误的部分,最终由主模型完成最终把关,大幅减少了逐次计算的等待时间。

实测数据显示,搭载DFlash drafter后,RTX 5090的平均解码速度从74.9 token/s提升至233.4 token/s,提升幅度达到原来的3.1倍;M4 Max的解码速度从23.7 token/s提升到37.8,M5 Max则从26.6 token/s提升至50.2 token/s。

Meta还将Muse Glimmer与Gemma、Qwen等模型进行了横向对比评测。在MCP Atlas、DeepSearch QA和SWE-Bench Pro三项测试中,Muse Glimmer的表现领先;而在OSWorld、SWE-Bench Verified和TerminalBench 2.1三项测试中,Qwen3.6-27B的得分更高。

目前相关开源资源已经上线,开发者可以通过官方渠道获取相关内容,进行本地部署与开发测试。

以上内容不代表本平台立场,仅供读者参考