QCon 2026上海站启动 AI动态汇总:DeepSeek多模态/英伟达涨价

近期,Meta的AI研究部门推出了一款全新的开源本地智能体模型Muse Glimmer,这款拥有300亿参数的模型采用Apache 2.0许可证开放权重,专门针对端侧运行场景设计,让开发者无需依赖云端API,就能在消费级GPU和工作站上直接运行自主智能体、复杂工具调用、本地编码,以及以大语言模型作为评判者的评估任务。
为了在有限的内存资源下实现出色的智能体执行能力,研发团队沿用了旗下旗舰模型Muse Spark的多阶段训练方案:
- Logit蒸馏预训练:通过匹配的预训练数据集组合,从Muse Spark迁移基础推理能力
- 中期训练:使用包含复杂推理轨迹、交错文本与图像数据、多步工具调用轨迹的长上下文序列来扩大训练规模
- 后训练对齐:结合监督微调、同策略蒸馏和强化学习,优化代码生成、工具使用和结构化规划等多个领域的性能表现
Muse Glimmer搭载了一个专用的18亿参数感知编码器,可以原生处理交错的多模态输入,让本地智能体在执行代码或自动化工作流时,能够直接理解截图、图表和文档等非文本内容。
未经压缩的300亿参数模型通常需要超过55GB的显存,无法在标准消费级硬件上运行。为解决这一问题,Muse Glimmer通过两项核心运行时优化降低了硬件门槛:
首先是4位动态压缩(K-Quant)的动态量化技术,将模型占用空间降至约17GB至20GB,这样就能在24GB至32GB的GPU/NPU内存中留出足够余量,用于键值缓存、感知嵌入和推测解码的开销。
其次是DFlash推测解码,这款模型不再单次预测单个token,而是和基于DFlash架构的轻量级配套“草稿”模型协同工作,由草稿模型生成包含多个token的序列块,再由基础模型并行验证。在Apple Silicon M4/M5 Max以及NVIDIA RTX 5090等硬件上,这种方式可以将生成吞吐量提升最多3.1倍。
- Muse Glimmer经过针对性训练,可以执行长期规划并处理意外故障状态。当API调用或终端命令返回错误时,模型会自动诊断故障并尝试其他执行路径,不会直接终止任务。它支持OpenClaw等主流智能体框架,还提供可调节的推理强度参数,让开发者能够在执行速度和决策质量之间找到平衡。
在SWE-Bench、DeepSearch QA、τ-Bench和MCP-Atlas等标准化基准评估中,Muse Glimmer在300亿参数级别的领先开放模型中取得了较高的成功率。和Gemma 4 31B、Qwen 3.6 27B等同类模型相比,它在多步工具调用可靠性和故障恢复能力上表现更出色,同时在通用编码和推理能力方面保持了竞争力。
目前该模型的权重已经在Hugging Face平台上线,Meta联合开源社区为llama.cpp、ExecuTorch、Apple MLX、Ollama、LM Studio和vLLM等流行的本地运行框架提供了原生支持,同时还通过PyTorch的TorchTitan框架支持微调工作流。
Muse Glimmer标志着本地AI智能体在兼顾可行性和高性能上迈出了重要一步,既可以保护数据隐私,又能维持低延迟的运行体验。如果要在本地机器上高效运行该模型,建议使用配备24GB至32GB统一内存或显存的系统,比如搭载M4/M5 Max芯片的Mac,或是配备RTX 5090、RTX 4090等现代GPU的PC,这样的硬件配置可以在加载量化后的4位权重之外,为长时间智能体会话所需的视觉编码器、DFlash草稿模型和KV上下文缓存提供充足的内存空间。

