文章摘要
Meta近日推出AI编程智能体Muse Code测试版,加入AI编码智能体赛道。它基于Muse Spark 1.2大模型,支持macOS和Linux系统,能完成软件工程全流程任务。亮点在于轻量化架构、运行时日志机制和内置指令。Muse Spark 1.2经多方面优化,在多项评测中表现优异,有不同版本收费标准。

AI编码工具赛道又添重磅选手,Meta正式推出自研的终端AI编程智能体Muse Code,直接向现有头部产品发起挑战。

近日,Meta官方推出了Muse Code的测试版本,这是一款运行在终端环境中的AI编程代理,底层依托全新升级的Muse Spark 1.2大模型打造。公司创始人公开表示,该工具能够在大型代码仓库中完成全流程的软件工程任务,包括项目分析、代码修改规划、功能代码编写、配套工具运行以及最终结果验证等多个环节。

这也意味着,Meta正式加入了AI编码智能体的热门赛道,与其他头部厂商的产品展开直接竞争。

产品上线后立刻引发了开发者社区的广泛讨论,有网友针对开源方向提问,询问Muse Code是否会采用开源策略,相关负责人也随即回应称,后续会公布更多相关细节。

目前Muse Code支持macOS和Linux系统,用户仅需通过一条终端命令即可完成安装。当用户提出完整的开发需求时,比如修复跨多个模块的程序漏洞、新增某项功能模块,或是对大型项目进行整体重构,Muse Code会先完成代码库的理解与分析,随后制定执行计划、修改对应代码文件、运行配套测试,并根据测试结果动态调整后续步骤。

Muse Code:Meta首款专业AI编程智能体

Muse Code采用了轻量化的主智能体循环架构,搭配一组常驻运行的异步后台智能体来强化核心能力。这些专用后台智能体不会针对单次任务临时启动,而是在整个会话周期内持续运行,能够有效减少重复的信息收集流程,自主完成后续执行步骤并判断何时向主智能体反馈结果。

这种常驻运行的设计不仅降低了系统延迟,也减少了主智能体在处理复杂多步骤任务时对人工引导的依赖。

Muse Code的核心设计亮点有两个:

第一是可靠的运行时日志机制。工具会将所有的模型调用、工具运行、审批操作以及代码修改操作记录在本地事件日志中,这套日志作为唯一可信的数据源,能够完整复现整个执行流程,即使程序意外崩溃,也可以从中断位置恢复执行,不会因中途故障导致任务流程中断或偏离原定方向,因此能够很好地支持运行周期较长的复杂开发任务。

第二是内置的专用操作指令。Muse Code默认提供了多个实用的内置技能:使用/plan指令可以将用户提出的整体任务拆解为可审批的分步计划;/grill指令会对生成的执行计划进行多轮压力测试,直到方案的可靠性达到预设标准;/goal指令则会围绕用户指定的目标持续推进,直到任务成功完成。

Muse Spark 1.2:支撑智能体的升级大模型

作为Muse Code的底层引擎,Muse Spark 1.2是在1.1版本基础上针对编程场景全面升级的大模型,重点优化了代码生成、复杂问题调试、大型代码库理解以及端到端开发流程的表现。在训练过程中,Meta大幅提升了编程任务相关的算力投入,同时扩展了训练环境的多样性,并且保留了模型在通用智能体场景下的核心能力。

在针对智能体终端任务能力的评测基准Terminal-Bench 2.1中,Muse Spark 1.2的表现仅略逊于顶级模型Opus 5(max);在DeepSWE 1.1评测中,该模型同样表现亮眼,仅输给Opus 5(max)和GPT-5.6 Terra(max)。DeepSWE评测包含113项真实开发任务,覆盖91个代码仓库和TypeScript、Go、Python、JavaScript、Rust五种主流编程语言,每项任务都配备了人工编写的功能验证程序和回归测试套件。

在Meta内部代码库构建的Meta Internal Coding Bench评测中,Muse Spark 1.2同样仅弱于Opus 5(max),该基准包含440项基于真实内部拉取请求构建的任务,涵盖漏洞修复、功能开发、代码重构、代码清理等多种软件工程工作。

Muse Spark 1.2的优异表现离不开三项核心技术优化:

首先是与Muse Code的协同训练。模型和智能体采用联合训练的方式,确保两者配合时能够充分发挥性能,提供更流畅的编程体验。训练过程中引入了基于拒绝采样的智能体运行轨迹优化方案,围绕目标执行、上下文压缩和子智能体协作等环节优化训练方法,同时将Muse Code的工具集纳入训练数据,提升模型与智能体运行框架的兼容性。

其次是针对长时程开发任务的专项优化。模型针对完整代码仓库生成、大型端到端项目开发、自动化研究等长周期编程任务进行了大规模训练,通过任务规划安排执行顺序,通过目标条件约束保持执行方向,并借助上下文压缩技术保留推进任务所需的关键信息,避免冗余信息干扰核心流程。

最后是自我迭代的训练机制。Meta使用上一代的Muse Spark 1.1生成高难度的编程环境和指令遵循模板,再由模型评估候选方案对各项要求的满足程度,以此构建出可规模化扩展的训练数据集,这套自我改进机制让Muse Spark 1.2在复杂指令遵循能力上相比上一版本有了显著提升。

使用成本方面,Muse Spark 1.2分为两个版本:普通版本的输入Token收费为1.25美元每百万Token,缓存输入为0.15美元每百万Token,输出Token收费为4.25美元每百万Token;Contributor版本的输入Token收费为0.10美元每百万Token,缓存输入为0.002美元每百万Token,输出Token收费为0.20美元每百万Token。

以上内容不代表本平台立场,仅供读者参考