文章摘要
Meta推出智能编码解决方案,包括Muse Code框架与Muse Spark 1.2模型,降低开发者使用成本,也为Meta获取编码训练数据。该工具输入输出能力广,功能丰富,分标准和贡献者档位定价。其架构设计有亮点,能支撑复杂开发任务。第三方评测显示,其单任务成本低。贡献者档位设置吸引开发者提供数据,或带来行业变革,也促使开发者为代码与能力定价。

针对愿意开放自身工作数据供模型训练的开发者,Meta推出了全新的智能编码解决方案:命令行代理式编码框架Muse Code,以及背后搭载的高性能低开销模型Muse Spark 1.2。这套方案将大幅降低开发者的智能编码工具使用成本,同时为Meta获取稀缺的高质量编码训练数据提供了新的渠道。

产品核心参数与服务细节

这套工具的输入输出能力覆盖广泛,支持文本、图片、视频与PDF文件作为输入,单次处理上限可达1048576个token,输出格式限定为文本。在功能层面,Muse Code与Muse Spark 1.2组合支持六级可调推理级别,涵盖工具调用、结构化内容生成、网页搜索、上下文缓存,以及可跨会话持久运行的后台子智能体。

目前Muse Code仅面向macOS与Linux系统开放beta测试,Muse Spark 1.2则通过Meta Model API对外提供服务。其定价分为两个档位:标准档位下,每百万输入、缓存、输出token的费用分别为1.25美元、0.15美元、4.25美元,且提示词与输出内容不会被用于模型训练;贡献者档位则大幅降价,每百万输入、缓存、输出token仅需0.10美元、0.002美元、0.20美元,不过该档位下的提示词与输出内容将被用于模型训练。此外,网页搜索服务的收费标准为每千次查询2.50美元。需要注意的是,Meta并未披露该模型的参数量、底层架构、知识截止时间以及训练数据与方法的具体细节。

架构设计亮点

Muse Code运行于本地终端环境,当接收到软件开发任务后,系统会先制定执行计划,再逐步编写代码,并通过Muse Spark 1.2在每一个环节验证结果。Meta基于Muse Spark 1.1的训练数据优化了本次的模型,使其能够与Muse Code实现完美适配。相较于传统的单循环反复调用模型的方案,这套框架有三项核心设计差异:

第一,主智能体将任务分配给一组持久化的子智能体,这些子智能体在整个会话周期内持续保留,而非为每个任务临时创建与销毁。据Meta相关负责人介绍,子智能体将在隔离的工作树中并行编辑代码,这些独立的仓库工作副本可以避免多任务同时修改带来的冲突问题。

第二,由于子智能体长期运行,它们可以留存从代码仓库中学习到的上下文信息,无需在每次任务中重新推导相关内容,同时子智能体可以自主判断向主智能体汇报工作的时机。

第三,主智能体将所有的模型调用、工具运行、计划审批以及文件编辑操作都记录在用户本地的日志文件中。如果智能体运行崩溃,系统可以读取日志并从上次中断的位置继续执行,而非从头开始,这一设计能够有效支撑长时间运行的复杂开发任务。

此外,主智能体默认内置三个可直接调用的技能:/plan可以将用户的需求转换为需要审批的执行路线图,/grill用于检查计划中的薄弱环节,/goal则会推动整个工作流程直至达成最终目标。

第三方评测表现

独立第三方测试结果显示,Muse Spark 1.2的智能水平略低于当前的前沿模型,但它的单任务成本远低于多数同级甚至更高级别的竞品。

在综合了九项经济实用型任务的第三方综合评测机构的Intelligence Index评测中,将推理级别设置为xhigh的Muse Spark 1.2获得了57分,单任务成本为0.40美元,排名第六位,领先于推理级别为high的Grok 4.5(56分,0.36美元/任务),仅落后于推理模式为reasoning的Qwen3.8-Max(58分,1.13美元/任务)。相较于上月发布的Muse Spark 1.1(53分,0.29美元/任务),新版本的得分提升了4分。

在针对长文档推理能力的AA-LCR评测中,xhigh推理模式下的Muse Spark 1.2以83.3%的准确率击败了所有参与测试的其他模型。

在按潜在经济影响加权的金融与编码任务综合指标专业评测团队的Vals Index中,xhigh推理模式的Muse Spark 1.2以71.88%的得分、0.70美元的单任务成本排名第五,领先于推理级别为max的Claude Opus 4.8(70.36%,7.52美元/任务),仅落后于同模式的GPT-5.6 Sol(73.12%,7.46美元/任务),其单任务成本仅为后者的十分之一左右。

在要求模型承担初级金融分析师工作的专业评测团队的Finance Agent v2评测中,xhigh推理模式的Muse Spark 1.2以60.60%的得分、0.77美元的单任务成本在45个参与测试的模型中排名第一,其成本明显低于排名第二的Claude Opus 5(58.63%,5.12美元/任务),单次测试的耗时也仅为后者的一半左右。

行业背景与商业动机

Muse Spark 1.2本身已经是一款低成本的高性能模型,而如果这套方案能够得到广泛应用,那么针对贡献者的折扣政策可能会带来行业性的变革。当前企业对于训练数据的渴求,正在推动一系列新的政策倡议与商业举措落地。

Meta相关负责人在长文中提到,美国的AI实验室正面临训练数据不足的困境,这让它们在行业竞争中处于不利位置。在所有训练数据类型中,高质量的代码数据属于极度稀缺的资源。上周,知名开源AI数据集平台发布了The Stack v3语料库,该数据集抓取自公开GitHub仓库,规模达到4.9万亿token,旨在替代已发布多年的前代版本。但公开仓库仅展示了最终打磨完成的代码,无法记录开发过程中的思考、试错与修正细节,而来自实际编码框架的会话记录则可以完整捕捉整个开发流程。

Muse Spark 1.2的折扣政策,正好出现在整个夏季不断升级的AI模型价格战之中:OpenAI将GPT-5.6 Luna的价格下调了80%,调整为每百万输入、输出token分别0.20美元与1.20美元;DeepSeek-V4-Flash-0731的定价则为每百万输入、输出token分别0.14美元与0.28美元。Meta的贡献者档位价格不仅低于这两家厂商,也几乎低于所有通过API销售高性能AI模型的其他服务商。

核心交易逻辑

贡献者档位的设置,让Meta获得了自身应用生态无法提供的关键训练数据。Meta旗下的Facebook、Instagram与WhatsApp虽然生成了海量的数据,但这些数据并非训练编码智能体所需的高质量代码相关数据。Meta正是看准了这一缺口,愿意通过放弃大部分模型售价来获取这类稀缺数据。

Meta以两种价格售卖同一款模型,折扣的代价就是获得对流经该智能体的所有内容进行训练的权利。这个交易无需额外签订合同,开发者只需要在调用时选择对应的模型名称即可。需要注意的是,支持数据训练的档位设置了速率限制,每个团队每分钟仅允许100次请求,而标准档位的速率限制为每分钟3000次,这意味着贡献者档位主要面向个人开发者与小团队——这类群体往往没有足够的资源聘请专业法律顾问,同时他们的产品代码可能本身就存储在智能体读取的仓库之中。

行业观察与思考

实际上,并没有开发者被强制要求为了使用Meta的高性能模型或智能体工具而交出自己的数据。但当开发者权衡Muse Code的折扣优惠时,无论是否有意,他们实际上都在为自己的代码与专业能力定价。长期以来,AI模型构建者都会通过抓取公共仓库与论坛中的开发者代码来训练模型,而Meta正在将这种被动的知识获取转变为一个透明的市场。

和所有市场一样,这个新的市场会奖励那些能够准确评估自身商品价值的参与者。当前市场中交易的商品,无论是公开或私有代码仓库,还是开发过程的完整记录,此前都没有明确的定价标准。Meta已经透明地为这个折扣标出了对应的价值,开发者在判断这笔交易是否划算之前,也应该先为自己的数据制定合理的价格。

以上内容不代表本平台立场,仅供读者参考