Meta发布Muse Spark 1.1:低成本高价值智能体模型

Meta近期在大模型赛道推出了全新动作,旗下视觉语言模型Muse Spark 1.1以及配套的Meta Model API正式发布,这也是该公司首次以付费形式开放模型访问服务。此前凭借Llama系列,Meta已经将自己定位为OpenAI的开放替代方案,而此次推出的闭源模型,则进一步将品牌形象调整为低成本高价值的市场竞争者。
产品核心参数与基础功能本次发布的Muse Spark 1.1是专门针对智能体任务训练优化的视觉语言模型,其输入支持文本、图像和视频,最大可处理1048576个token;输出为文本内容,最大支持131072个token,生成速度可达每秒119个token。
该模型具备多项实用功能,包括工具调用、Prompt缓存以及可调节的推理级别,涵盖无、最低、低、中、高、超高六个档位。
在性能表现上,Muse Spark 1.1在工具使用排行榜MCP Atlas和JobBench中位居第一;在Artificial Analysis的Intelligence Index榜单上,与GPT-5.6 Luna和GLM-5.2并列,同时保持了较低的单任务成本。
用户可以通过Meta AI应用和meta.ai免费使用该模型;API版本目前处于公开预览阶段,仅限美国地区使用,需要加入等待名单,新用户可获得价值20美元的初始使用额度。具体收费标准为:每百万输入token 1.25美元,每百万缓存token 0.15美元,每百万输出token 4.25美元,网络搜索功能每1000次查询收费2.50美元。值得注意的是,Meta并未披露该模型的参数数量、模型架构、训练数据以及训练方法。
模型技术细节Meta并未公开过多Muse Spark 1.1的构建细节,该模型是对今年4月推出的初代Muse Spark的升级,后者此前作为Meta AI背后的核心模型运行。本次升级的训练技术重点集中在上下文管理、计算机操作以及多智能体协调三个方面。
首先,模型经过训练后可以适配多个面向智能体编程的运行框架,这类框架可以将模型连接到文件、工具和测试环境,同时支持任务规划和子智能体编排等功能。其次,模型具备双向委派能力,当作为主导模型时,可以拆分任务并分派给多个子智能体并行执行,缩短整体完成时间;当作为下级智能体时,则会遵循分配的角色,在决策超出权限时将控制权交还给上层编排模型。
此外,模型自身可以在长时间任务过程中自动调整输入上下文,能够检索任务早期的细节信息,压缩中间的交互内容,同时保留后续步骤所需的关键内容。针对计算机操作场景,模型可以在自动化脚本编写和直接操作(如点击、虚拟键盘输入)之间自主选择,采用更快捷或简单的执行方式,还支持一次执行多个操作,进一步提升运行速度和性能。
第三方测试成绩Muse Spark 1.1在智能体工具使用相关的基准测试中表现亮眼,但在整体智能水平上仍略逊于顶级模型。在人工盲测对比中,其排名仅稍低于领先模型,而在智能体编程能力方面则处于中游水平,不过其单任务成本优势尤为突出。
在Artificial Analysis的Intelligence Index榜单中,开启xhigh推理模式的Muse Spark 1.1获得51分,与开启最高推理模式的GLM-5.2和GPT-5.6 Luna持平,仅落后于Claude Sonnet 5的53分。该模型在该榜单上的单任务成本为0.26美元,除了GPT-5.6 Luna的0.21美元之外,在所有得分不低于它的模型中,其运行成本是最低的。
在Arena.ai的Text Arena榜单中,Muse Spark 1.1以1490 Elo排名第六,排在Claude Fable 5(1505 Elo)和四个Claude Opus版本之后,同时略高于开启xhigh推理模式的GPT-5.6 Sol(1486 Elo)。
在Artificial Analysis的Coding Agent Index榜单中,开启xhigh推理模式的Muse Spark 1.1获得71.3分,仅落后于GPT-5.6 Luna的71.4分,高于开启中等推理模式的Gemini 3.5 Flash的70.1分。其单任务成本约为1.40美元,属于参与对比的编程智能体中成本最低的一档,但完成每项任务所需的时间比其他模型更长。
在MCP Atlas榜单中,Muse Spark 1.1的通过率为88.1%,高于开启高推理模式的Gemini-3.5-Flash的83.6%和Claude Fable 5的83.3%。在JobBench榜单中,其得分54.7%排名第二,高于Claude Opus 4.8的48.4%,仅次于Claude Fable 5的57.4%。
行业发布背景Muse Spark 1.1的发布正值大模型密集推出的时期。发布当天,OpenAI向公众开放了GPT-5.6系列模型;前一天,Grok 4.5正式发布,该模型同样强调较低的单任务成本。两周后,Google又推出了Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。在同一周内,Meta还推出了图像生成模型Muse Image,并宣布了视频生成模型Muse Video的研发计划。本次发布的Muse Spark 1.1也是首个通过Meta全新推出的Model API提供访问服务的模型。
定价策略与市场影响Token的定价水平决定了哪些应用能够实现规模化的经济可行,而Muse Spark 1.1的推出改变了这一行业门槛。该模型的输出token成本仅为竞品的一小部分,例如Claude Opus 4.8、GPT-5.6 Sol和Claude Fable 5的输出token价格分别为每百万25美元、30美元和50美元,而Meta的定价仅为每百万4.25美元。单任务成本的实测数据也验证了这一价格优势,根据Artificial Analysis的统计,仅有GPT-5.6 Luna这一款智能水平相近的模型运行成本更低。
Meta首席执行官马克·扎克伯格将这一价格策略描述为对竞争对手商业模式的攻击,他表示其他实验室的定价“非常极端,而且利润率非常高”。与谷歌类似,Meta可以利用广告收入补贴模型的开发、训练和推理成本,这与那些主要依赖API利润和订阅收入生存的实验室相比,具备结构性的成本优势。如果其他竞争对手为了维护市场份额而被迫跟进降价,那么整个行业运行智能体的成本都将出现下降。
行业趋势观察当前大模型的能力正在不断从外围支撑系统迁移到模型权重本身。最初,指令遵循能力依赖于提示工程,工具使用功能则是通过包裹在模型外围的代码实现的,而如今这两项能力都已经成为模型训练目标的一部分。Muse Spark 1.1延续了这一趋势,将开发者过去需要通过外围支撑系统实现的行为,例如向其他智能体委派任务、升级处理以及在任务过程中管理上下文,都集成到了模型本身。开发者需要手工构建的外部工具越少,智能体应用的普及速度就会越快。


