Meta5个月迭代4款 新旗舰反超谷歌Gemini将开源

据行业观察消息,海外科技巨头Meta于近期推出了全新旗舰大模型Muse Spark 1.3。在第三方AI分析指数榜单中,这款新模型的综合得分仅次于两款竞品,排名第三。
Meta联合创始人兼CEO马克·扎克伯格在社交平台上表示,Muse Spark 1.3的性能表现远超预期。
Meta超级智能实验室负责人、首席AI官汪滔则指出,该模型的部署成本极低,几乎可以忽略不计,同时智能体协作、编程能力以及易用性都有了大幅提升。当搭配Muse Code工具使用时,其评测表现可以对标两款顶级竞品组合。
有开发者使用Muse Spark 1.3完成了《我的世界》相关内容制作,整体成本仅10美分,折合人民币约0.67元。
值得注意的是,就在Meta发布新模型的4小时前,谷歌刚刚推出了其最强推理与编程模型Gemini 3.8的两个新版本。但仅过了数小时,Meta的新模型就在第三方榜单上实现反超。当前该指数榜单中,Muse Spark 1.3得分为62分,仅次于66分的Claude Fable 5.1和63分的Claude Opus 5,而Gemini 3.8 Flash的得分为59分。汪滔还在社交平台上调侃谷歌的新模型,称“gemini who?”,甚至调侃“Gemini现在取消上线还不算晚”。
过去5个月里,Meta已经接连推出了四款Muse Spark系列模型:4月首发基础版Muse Spark,7月更新至1.1版本,8月上线1.2版本,加上最新的1.3版本,迭代速度越来越快。
根据Meta公布的基准测试结果,Muse Spark 1.3在五项核心测试中拿下第一,在长上下文处理、编程能力等多数测试项目中都优于GPT-5.6 Sol和Claude Opus 5,仅在Terminal-Bench终端操作Agent测试中与GPT-5.6 Sol打成平手。不过这款模型的Agent能力仍有短板,在联网搜索类Agent、通用知识任务GDPVal-AA v2中的表现相对较弱。
定价方面,Muse Spark 1.3的API定价与前代1.2版本保持一致:每百万token缓存未命中输入为1.25美元,缓存命中输入为0.15美元,每百万token输出为4.25美元。其价格略高于Gemini 3.8 Flash,但比DeepSeek-V4-Pro的高峰期价格更为便宜。
目前Muse Spark 1.3已经在Muse Code和Meta Model API中逐步推送,此前支持的推理模式已经可以正常使用,极致推理模式则将在完成额外安全测试后很快开放。Meta官方表示,团队已经规划了清晰的产品路线图,包括更大参数规模的模型、Muse Spark开源权重版本发布以及更多功能更新。
开发者实测:高性价比与表现的平衡
社交平台上不少开发者分享了自己实测Muse Spark 1.3的体验,多数用户认为这款模型运行速度快、成本低廉,但生成效果并没有达到惊艳的程度。
有开发者对比了Muse Spark 1.1到1.3基于照片生成同一栋建筑3D模拟效果的升级,新版本在几何形状、结构和视觉效果上都有明显提升,而整体成本始终保持在0.6美元左右,折合人民币约4.03元。
另一位开发者对比了开启Ultra超高算力模式的Muse Spark 1.3和Claude Fable 5.1 xHigh的表现,两者使用完全相同的提示词,运行时长均约2小时。该提示词内置了自我迭代优化规则:如果独立评审模型给出的打分低于9.5/10,模型就需要持续优化并重新尝试。
最终Muse Spark 1.3完成了20轮自我优化循环,每轮启动3个智能体,两小时内累计执行超过60次智能体任务,整体成本不到1美元。有网友在评论区质疑,这是否意味着模型始终没有完成最终任务,仅以1美元的成本就停止了迭代。
在开源的3D空间推理基准测试MineBench中,对比Gemini 3.8 Flash和Muse Spark 1.3的实测结果显示:Gemini 3.8 Flash总测试成本1.18美元,平均推理耗时1分51秒,首测Elo评分为1888分;Muse Spark 1.3总测试成本6.57美元,平均推理耗时5分36秒,首测得分1787分,其生成输出质量距离当前顶尖前沿模型仍有一定差距。
还有开发者对比了Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT-5.6 Sol的综合表现,认为Muse Spark 1.3在成本和速度上可以和Qwen 3.8 Max相媲美,而GLM 5.3则在性能、成本、速度以及token使用量上的综合表现最为出色。
整体来看,虽然Muse Spark 1.3价格低廉且运行速度快,但整体表现只能算是不错。Qwen 3.8 Max的输出成果质量最高、完成度最好,但耗时约一个半小时,而Muse Spark 1.3仅需要约2分钟就能完成基础任务。
核心优势:长周期任务与编程能力升级
Meta官方博客提到,Muse Spark 1.3的核心优势在于支撑长周期复杂任务以及编程开发场景。
这款模型可以和用户协同工作,在单条长对话会话中并行处理多条工作流。当面对开放式目标时,它可以主动调用工具,从杂乱且相互矛盾的信息源中自主构建完整上下文,主动修正方案中的漏洞,并基于已获取的信息输出完整的交付成果。
同时,Meta的研究团队基于多套多样化的评测框架完成了模型训练,让其可以适配各类智能体运行环境。举个例子,当Muse Spark 1.3收到复杂的提示词,需要在不同位置提取活动详情、文案和图片,再编辑组合后在广告管理平台中创建并发布内容时,相比前代模型,它可以在多步骤任务中更好地保留细节要求,不会遗漏约束条件,也不会偏离既定的工作流程。
Meta还优化了模型的多任务处理能力,即便在信息杂乱的单会话上下文中,无论用户是接续过往任务,还是中途打断当前任务,模型都能准确将新输入的提示匹配到对应的任务上。
此外,Muse Spark 1.3可以清晰认知自身的能力边界,知道自己能做什么、不能做什么,了解自己已知和未知的信息,在遇到障碍时可以做出合理应对,而不是生成错误的预测结果。比如当收到“作为小型航空企业的机械工程师,为下一代飞行器设计实验型X型机翼组件,基于附件材料撰写流体仿真报告初稿,包含初步CFD仿真结果和机翼组件CAD模型STEP文件”的提示词时,模型可以生成符合要求的对应文件。
编程方面,相比Muse Spark 1.2,Muse Spark 1.3需要的操作步骤更少,表述更加简洁,整体编码风格也更为清晰。根据Meta工程师的测试结果,它的工具调用次数减少了20%,使用的token数量减少了25%。
此外,研究团队围绕智能体与代码能力相关的多个维度完成了安全升级:Muse Spark 1.3的对抗鲁棒性有所增强,对对抗输入和提示注入攻击的抵御能力得到提升;在处理复杂智能体任务时,模型可以对不可逆操作进行风险判断,并据此审慎执行动作。
行业观察:密集迭代背后的AI战略转向
5个月内迭代4款Muse Spark系列模型,如此密集的发布节奏,或许标志着Meta的AI研发进程发生了明显的战略转向。
从Muse Spark 1.3的能力布局来看,这款模型并没有追求全维度通杀,而是将资源集中在长上下文处理、编程能力等核心场景上,在DeepSWE、OSWorld等面向真实工程任务的基准测试中实现了对前沿模型的反超。
这种针对性的能力取舍或许也证明,未来开发者和企业在选型大模型时,不会再追求“一个模型搞定全部”的方案,多模型路由、根据任务类型调度不同专长模型,可能会成为企业落地Agent应用的主流方式。

