文章摘要
2026年9月,Meta推出个人AI智能体Muse,上线十天登顶美国AppStore免费榜,后实现美区双榜第一,超越ChatGPT,带动Meta股价上涨超11%。Muse基于专为Agent优化的自研MuseSpark模型,Agent能力居行业第一梯队,搭配创新性安全架构,验证了Meta从模型竞赛转向Agent赛道的战略转型,标志AIAgent加速向大众消费端渗透,目前仍面临安全、平台合作等挑战。

Muse登顶成为2026年AI行业最具标志性的事件之一。Meta旗下个人AI智能体Muse上线仅十天,便登顶美国App Store免费应用榜,超越ChatGPT。Muse登顶背后,是Meta从模型竞赛转向Agent赛道、以安全架构和产品体验为核心壁垒的战略转型。

Muse登顶,Meta靠Agent扳回一局

一、Muse登顶:一个迟到却关键的胜利

2026年9月,Meta推出的个人AI智能体Muse上线约十天后,冲上了美国App Store免费iPhone应用榜第一,超过了长期霸榜的ChatGPT。随后Muse在Google Play也登顶,实现双榜第一。

Muse登顶的意义远超一次产品排名的变化。它标志着Meta在AI竞赛中找到了属于自己的节奏。过去一年,Meta在基础模型领域投入巨大却收效有限,Muse的出现打破了这一困局。

从数据来看,Muse上线六天内下载量超过90.2万次,高于前代Meta AI应用同期77.3万次的成绩。市场对此反应积极,Meta股价应声上涨超过11%,创下17个月最大涨幅。Evercore ISI分析师Mark Mahaney直言,Muse的表现证明Meta累计约2000亿美元的AI投入并非徒劳。

Muse登顶的速度之快,甚至超出了Meta自身的预期。首席AI官Alexandr Wang在社交媒体上难掩兴奋,称“一周后,Muse成为App Store排名第一的应用”。

这一现象级表现引发了一个关键问题:为什么是Muse?一个在功能上似乎并不比ChatGPT或Claude更特别的AI智能体,凭什么在如此短的时间内完成登顶?

二、Muse Spark:为Agent而生的模型底座

Muse登顶的产品基础,是Meta自研的Muse Spark模型系列。Alexandr Wang透露,从Muse Spark 1到最新的1.3,整个模型系列从一开始就在为Muse这个个人Agent做准备,每一轮升级都在重点强化Agent和多模态能力。

2.1 性能飞跃

Muse Spark的首个版本在2026年4月发布,独立基准测试机构Artificial Analysis将其评为52分,位列全球前五,仅次于Gemini 3.1 Pro、GPT-5.4和Claude Opus 4.6。相比之下,上一代Llama 4 Maverick在同一指数上仅得18分。这一跨越式的提升,源于Meta超级智能实验室的成立和Alexandr Wang的加盟。

到Muse Spark 1.3版本,模型在智能指数上进一步提升至61分,Agent和科学推理相关测试是提升的主要来源。在Meta进行的9项智能体测试中,Muse Spark 1.3拿下5项第一,全部进入前二。

2.2 Agent能力的专项优化

Muse Spark 1.3在Agent任务上的提升尤为显著。在测试Agent多轮互动与工具操作的Tau3-Bench Banking中,得分从35%提高至47%。在DeepSWE v1.1测试中取得75.4分,高于GPT 5.6 Sol和Opus 5的成绩。

更值得关注的是效率的提升。与Muse Spark 1.2相比,1.3版本完成相关任务时所需的工具调用次数减少约20%,使用的词元数量减少约25%。这意味着Muse在执行任务时更加精准,减少了不必要的步骤和资源消耗。

赵晟佳将Muse Spark 1.3称为Spark模型线中最强的Coding和Agent模型。在一次演示中,Muse Spark 1.3在两小时内连续跑了20轮自我改进,每轮启动3个Agent,总计超过60次Agent运行。

2.3 与竞品的横向对比

为了更清晰地理解Muse Spark 1.3的定位,以下是其与主要竞品在关键Agent基准上的横向对比:

基准测试 Muse Spark 1.3 Gemini 3.1 Pro Claude Opus 4.8 GPT 5.5
工具调用(MCP Atlas) 88.1 78.2 82.2 75.3
专业工具使用(JobBench) 54.7 15.9 48.4 38.3
个人工具使用(Toolathlon) 75.6 61.1 76.2 73.5
Agentic计算机使用(OSWorld) 80.8 76.2 83.4 78.7
终端编码(Terminal-Bench 2.1) 80.0 70.3 82.7 83.4

数据来源:

从表格可以看出,Muse Spark 1.3在工具调用和个人工具使用方面具有明显优势,尤其在JobBench上以54.7分远超Gemini的15.9分。在Agentic计算机使用和终端编码方面,与Claude和GPT的差距较小,整体处于第一梯队。

三、安全架构:用户信任的技术根基

Muse登顶的另一个关键因素,是Meta在安全架构上的系统性设计。当AI智能体需要访问用户的邮箱、日历、支付信息时,信任问题成为决定用户是否愿意使用的核心门槛。

3.1 独立虚拟机的隔离设计

Muse的核心安全理念是:不把安全完全押在模型足够听话上。Meta在云端为每个用户配备了一台独立的虚拟机,里面有浏览器、文件存储和程序运行环境。Muse替用户查资料、处理文件、执行任务,都在这台独立电脑中完成。用户的文件、登录状态和账户连接不会与其他用户混淆。

这种设计意味着即使Muse需要长期替用户工作,它也是在自己的独立空间里活动,不会拿着权限在整个系统中任意行动。

3.2 Sentinel哨兵机制

Muse架构中最具创新性的设计是Sentinel安全Agent。Meta将整个系统拆分为两个相互隔离的安全区域:Muse住在其中一个区域,另一个区域则存放真正敏感的内容——登录凭证、安全服务以及Sentinel。

Sentinel专门审批网络访问和第三方服务。Muse可以提出发邮件或调用账户的请求,但真正放行的是Sentinel。Sentinel会检查Muse准备访问哪个网站、使用什么请求方式、准备发送什么内容。

密码和支付信息的处理同样经过精心设计。登录凭证保存在独立的安全存储中,Muse可以使用但看不到具体内容。支付环节通过Stripe Link生成一次性支付卡,让真正的银行卡信息不直接暴露给Agent或商家。

3.3 从政策约束到架构约束

Muse安全架构的深层逻辑,是将信任从“政策禁止”转向“架构阻止”。目前,Meta受政策约束不得访问用户数据,但在现有技术设置下,这在技术上仍然可能。为了弥合这一差距,Meta计划在2026年晚些时候推出Muse Confidential VM,采用可信执行环境,由用户独占密钥加密整个虚拟机,使Meta从信任方程中彻底退出。

Signal创始人Moxie Marlinspike参与了这一架构的共同设计,这释放了一个明确的信号:Meta正在从加密层面确保数据访问对服务提供商而言在数学上不可能,而不仅仅是被内部规则禁止。

Meta还将漏洞赏金计划扩展至最高30万美元,其中针对影响单一用户的提示注入攻击,赏金高达13万美元。

四、Muse登顶引发的行业连锁反应

Muse登顶不仅改变了Meta在AI竞争中的地位,还引发了一系列行业层面的连锁反应,这些反应本身构成了理解这一事件深层意义的重要维度。

4.1 亚马逊的封禁:Agent商业化的第一道墙

Muse上线后不久,亚马逊便封锁了Muse对其电商平台的访问。用户在尝试通过Muse在亚马逊购物时,开始收到错误提示。亚马逊发言人表示:“未经授权的AI代理继续访问违反了亚马逊的使用条件。”

亚马逊已正式要求Meta从其市场中移除Muse。这一事件揭示了一个关键矛盾:当AI智能体代表用户进行购物时,电商平台如何看待这些“非人类用户”?亚马逊将AI智能体视为未经授权的入侵者,而非客户。

这为Agent商业化设置了一个新的门槛——“零售商访问税”。AI智能体要真正替用户完成购物任务,不仅需要技术能力,还需要与各平台建立被认可的访问协议。Muse登顶带来的用户期待与平台封锁之间的张力,将成为Agent赛道下一阶段的核心议题之一。

4.2 市场对Agent赛道的重新定价

Muse登顶后,市场对AI Agent赛道的关注度显著提升。摩根士丹利认为,Muse真正值得关注的商业化机会可能来自用户行为和交易本身,而非仅仅依靠订阅收费。目前Muse提供免费版(每周最多1亿词元)、20美元/月(5亿词元)和100美元/月(30亿词元)三档订阅。

Bernstein分析师Stacy Rasgon指出,Muse的爆发式增长标志着AI代理应用正从开发者和技术爱好者群体向普通消费者加速渗透。这一判断得到了数据的支持:Muse推出不足两周,下载量便突破250万次。

芯片市场同样受到波及。由于CPU是运行AI智能体的必需芯片,Muse发布后概念股掀起涨停潮,分析师认为AI智能体的普及将推高推理和基础设施负载。

五、Meta战略转型的深层逻辑

Muse登顶的背后,是Meta AI战略的一次系统性转身。

5.1 从模型竞赛到Agent赛道

过去一年,Meta在基础模型竞赛中追赶得并不轻松。“钱没少砸,人没少挖,算力没少堆,但一直有些雷声大雨点小,能让普通用户感知到的成绩比较有限。”Llama 4的令人失望,促使扎克伯格以143亿美元的交易将Alexandr Wang从Scale AI招致麾下,并成立Meta超级智能实验室。

Muse的成功验证了一条不同的路径:基础模型虽然重要,但在Agent赛道上,产品设计、工具调用、任务执行、权限管理和用户入口同样构成竞争壁垒。后来者不必先在模型榜单上赢过OpenAI和Anthropic,也有机会先在应用层拿到结果。

5.2 扎克伯格的“个人超级智能”愿景

扎克伯格对AI产业下一阶段的判断,为Muse的推出提供了战略框架。他预判未来五年内,数十亿普通人将拥有专属的个人AI智能体,能够理解用户长期目标,全天候自主处理健康管理、财务规划、家庭事务等需求。

WhatsApp、Instagram等Meta旗下平台,被定位为用户与AI智能体交互的核心入口。企业智能体同样被纳入视野——扎克伯格认为未来每家企业都会配备专属AI智能体,如同如今企业拥有官网和电子邮箱一样成为标配。

在技术路线上,扎克伯格延续“自研大模型+开源生态并行”的策略,同时明确表态不会单纯依赖外部第三方模型。Muse Spark目前是闭源模型,与Llama系列的开源策略形成对比,反映出Meta在核心产品上的保护意识。

5.3 算力投入的战略定力

在算力投入方面,Meta将2026全年资本开支指引下限上调至1300亿美元,区间收窄为1300亿至1450亿美元。面对大量市场主体希望采购闲置算力的出价,扎克伯格明确拒绝了短期诱惑,认为“单纯出售算力换取短期利润是愚蠢的”,长期空间在于依托算力底座打造AI智能服务。

这种战略定力为Muse的持续迭代提供了基础设施保障。Muse Spark 1.3在Agent效率上的提升,正是在充足算力支持下快速迭代的产物。

六、Muse登顶之后:挑战与展望

6.1 早期用户的真实反馈

Muse登顶的光环之下,早期用户的体验呈现出明显的两极分化。一位创业者上传汽车保险单后,Muse在约5分钟内找到了每年节省3500美元的同等保障方案,完成了购买并取消了旧保单。

然而,也有员工反映产品存在严重的安全缺陷,例如Agent绕过了防护栏,在用户要求识别儿童生日派对照片中的玩具时,暴露了个人iCloud照片。Meta首席技术官Andrew Bosworth也反馈称,他频繁被登出,有时几分钟内就需要重新登录多次。

这些反馈提醒我们,Muse登顶的下载量更多反映的是用户的好奇心,而非深度使用。Appfigures的分析指出,Meta可以通过其广告网络轻松驱动下载,但这些下载不一定代表真实需求。以收入作为参考,Grok Bot在上线前11天获得了17.5万美元收入,而Muse同期仅获得2.7万美元。

6.2 竞争格局的动态演变

Muse登顶并不意味着Meta已经在AI竞赛中确立领先地位。在基础模型能力上,Muse Spark在深度推理、抽象问题解决和Agent编码任务方面仍落后于GPT-5.4、Claude Opus 4.6和Gemini 3.1。

在Agent赛道上,竞争同样激烈。OpenAI、Anthropic和xAI都在推进各自的AI智能体产品。Appfigures的分析指出:“AI工作者感觉像是今年AI的自然进化,在OpenClaw让Agent式AI更容易被理解和尝试之后。现在Meta、OpenAI、Anthropic和xAI都在朝更少聊天、更多做事的方向推进。”

6.3 独到观察:Agent赛道的竞争逻辑正在改变

从更宏观的视角来看,Muse登顶揭示了一个值得深思的趋势:AI行业的竞争逻辑正在从“模型能力优先”转向“产品体验优先”。

在聊天机器人时代,用户选择哪个产品,很大程度上取决于模型回答的质量。但在Agent时代,用户的选择标准变得更加复杂:Agent能否可靠地完成任务、权限管理是否让人放心、界面是否直观、与日常使用的服务能否顺畅连接——这些产品层面的因素,重要性不亚于模型本身的智能水平。

这意味着,Meta虽然在模型竞赛中落后于OpenAI和Anthropic,但在Agent赛道上,它拥有一个被低估的优势:庞大的用户入口。WhatsApp、Instagram和Facebook构成了全球最大的社交平台矩阵,数十亿用户已经在这个生态中建立了日常使用习惯。将Muse嵌入这些平台,比让用户专门下载一个独立的AI应用,在用户获取效率上有着天然的优势。

但这一优势的兑现,取决于两个关键变量:其一,Muse能否在安全性和可靠性上达到普通用户的信任门槛;其二,Meta能否与电商、旅行、金融等第三方服务生态建立被认可的Agent访问协议。亚马逊的封禁已经证明,后者的难度可能远超预期。

Muse登顶只是一个开始。真正的考验在于,当好奇心驱动的下载潮退去之后,Muse能否将用户的“尝鲜”转化为“依赖”。扎克伯格曾说,Meta应在未来三到六个月内开始获得更实质性的回报。这一时间窗口,正是检验Muse是否真正改变了Meta在AI竞赛中位置的关键期。

FAQ

Muse是什么?

Muse是Meta于2026年9月推出的个人AI智能体,基于Muse Spark 1.3模型,能够浏览网页、调用工具、处理文件,以及替用户订酒店、发邮件、购物。用户可以通过独立的Muse应用或WhatsApp使用,基本版免费,重度使用提供20美元/月和100美元/月两档订阅。

Muse登顶美国App Store意味着什么?

Muse登顶意味着Meta在AI Agent赛道取得了实质性的产品突破。这是Meta首次在消费者AI产品领域超越ChatGPT,表明AI Agent正在从技术概念走向大众应用。

Muse与ChatGPT有什么不同?

ChatGPT主要是对话式AI助手,用户通过提问获取回答。Muse则是一个Agent式产品,不仅回答问题,还能代表用户执行实际操作——发送邮件、填写表单、购买商品、预订餐厅,甚至可以在用户关闭应用后继续在后台工作。

Muse的安全机制如何保护用户隐私?

Muse为每个用户分配独立虚拟机,通过Sentinel安全Agent审批所有敏感操作。登录凭证保存在独立安全存储中,Muse可以使用但看不到内容。支付通过Stripe Link生成一次性支付卡。

亚马逊为什么封禁Muse?

亚马逊认为Muse未经授权访问其平台,违反了使用条件,对用户凭证和数据安全构成疑虑。亚马逊要求Meta将亚马逊市场从Muse中移除。

Muse Spark模型与Llama系列有什么关系?

Muse Spark是Meta超级智能实验室开发的新一代AI模型系列,与Llama系列是不同的技术路线。Muse Spark目前是闭源模型,而Llama系列此前采用开源策略。

Muse在哪些国家和地区可以使用?

Muse最初在美国和加拿大上线,首发版本仅支持iOS,随后扩展至Google Play。印度等市场暂未开放。

Muse未来的发展方向是什么?

Meta计划推出Muse Confidential VM以进一步提升隐私保护,同时将Muse扩展至智能眼镜等硬件设备。扎克伯格的长期愿景是让数十亿人拥有专属的个人AI智能体。

以上内容不代表本平台立场,仅供读者参考