苹果Siri AI发布:迟到两年的“个人化助手”,到底变了什么?

2026年6月8日,苹果在WWDC大会上正式发布了全新一代Siri AI,这是Siri诞生十五年来最彻底的一次重建。从“语音命令工具”到“对话式个人助手”,Siri AI首次具备了跨应用执行任务、理解屏幕内容和调用个人上下文的能力。但它比原计划晚了整整两年,期间的跳票、诉讼与管理层更迭,让这次发布带着一种“补考”的意味。

H2 一、一场迟到了两年的发布:Siri AI的来龙去脉
H3 1.1 从承诺到跳票:两年间发生了什么
2024年WWDC,苹果首次展示了“更个人化的新一代Siri”概念,承诺它将具备深度上下文理解能力,能够搜索邮件、信息和照片,并支持更自然的对话。当时的宣传甚至直接绑定了iPhone 16 Pro。
然而,这个项目从一开始就不顺利。原定随iOS 18推出的计划被推迟到iOS 18.4,又推到iOS 26,再推到iOS 26.4。2025年3月,苹果公开承认在Siri AI项目上“贪多嚼不烂”,宣布无限期推迟,不再给出明确时间表。原Siri负责人John Giannandrea被撤换,由负责Apple Vision Pro的Mike Rockwell接任。
这场跳票的代价是实实在在的。苹果因Siri功能延迟遭到投资者集体诉讼,最终在2025年12月以约2.5亿美元和解。2026年4月,苹果还紧急组织了一场持续多周的AI“vibecoding”训练营,派出近200名工程师集中提升AI编码与产品落地能力。
H3 1.2 WWDC 2026:库克的“告别演出”
这场发布会的背景本身就带有转折意味。WWDC 2026是Tim Cook作为CEO的最后一次主题演讲,他将于2026年9月1日将CEO职位交给硬件负责人John Ternus。Cook在演讲中罕见地公开承认,Apple Intelligence“尚未兑现我们承诺的一切”。这句话从一位以严格控制叙事著称的CEO口中说出,分量不轻。
市场的反应同样微妙。发布会当天苹果股价一度涨超3%,随后跳水,收盘反跌约1.9%,市值一夜蒸发超过850亿美元。这个数字本身就说明了很多问题——资本在用脚投票,表达对这场“迟到补考”的复杂态度。
H2 二、Siri AI到底“AI”在哪里:核心能力拆解
H3 2.1 从语音助手到对话式助手:交互方式的根本转变
旧版Siri的本质是“语音指令解析器”——你说话,它匹配意图,执行单一操作。新Siri AI的逻辑完全不同。
它拥有了独立的应用程序,用户可以像使用ChatGPT一样打字提问、上传文件、回看历史对话并继续之前的话题。交互入口也从屏幕边缘的发光效果,变成了从Dynamic Island“跃出”的Liquid Glass动画。用户可以通过下拉Dynamic Island、说“嘿Siri”或按侧边按钮唤醒它。
更关键的是多轮对话能力。Siri AI能够理解连续提问的语境,而不是像以前那样每句话都需要重新“交代背景”。
H3 2.2 “随Siri写作”:个人风格迁移的实用场景
这是Siri AI中一个被低估但可能最高频使用的功能。在邮件和信息应用中,“随Siri写作”可以模拟用户与特定联系人的沟通风格来辅助起草内容。
举个例子:如果你平时给上司发的邮件是简洁直接的要点摘要,Siri AI在帮你起草邮件时也会保持同样的风格。这个功能的底层逻辑是个人上下文理解——Siri需要知道你过去和这个人是怎么沟通的,才能模仿出你的语气。
H3 2.3 跨应用操作与屏幕感知
旧版Siri最大的局限之一是“应用孤岛”——它只能在特定应用中执行有限的操作。Siri AI打破了这层壁垒。
用户可以发出这样的指令:“帮我给玛丽发最新的报告”,Siri AI能够跨应用调取数据并完成操作。在演示中,苹果展示了通过自然语言查询演唱会时间并设置门票提醒的完整流程。
屏幕感知是另一个实质性升级。当你看着屏幕上的内容说“解释这段文字”或“帮我找这个产品的评价”,Siri AI能够理解屏幕上显示的是什么,并据此做出回应。
H2 三、技术架构:苹果到底怎么做到的
H3 3.1 三层模型矩阵
苹果这次披露了第三代基础模型(AFM 3)的完整矩阵,结构比前两代清晰得多。
| 模型 | 运行位置 | 规模 | 单次激活 | 角色 |
|---|---|---|---|---|
| AFM 3 Core | 端侧 | 3B(稠密) | 3B | 轻量文本、路由、快速NLU |
| AFM 3 Core Advanced | 端侧 | 20B(稀疏) | 1–4B/prompt | 新Siri、听写、TTS、图像理解 |
| AFM 3 Cloud | 私有云计算 | 未公布 | — | 云端主力文本/图像理解 |
| ADM 3 Cloud | 私有云计算 | 未公布 | — | 图像生成与编辑 |
| AFM 3 Cloud Pro | Google Cloud | 未公布 | — | 复杂推理、Agent工具调用 |
数据来源:
H3 3.2 20B稀疏端侧模型:把“大模型”装进手机的关键
这张表里最值得关注的是 AFM 3 Core Advanced——一个200亿参数的模型,却能在手机上运行。秘诀是稀疏架构配合苹果研究院提出的 Instruction-Following Pruning(IFP) 技术。
传统稠密模型每次推理都要激活全部参数,计算量和功耗都极高。IFP的思路是:让一个小型预测器读取当前的prompt,动态选择这次请求需要激活哪些FFN矩阵的行和列。论文数据显示,这种3B激活的稀疏模型在数学和编程任务上比3B稠密基线高出5–8个绝对分,能追平9B稠密模型的表现。
工程实现上,苹果把完整的20B模型放在闪存中,只把一小部分“始终激活的共享expert”留在DRAM,预测器选中对应的expert时再动态调入。这就是20B模型能塞进端侧又不会把电池榨干的原因。
H3 3.3 Gemini的角色:不是“直接用”,而是“用来精炼”
苹果与Google的合作是这次发布中最受关注的话题之一。据多家媒体报道,Siri AI底层运行的是一个约1.2万亿参数的定制Gemini模型,许可费用据报道约为每年10亿美元。
但苹果高管的表述很谨慎。Craig Federighi强调,苹果先自主搭建了AFM框架,随后借助Gemini进行精炼和升级,而非直接调用Gemini面向普通客户的模型。Siri AI最强的云端模型AFM 3 Cloud Pro运行在Google Cloud的NVIDIA GPU上,并使用Gemini前沿模型的输出做精调,但苹果坚持这模型是“自家的”。
这个区分很重要。如果苹果只是把Gemini包装进Siri,那它失去的是AI能力的自主定义权。精炼与直接使用的区别,决定了苹果在架构层面是否保留了后续自主迭代的空间。
H2 四、隐私叙事:苹果的“不妥协”与它的裂缝
H3 4.1 三层隐私架构
隐私是苹果在这场发布中反复强调的核心卖点。Federighi的原话是:“大多数AI提供商将数据保护责任转嫁给用户,但苹果通过端侧AI和私有云,阻止包括苹果在内的任何人访问或存储用户数据。”
具体架构分三层:
第一层:端侧处理。 简单请求在设备内部完成,数据不离开手机。Siri AI的端侧模型门槛提高到12GB RAM,这意味着大量旧款iPhone无法使用。
第二层:私有云计算(Private Cloud Compute)。 中等复杂度的请求路由到苹果服务器上的高性能模型。用户数据在传输和处理过程中处于“无状态”模式——处理完成后不保留任何信息。
第三层:Google Cloud。 最复杂的推理请求路由到Google Cloud上的AFM 3 Cloud Pro。苹果表示,查询在到达Gemini之前会剥离所有个人可识别数据,合同禁止Google利用苹果用户数据训练未来模型。
H3 4.2 裂缝在哪里
这套架构在技术上确实比“直接上传云端”更严谨,但“Google形状的星号”始终存在。用户数据经过Google的基础设施,即使苹果做了数据剥离和合同约束,这种信任链条的长度本身就构成了新的风险面。
更现实的问题在于功能取舍。Siri AI被曝在系统提示中硬编码了一条规则:当用户提供URL并要求总结、阅读或提取信息时,Siri AI必须明确告知无法访问网页,且不得提供替代方案。这个决定在媒体行业引发了讨论——苹果选择不做一个“吃掉出版方内容却不带来流量”的AI,但用户获得的实用性也因此打了折扣。
H2 五、与竞品的真实差距:Siri AI vs ChatGPT vs Gemini
H3 5.1 能力对比
| 维度 | Siri AI | ChatGPT | Google Gemini |
|---|---|---|---|
| 核心定位 | 系统级个人助手 | 通用对话AI | 搜索+助手融合 |
| 端侧运行 | 支持(20B稀疏模型) | 不支持 | 部分支持(Pixel设备) |
| 跨应用操作 | 原生系统级 | 有限(通过插件) | Android系统级 |
| 个人上下文 | 深度整合设备数据 | 需手动上传 | 深度整合Google生态 |
| 独立应用 | 有 | 有 | 有 |
| 隐私架构 | 端侧+私有云+Google Cloud三层 | 纯云端 | 云端为主 |
| 网页访问 | 不支持 | 支持 | 支持 |
| 中国大陆可用 | 暂不支持 | 部分可用 | 不支持 |
H3 5.2 速度是短板
根据Macworld的实测,Siri AI在WWDC演示中的响应延迟明显。在“舞台管理”的最优条件下,最快响应3.71秒,最慢达到8.31秒,复杂任务甚至超过10秒。作为对比,ChatGPT和Gemini在类似任务上的响应通常在2–4秒以内。
这个差距不是“优化一下”就能解决的。Siri AI的三层路由架构——端侧→私有云→Google Cloud——每经过一层就增加一次传输和判断开销。苹果选择了隐私优先的架构,代价就是延迟。这是一个真实的设计权衡,而不是工程缺陷。
H3 5.3 真正的差异化在哪里
如果只看“回答问题的能力”,Siri AI并不比ChatGPT或Gemini更出色。它的独特之处在于与操作系统的深度绑定。
Siri AI能够读取你屏幕上的内容、搜索你设备上的邮件和照片、在你正在使用的应用中直接执行操作。这种“知道你在做什么、在哪个应用里、屏幕上看的是什么”的上下文感知能力,是任何第三方AI助手都无法复制的。ChatGPT需要你复制粘贴内容,Siri AI直接“看到”屏幕就知道你在说什么。
这个差异化的价值取决于一个前提:用户是否真的需要一个“知道得太多”的助手。Wired在报道中提出了这个问题:“为了让Siri更聪明,苹果想让Siri更了解你——问题是,iPhone用户是否还想要两年前苹果承诺的那个AI助手,以及他们是否真的想让Siri那么了解自己?”
H2 六、开发者生态:App Intents才是真正的引擎
H3 6.1 App Intents:让第三方应用“被Siri理解”
Siri AI能跨应用执行任务的底层机制是 App Intents框架。开发者通过App Intents描述自己的应用“能做什么”和“管理什么内容”,Siri AI据此理解并调用。
具体来说,开发者需要做三件事:用App Entities建模应用中的数据(比如“会议”“报告”“联系人”),用Intents描述应用支持的操作(比如“发送邮件”“设置提醒”),并通过注解让Siri理解屏幕上显示的实体对应的是什么内容。
这套机制的设计哲学是:Siri负责语言理解,应用负责执行。开发者不需要自己训练模型来理解自然语言,只需要用结构化的方式告诉系统“我的应用有什么、能做什么”。
H3 6.2 对开发者意味着什么
App Intents的更新实际上降低了一个门槛:如果你的应用内容能够被贡献到Spotlight语义索引中,用户就可以用自然语言找到并操作你的应用内容,而不需要打开应用再一步步导航。
这创造了一种新的交互范式。用户说“把玛丽的最新报告发给我”,Siri AI需要同时理解“玛丽”是一个联系人,“最新报告”是一个文件实体,以及“发送”是一个可执行的操作。这三个理解分别来自不同的App Intents声明。
对开发者来说,这意味着应用的可发现性和可用性不再完全依赖于界面设计。一个功能再深的应用,只要正确声明了App Intents,用户就能通过Siri直达。
H2 七、中国大陆市场的“缺席”:一个结构性问题
H3 7.1 首发不支持,原因在合规
苹果在WWDC 2026上明确表示,Siri AI和Apple Intelligence新功能在中国大陆市场暂不提供,原因是“需要配合监管要求推进相关工作”。欧盟市场同样不在首批推出范围内。
Siri AI计划支持包括简体中文和繁体中文在内的16种语言,但语言支持与地区可用性是两回事。据后续报道,国行AI服务可能由千问大模型提供支撑,相关端侧生成式AI服务已通过备案。
H3 7.2 更深层的问题:用户预期的落差
中国大陆用户对这次“缺席”的反应值得关注。有内地科技媒体评论指出,中国用户以全球最高价格购入iPhone 17 Pro等机型,到手的却是“硬件性能严重溢出、系统核心卖点被全面阉割的半成品”,实际能体验到的仅剩“图标变透明、控制中心改版”等表面更新。
这个评论虽然尖锐,但指向了一个真实的矛盾:苹果在中国市场维持着高品牌溢价,而AI能力正在成为智能手机的核心竞争力之一。当这个能力因为合规原因无法落地时,品牌溢价的支撑点就需要重新寻找。
苹果与中国本土AI模型的适配不是简单的“换个模型”就能完成的。端侧模型的硬件门槛、私有云架构的合规要求、数据本地化的技术实现——每一个环节都需要重新设计。Siri AI要真正进入中国大陆市场,面临的是一场比技术更复杂的系统性问题。
H2 八、独到见解:Siri AI的真正挑战不是“不够AI”
H3 8.1 苹果选择了一条“正确但更难的路”
从纯能力角度看,Siri AI在对话流畅度、响应速度、网页访问等维度上都不占优。但苹果做的是一个不同的产品。
ChatGPT是一个目的地——你专门去那里提问。Siri AI想成为空气——你不需要“去”任何地方,它在你正在做的事情里自然出现。这个定位的差异决定了评价标准的不同。用“聊天机器人”的尺子量Siri AI,它确实不够好;用“系统级助手”的尺子量,它做的事情是ChatGPT做不了的。
H3 8.2 架构选择塑造了能力边界
三层隐私架构(端侧→私有云→Google Cloud)是Siri AI最独特的设计,也是它最大的能力约束。每一次路由都增加延迟,每一次跨层传输都消耗信任。苹果选择了隐私优先,就必须接受“响应不够快”的现实。
这不是一个可以被“下一代芯片”解决的问题。只要架构不变,延迟就不会消失。苹果可能需要在“足够好的隐私”和“足够好的体验”之间找到一个新的平衡点——这个平衡点的位置,将决定Siri AI能否真正被用户接受。
H3 8.3 “个人化”是一把双刃剑
Siri AI的核心卖点是“更了解你”。它能搜索你的邮件、读取你的屏幕、模仿你的写作风格。但“更了解你”的同时也意味着“知道得更多”。
苹果花了大量精力构建隐私架构来回应这个担忧,但技术架构能解决的问题是有限的。用户对“AI知道我多少”的心理接受度,不是靠“数据不存储”就能完全消除的。这个心理门槛的跨越,可能比任何技术挑战都更困难。
Siri AI的发布是一个起点,不是终点。它证明苹果有能力在两年内从零重建一个AI助手,但它还没有证明这个重建的结果值得等待两年。接下来的测试版反馈和正式版表现,才是真正的答案。
H2 常见问题
Siri AI什么时候正式推出?
Siri AI的开发者测试已于WWDC 2026后立即开始,正式版预计与iOS 27、iPadOS 27和macOS 27一同在2026年秋季推出。
中国大陆用户什么时候能用上Siri AI?
目前没有明确时间表。苹果表示需要配合监管要求推进相关工作,国行版本可能由本土AI模型提供支持,但具体上线时间尚未公布。
Siri AI需要什么硬件配置?
Siri AI的端侧模型门槛提高到12GB RAM,这意味着iPhone 15 Pro及更新机型才能完整支持端侧AI功能,旧款设备可能只能使用简化版本。
Siri AI和旧版Siri最大的区别是什么?
旧版Siri是“语音指令工具”,新Siri AI是“对话式助手”。核心区别在于:支持多轮对话、能跨应用执行任务、能理解屏幕内容、有独立应用可以打字交互、能模仿用户写作风格。
Siri AI的数据会传给Google吗?
苹果表示用户数据在到达Google Cloud之前会剥离所有个人可识别信息,查询以无状态方式处理,合同禁止Google利用苹果用户数据训练模型。但数据确实经过了Google的基础设施。
为什么Siri AI不能总结网页链接?
这是苹果的有意设计。Siri AI在系统层面被设定为不能读取或提取网页内容,苹果选择不做一个“消费出版方内容但不带来流量”的AI。

