文章摘要
小米澎湃OS 4 Beta版开启公测招募,其中超级小爱2.0是核心升级。它从传统语音助手进化为AI Agent,能主动执行需求。小米做AI Agent有独特优势,具备模型能力和终端触点。其能力围绕跨端记忆和跨端执行,交互体验也有多处优化。目前多数AI Agent产品较单一,超级小爱2.0率先做出示范,让智能生活逐步照进现实。

最近小米澎湃OS 4 Beta版开启了公测招募,没有举办正式发布会,官方表示将通过更多用户的实际反馈来持续优化使用体验。作为关注智能交互的观察者,我最在意的正是这套系统中暗藏的核心升级——超级小爱2.0。

作为95后,我们对人工智能的最初印象,大多绕不开小爱同学。从家里那句标志性的“我在~”回应,到初代超级小爱,再到如今的超级小爱2.0,它早已不是当年那个简单的语音助手了。看着它一步步进化,就像见证自己养的数码宝贝成长,既熟悉又充满新鲜感。

从传统语音助手到AI Agent,二者的体验跨度可以说是颠覆性的。早期的语音助手,不管是小爱还是其他同类产品,本质上都只是被动的指令响应系统:你说查天气,它调取天气接口返回结果;你说放首歌,它打开音乐应用播放。你问什么它答什么,全程被动、单轮互动,只能完成简单的单次指令。

而AI Agent则完全不同,它更像一个可以全权委托的助手,能够独立完成一整套完整的任务。你不需要告诉它每一步该怎么做,只需要说出最终想要的结果,它会自行规划执行路径、调用所需工具、完成操作流程,最后把完整的成果交付给你。超级小爱2.0正是这样的产品,小米官方将其总结为:从一个“听得懂”的对话框,升级成了一个“做得到”的协作伙伴。

在我看来,“听得懂”只是语音助手时代的基础标准,而“做得到”才是AI Agent时代真正的门槛。超级小爱2.0的核心升级围绕三个方向展开:全面重构AI架构、深度集成Xiaomi MiMo自研大模型、针对跨应用跨设备场景做了专项优化。这三重升级叠加下来,让AI交互从单纯理解用户意图,进阶到了主动执行用户需求。

举个简单的例子,以前想要在相册里找到一张身份证照片,你需要手动打开相册、翻找目录,或者手动输入关键词搜索。现在只需要告诉超级小爱2.0“帮我找身份证照片”,它会自动规划查找流程、调用相册的检索能力,直接帮你完成查找。你不需要指导它每一步的操作,只需要说出目标即可,这正是AI Agent和传统语音助手的核心区别。

不少使用iPhone的用户习惯了Siri,但这些年Siri的进化始终乏善可陈。而超级小爱2.0,已经率先落地了很多我们曾经想象过的智能场景。

为什么小米做AI Agent有着独特优势?

过去两三年里我一直在关注AI Agent赛道,一直很好奇:为什么小米在这个领域的表现格外值得关注?目前布局AI Agent的玩家大致可以分为三类:

第一类是纯模型厂商,比如智谱、MiniMax、DeepSeek等,它们拥有顶尖的大模型能力,但缺少直接触达用户的终端设备;第二类是头部互联网厂商,比如百度、腾讯、阿里,它们拥有海量用户和丰富的应用生态,但基座大模型的能力参差不齐,同时也缺少端到端的生态闭环,在手机、汽车等硬件终端上的布局不足;第三类则是同时拥有软硬件和完整生态的终端厂商,小米正是这类玩家中最典型的代表。

小米的位置非常特殊,它既不是纯粹的模型厂商,也不是纯粹的互联网公司,而是夹在中间、同时具备模型能力和终端触点的独特存在。

先对比纯模型厂商:模型厂商的优势在于模型能力强,但最大的短板就是没有自己的终端设备。如果AI Agent只能局限在某个App内部运行,它能获取到的用户数据和感知范围就会被严格限制在这个App的权限之内。而小米不一样,它拥有手机、汽车、电视、音箱、手表以及数百款智能家居设备,这些设备每天都在产生海量的用户行为数据,覆盖了用户从起床到入睡的几乎所有生活场景。手机能记录你白天的活动轨迹,汽车能感知你的出行习惯,家里的智能设备能掌握你的生活偏好,当这些跨端的数据被打通之后,AI Agent对用户的理解深度,是单一App无法比拟的。这也是为什么很多模型厂商都在尝试推出自有硬件的原因。

小米的人车家全生态,几乎覆盖了用户全天的生活场景,跨端打通的数据让AI Agent能够真正理解用户的完整需求。

再对比头部互联网厂商:互联网厂商的优势在于应用生态丰富,支付宝、微信、高德等超级App都掌握在它们手中,但它们的基座大模型能力普遍不如专业模型厂商,同时也缺少端到端的硬件生态布局。更关键的是,互联网厂商之间存在天然的业务排他性,比如百度不会开放自己的服务给阿里的AI,腾讯也不会向字节的AI开放接口。而小米作为终端厂商,和各家互联网服务都没有直接的竞争关系,可以相对中立地接入支付宝、高德等第三方服务。目前超级小爱2.0已经接入了十多家开发者的服务,这种不排他的中立位置,让小米有机会成为连接模型厂商和互联网厂商的纽带,实现多方共赢。

除此之外,小米在AI和智能助手领域还有着深厚的积累。小爱同学从2017年正式落地至今,已经有近十年的时间,这十年间积累的用户使用习惯数据、设备控制数据、场景理解数据,都是新入局的玩家无法复制的宝贵财富。这些丰富的交互数据,正是AI Agent学习用户偏好、优化交互体验的核心素材,数据量越大,Agent就越懂用户。

超级小爱2.0的技术实现与交互细节

超级小爱2.0的Agent能力,核心围绕两个关键词打造:跨端记忆和跨端执行。

首先是跨端记忆,解决的是AI能不能“认识你”的问题。传统的语音助手没有记忆能力,你和它的每一次对话都是独立的,它无法记住你的个人偏好、日常习惯或者待办事项。而超级小爱2.0支持跨端记忆的云同步:你在手机上告诉小爱你喜欢喝冰美式,平板上它会记得这个偏好;你在电脑上设置了一个日程提醒,车机上也能同步获取这个信息。真正实现了“换设备不换脑”。

这个能力在小米的人车家全生态中价值尤其明显:比如你早上在家对着智能音箱说“今天要去机场”,出门上车之后,车机就会自动帮你规划前往机场的路线,当你到达机场时,手机会自动弹出登机提醒。整个过程你只需要说一句话,剩下的所有流程都由系统在后台自动完成。

其次是跨端执行,解决的是AI能不能“把事办成”的问题。光认识用户还不够,AI必须能够真正动手完成任务。超级小爱2.0的专家模式正是为此设计的:你只需要说出最终的需求,它会自行思考、规划执行步骤、调用相关应用、完成整个任务流程。它不仅深度接入了相册、笔记、录音、日历等小米自有应用的能力,也在持续拓展第三方生态的接入范围。

在交互体验上,超级小爱2.0也做了多处针对性优化:

第一是“上岛”功能。以前调用小爱助手之后,一旦退出当前界面就无法看到任务的执行进度。现在小爱思考和执行的状态会在小米超级岛上实时显示,用户可以正常使用其他功能,不需要停留在一个界面干等,任务完成后结果还会自动展开。这个设计解决了一个非常实际的用户痛点:AI完成任务需要一定时间,但用户不想被强制锁定在某个界面中等待。

第二是“灵感球”功能。用户可以直接指向屏幕上的具体内容,再通过语音下达指令。比如你看到一张照片里有某个细节需要处理,直接指向那个区域说“修一下这里”就可以完成操作。相比以前需要先唤醒识屏、圈选内容、再输入指令的老流程,新方案省去了好几步操作,大幅简化了交互步骤。

第三是新增的识别上岛能力。取餐码、取件码、排队码、寄存码、退货码这类日常需要用到的信息,现在可以通过上滑快速识别并调取。看起来只是一个小功能,但对于经常需要翻找短信找取件码的用户来说,这个细节能节省大量的时间。

从这些细节可以看出,小米在超级小爱2.0的产品打磨上确实下了不少功夫。更值得一提的是,超级小爱2.0并不只局限在手机上使用:更新小米互联服务App之后,除了小米自家的电脑和平板,甚至Mac和第三方Windows电脑,也可以调用超级小爱2.0的专家模式。这让AI Agent的能力从手机端拓展到了桌面端,进一步打通了不同设备之间的AI体验,让你在电脑上处理文档、整理数据、批量操作文件时,都可以让超级小爱2.0来帮忙。

AI Agent的未来趋势与超级小爱2.0的示范意义

AI Agent是当前智能交互领域的系统级大趋势,模型厂商、互联网厂商、手机厂商都在积极布局这个赛道。但说实话,目前市面上的大部分AI Agent产品,还都停留在单一终端、单一场景的阶段,很少有产品能够真正让普通用户每天都离不开它。

在终端厂商中,小米是最接近打造完整能力生态闭环的玩家。MiMo自研大模型、人车家全生态的海量设备与全天候场景、近十年积累的用户交互数据,这些条件叠加在一起,让小米在做AI Agent这件事上拥有了其他玩家难以复制的底气。

当然,这个领域也存在不少挑战:AI Agent的能力边界在哪里?如何保障用户的隐私与数据安全?跨端协同的体验如何做到真正无感?这些都是需要持续探索和解决的问题。相关负责人也曾公开表示,面对人车家全生态的海量设备,如何让用户真正用得上AI、用得方便,团队还在不断摸索,这话确实非常实在。

但我始终认为,AI Agent的发展方向是确定的:它绝非锦上添花的附加功能,而是下一代人机交互的核心范式。现在越来越多的设备都打着AI的旗号,各类厂商也都在跃跃欲试。而超级小爱2.0,已经率先做出了一个非常好的行业示范。

我甚至可以想象这样的日常场景:早晨被小爱温柔的声音叫醒,房间的灯光逐渐调亮,楼下的小米汽车提前打开了空调,刚好在你出门时停在单元楼下;一路上,小爱会为你播报准备好的AI资讯,同步电脑上昨晚Agent任务的完成情况,还会在车机上帮你回复最新的工作消息;晚上回到家,又是被超级小爱2.0安排得明明白白的舒适夜晚。那些曾经幻想的智能生活场景,已经一步步走进了现实。

以上内容不代表本平台立场,仅供读者参考