文章摘要
当前AI手机行业存在大模型参数不断升级,但用户实际体验未同步提升,无法闭环处理完整日常事务、难以适配个性化需求的痛点。vivo在年度终端开发者大会上推出“大模型+Harness”方案,落地蓝心大模型端云矩阵与系统级Harness开发者平台,联合第三方生态落地多场景,兼顾隐私保护,打造真正懂用户的个性化手机AI。

当AI技术发展到如今的成熟阶段,一个愈发凸显的现实矛盾逐渐浮出水面:对于手机这类贴身终端设备来说,AI能力的强弱,并不直接等同于用户体验的优劣。

AI能力更强,并不意味着用户「体验更好」。

举个简单的例子:当一条航班延误通知弹出时,基础AI或许可以快速总结通知内容、告知用户晚点时长,但当用户需要进一步处理后续事务时,问题立刻变得复杂——要不要改签转机、预订的酒店是否会受航班变动影响、第二天的会议能否按时参加,一连串的决策和行动需要被妥善安排。更棘手的是,当前的AI往往无法适配用户的个人习惯:比如用户是否愿意搭乘凌晨的后续航班、是否在意额外的出行成本、第二天的会议是否允许适当延迟,这些个性化的细节大多无法被现有AI系统捕捉。

即便是尝试调用或部署应用,也需要适配接口、MCP协议等一系列技术细节,普通用户很难独立完成。

这也让不少用户感慨:现在的AI看似能应对不少基础场景,但真要处理完整的日常事务,最终还是需要用户亲自上手补全后续步骤。

这也恰好解释了近两年AI手机市场出现的明显落差:各大厂商的大模型参数不断刷新,跑分竞赛愈演愈烈,但终端用户的实际体验却并没有随着模型能力的提升而同步升级。

模型能力一路上涨,Benchmark卷得飞起,但手机端体验却并没有随着模型变强自动升级。

一款手机如果想要真正替用户承接完整的事务流程,仅仅听懂用户的指令远远不够。它需要在严格遵循用户授权和隐私保护规则的前提下,实时感知当前的场景状态,记忆过往的交互和习惯,再自动调度匹配的模型、上下文资源、应用服务,将后续的事务一步步完整闭环。

到这个阶段,手机端的AI挑战已经不再局限于单一的模型性能,而是升级为一套涵盖感知、记忆、资源调度、任务执行和跨服务协同的系统性命题。

在刚刚结束的年度终端开发者大会人工智能分论坛上,头部手机厂商给出的技术落地路径,恰好切中了个人智能终端落地的核心命题:

以「大模型+Harness」构建个人化智能底座,重构OS体验。

这一方案的核心目标,是让AI个人助理真正服务于用户日常,让系统变得更贴合个人需求,也让手机能够真正理解每一位使用者的独特习惯。

谈及智能体(Agent)技术,端侧部署已经成为绕不开的核心方向。据行业调研机构预测,今年全球生成式AI手机的出货占比将达到45%,而去年这一数字仅为36%。

智能手机之所以再次成为AI落地的核心场景,本质原因在于它是离用户最近的终端设备,能够获取最完整的个人使用上下文——从屏幕上正在浏览的内容、相册里的图片视频、实时位置信息,到日常的应用使用习惯、长期积累的个人数据,所有信息都围绕这块几英寸的屏幕产生。

但技术发展的规律同样适用:当技术越贴近真实的用户场景,面临的约束条件也就越多。当AI真正进入个人终端设备,时延控制、计算成本、隐私安全和模型能力之间的平衡,成为了一道必须解决的选择题。复杂的推理任务和长链路事务需要更强的大模型支撑,但这往往伴随着更高的计算成本和更长的响应延迟;而本地部署的轻量小模型虽然响应更快、成本更低,但能力上限有限,且多数真实事务往往需要跨端协同完成。过去那种依靠单一通用模型包打天下的思路,已经难以适配终端场景的复杂需求。

类似的困境其实在芯片行业早有先例:当计算任务复杂度不断提升,仅依靠CPU承担所有计算工作,很快就会撞上功耗、效率和性能的天花板。最终行业给出的解决方案是异构计算:让CPU负责通用控制调度,GPU承接并行计算任务,NPU专门处理AI相关运算,ISP专注图像信号处理,系统根据任务类型动态将计算资源分配给最适配的单元。核心逻辑并非用最强的单元处理所有任务,而是让最合适的单元完成对应的工作。

将这一思路延伸到端侧AI模型的部署上,该头部手机厂商给出了极具终端厂商特色的解法:相较于多数大模型厂商不断训练更大、更通用的单一模型,该厂商更关注如何为每一位用户在手机上打造专属的AI能力体系。既然单一模型无法同时兼顾性能、成本、隐私和响应速度,那么不如让多个不同定位的模型各司其职,并由系统自动调度,实现端云协同的混合计算架构。

在本次开发者大会的人工智能分论坛上,该厂商推出的「蓝心大模型端云矩阵」,正是这一思路的具体落地。针对不同的场景需求,这套矩阵配置了多款定位明确的模型:识别语音、理解语义语气和用户意图的任务,交由端到端语音大模型BlueLM-Realtime负责;需要长期驻留在设备本地的感知和记忆功能,则由端侧大模型BlueLM-Nano承担;对于信息查询、日程管理、跨应用操作这类高频轻量场景,由响应速度更快的云侧模型BlueLM-Flash完成;而遇到复杂推理、长程规划的高难度任务,则由BlueLM-Pro接手。此外,当进入专业领域场景时,系统还可以自动调用外部顶尖专业模型进行能力补位。这也让AI模型从需要用户主动选择的独立产品,退居后台成为被系统自动调度的基础能力组件。

但长期运行在个人设备上的智能体,还面临另一道更棘手的挑战:人,本身就是一种「不断变化」的上下文。AI真正要理解的,从来不是一条孤立的指令,而是一个人此刻所处的状态,以及此前一路留下来的轨迹,它需要懂当下也需要懂过去。

随之而来的,还有另一道更棘手的问题:隐私和权限边界。个人AI想越用越懂你,就得持续感知设备上的信息,并逐渐积累日程、位置、操作习惯、历史任务等个人上下文。但感知范围越广、记忆时间越长,涉及的个人信息也越多,权限管理和隐私保护的压力自然会同步上升。因此,个人AI真正难的地方,其实是同时解决两件看似矛盾的事——既让AI拥有足够连续的个人上下文,又让这些感知和记忆始终运行在明确的授权边界之内。

围绕这个问题痛点,该厂商则把目光押在两个关键词上:「感知」和「记忆」。在用户授权和隐私保护前提下,把一次次零散的端侧交互,慢慢拼成对一个人的长期理解。

面向感知,端侧模型BlueLM-Nano通过轻量视觉编码器和UI专用Token,高效理解屏幕、图像、视频和文本;面向记忆,则通过SwiftKV、混合稀疏注意力和PLE逐层嵌入,将端侧上下文扩展至32K。

感知不断沉淀为记忆,记忆又让下一次服务更贴合你个体需求,一套越用越懂人的个人智能飞轮,也开始跑起来。

当一个AI能够看懂你此刻在做什么,记得你过去做过什么,又能在不同任务之间自动找到最合适的模型和能力,所谓个体专属AI助理,才真正开始有了个体二字的含义。

如果说模型能力解决的是会不会的问题,那么Agent真正进入系统之后,还要面对另一个更现实的事情:

AI能不能把一个任务,从头到尾自主地做完。

以前软件行业把这些统称为工程,Agent时代给工程重新起了个更时髦的名字:Harness。但有意思的是同样叫Harness,大模型厂商和终端厂商真正要解决的问题,并不完全在一个层面。

对于大模型厂商来说,Harness更多围绕模型展开:怎么让一个Agent稳定调用工具、保持更长上下文、跑更久的任务,以及在Sandbox里安全执行。到了手机这里,问题会再往系统深处走一层,难度也上了一个台阶:手机面对的重点,是怎么让AI执行过去由用户自己完成的那套手机操作流程。

过去十几年,智能手机建立起来的是一套以App为中心的「服务秩序」。打车要先找到打车软件,订酒店要打开旅行App,换句话说过去的手机系统,核心任务是让成千上万个App稳定地共享算力、存储、网络和硬件能力。但Agent进入终端之后,虽然App依然承载具体服务,但用户与这些服务打交道的方式也开始发生「变化」:Agent执行过程天然会穿透应用边界,连续调用不同服务、继承上下文,原本被App边界隔开的能力,开始需要在一次任务里被动态组合。当越来越多Agent都要处理意图理解、服务调用和跨设备协同,这些能力就不该再被每个应用和开发者重复造轮子。

也正是在这套终端范式开始松动的过程中,该厂商把其中一层关键能力,提前收进了手机系统,做出了一套「Agent原生的蓝心系统级Harness开发者平台」,把App时代的能力孤岛,改造成Agent时代的公共基础设施。

具体来说,感知和记忆层负责理解用户与环境,前者通过多模态信息获取当下状态,后者沉淀场景、偏好和历史交互,让不同Agent能够共享长期上下文。规划层负责路由、任务编排和反思优化,并持续调整执行路径、Token和成本;执行层则借助6000+系统级工具,以及MCP、A2A、CLI和统一API,把模型、Agent、Skill和外部服务真正接进手机、IoT乃至现实世界。由此,理解、规划、调用、执行也就形成了一个闭环,当底层的苦活被系统吃掉之后,开发者才终于能把时间花在真正值钱的地方。

此外,Harness还得解决一个Agent行业非常现实的问题:经验怎么留下来。人干同一件事十次,多少会学聪明一点。Agent今天绕八个弯完成任务,明天如果还原样绕八个弯,那它充其量是个拥有无限耐心的实习生。而在该厂商的这套系统级Harness中,这种「自进化」的能力也被进一步做成了一套具体运行机制。

基于观察—反思—沉淀框架,系统可以在用户授权下持续学习行为与反馈,并利用设备闲时复盘任务路径,把新的经验重新沉淀进系统能力。与此同时,统一意图、跨设备Runtime和上下文随行,让任务可以在手机、PC和平板之间继续跑;MCP和A2A再负责让Agent、模型和工具接力。这也意味着,个人AI长期积累的,开始从静态的用户信息,进一步延伸到动态的执行经验。当系统层足够成熟,对于开发者而言,剩下只需要考虑一件事:just do it。

AI行业过去几年花了大量时间研究怎么降低Token成本。到了Agent时代,另一项成本可能会越来越贵——协调成本。放在当前这个时间节点看,协调成本也正在迅速变成一项显性的系统成本。能力越多,调度、上下文、权限和执行链路就越复杂;模型能力越强,系统工程的重要性也随之上升。最后真正决定体验的,依旧是那条越来越清楚的分工:模型决定能力上限,系统决定这些能力最终能够兑现多少。

互联网过去二十年的商业史,某种程度上就是一部「抢入口」的历史。门户时代抢首页,搜索时代抢关键词,移动互联网抢桌面图标和App时长,超级App再把越来越多服务收进自己的围墙里。但Agent开始出现之后,这套规则有些不适用了。当用户只需要对AI说一句「帮我订一家川菜餐厅」,他已经不太关心背后打开了哪个App、调用了哪个服务。App时代争的是入口,Agent时代开始争的是谁能更靠近「用户意图」。这也是为什么今年从Cursor、Codex到GitHub Copilot,Skills、MCP等机制越来越往意图核心靠。

但在一众全球主流AI公司中,作为一家终端厂商,该厂商在生态层给自己的定位,显得有些克制。他们并不试图成为一个包办所有服务的全能选手,而是把自己放在了意图和服务之间,做一个「搭桥人」——一头,连接具体的Agent服务;另一头,连接真实的用户需求。

蓝心小V升级到Pro模式之后,该厂商试图做的,就是把这中间那层连接成本尽可能压低:开发者接入一次,能力就能被系统在不同入口中统一理解、调度和触达。与此同时,Agent、Skills、MCP、原子技能乃至端侧模型,也被逐步纳入同一套能力底座。意图服务的竞争单位,也开始从一个完整App,逐渐下沉到一项项可以被智能调度的能力。这也意味着,移动互联网过去十几年建立起来的「App即服务边界」,开始松动了。

2008年,苹果上线App Store时,真正把iPhone变成智能手机平台的,其实是一批批第三方开发者。从游戏到社交、打车、支付,这个应用商店的可用性很大程度上取决于外部服务能在这套系统里长出多少新的能力。平台比的是连接效率,生态共建比的是协同深度。真正能把生态做厚的,最终还是第三方伙伴有没有在里面跑出新的产品形态和真实结果。而在这个事情上,该头部终端厂商也长出了不少具体注脚——

民生服务场景,该厂商联合支付宝重构终端服务形态,将能力拆为服务直达、服务执行和MCP Skill,让更多生活服务一句话办完。在本地生活领域,美团将吃喝玩乐等能力接入蓝心小V,通过Agent,串起原本分散的服务入口。在出行场景,深度联动高德地图,小V一句话即可完成导航、路线规划、生活服务与POI查询。在电商消费端,京东进一步打通跨App圈选、多模态识别、商品搜索到支付的完整链路。在刚刚结束的开发者大会圆桌讨论上,围绕第三方生态,来自京东和支付宝的合作伙伴围绕各自与该厂商的合作实践,分享了Agent服务在终端落地过程中遇到的真实问题,以及生态协同带来的新解法。而这些,也正是终端生态从「把服务接进来」,继续走向「让服务真正跑起来」必须补上的一环。

当然,技术赋能到底有没有价值,还要看它是否照顾到那些容易被忽略的需求。事实上从2021年发起「声声有息」公益计划至今,该厂商也已经开放27项无障碍功能,覆盖超过110万残障用户。其多模态手语大模型也基于8000多个国标词汇、100万段视频训练,从单个手势识别走向连续手语理解,并已用于实时翻译和手语学习。当AI开始听懂那些过去常被系统遗漏的表达,所谓个人化智能,也就有了更有温度的意义。

今天,当整个行业再聊端侧、手机、模型和Harness,会发现几者之间的界限其实正在变得越来越模糊——模型开始进入系统,系统开始接管执行,端侧负责理解和记忆,云端补足更复杂的能力。但站在用户这一边,所有技术名词最后其实都会收敛成一个很简单的体验:

能不能真正懂我,能不能帮我办事。

真实生活从来都不是一道孤立的Prompt,它是一连串习惯、偏好、临时变化和前后关联的小事。用户不需要知道背后跑的是端侧模型还是云端模型,也不需要理解Harness、MCP和A2A分别做了什么。他只会慢慢发现,很多事情不用再从头解释,很多操作也不用再自己一层层点下去。这或许就是「个人化智能」更实际的一层含义:AI开始从理解一条指令,走向理解一个具体的人。

该厂商这次给出的大模型+Harness路径,最终要缩短的正是这段距离:让模型能力穿过系统工程,真正落到每一次具体的日常需求里。手机,由此也不再只是一个装着AI的设备,而开始有点像一台属于「我」的专属助理。

以上内容不代表本平台立场,仅供读者参考