文章摘要
今年WAIC展会热度爆棚,AI不再局限于数字屏幕,开始向真实场景渗透。京东在展会上首次集体展出JoyAI全系列大模型等成果。其带来的JoyAI模型“全家桶”覆盖物理AI所需能力,还展示了数据采集链路和开源数据集。此外,京东通过JoyInside将AI带进家庭场景,相关智能硬件网络扩张迅速,物理AI形成持续循环机制。

今年的WAIC展会热度依旧爆棚,即便到了开展第三天,现场依然人头攒动,火爆程度丝毫不逊上海同期的高温天气。更有消息显示,展会门票甚至被黄牛炒到了三千元一张。

观众的热情并非毫无缘由,本届展会现场的看点十足:机器人模拟药房拿药取药、多台机器人组团举办演奏会,还有大量嵌入真实硬件的智能体与操作系统悉数亮相。过去一年里备受关注的具身智能、世界模型、AI Coding、Token经济、AI硬件等技术概念,今年都在展会现场得到了具象化展示。

和去年逛展时大家更多讨论“AI还能做什么”不同,今年最明显的变化是,AI已经不再局限于数字屏幕,开始向工厂、家庭、药房、穿戴设备等真实生产与生活场景渗透。

在众多参展商中,京东的亮相格外引人注目。这家以零售起家的企业,此前官宣要打造全球最大的物理世界运营中心,如今已经将最新成果带到了WAIC现场。本次展会,京东首次集体展出了JoyAI全系列大模型、具身数据采集与训练链路,以及基于JoyInside底座打造的京东AI Home。

逛完本届WAIC不难发现,AI的能力边界已经从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。曾经停留在概念层面的智能技术,如今已经真正进入工厂、家庭和各类终端设备,参与到现实世界的运转中。

近两年大模型进入密集发布期,走进WAIC主场馆不难发现,图像、视频、语音、交互、具身等多个赛道的模型几乎覆盖了所有热门方向。但值得注意的是,在真实的物理环境中,单一模型给出的判断只是整个AI任务执行流程的起点,后续的路径规划、设备控制、动作执行与结果反馈,每一个环节都直接影响任务能否形成完整闭环。因此,物理AI对模型能力的要求,已经从单项能力的突破,延伸至感知、理解、决策、执行的系统协作。

在本届WAIC现场,京东带来了一整套面向物理世界的JoyAI模型“全家桶”,从语音、图像、视频、实时交互到具身智能,覆盖了物理AI所需的全部模型能力。

对于物理AI来说,视觉能力决定了其能否建立对现实环境的连续认知。在机器人真正开始行动前,首先需要弄清周围有什么、物体位于何处,以及彼此之间的空间关系。京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,分别对应了视觉能力向物理世界延伸的不同维度:JoyAI-Image-Edit实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素转向理解空间结构;JoyAI-Echo通过跨模态记忆维持长视频的一致性;JoyAI-VL-Interaction则将理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边完成交互并调用智能体。

本届展会京东还展示了多模态领域的最新研究成果——实时视频编辑模型JoyAI-Video-Edit,用户可以自定义画面并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。从长时一致性、实时理解到即时修改,这几款模型补齐了动态视觉的各个环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。

视觉模型让设备看懂周围环境,但当设备进入家庭和零售场景时,还要面对更复杂的变量——人的指令。现实中的交流很少遵循标准格式,语气、习惯和表达方式因人而异,物理AI能否真正听懂指令,直接决定了后续动作是否会跑偏。

本届WAIC上,京东不仅亮相了语音生成基础模型JoyAI-Voice,还同步发布了全新的语音交互模型JoyAI-Talker。该模型能够识别用户的情绪与真实意图,根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断的能力。这意味着人与物理AI的交互不再局限于一次性下达指令,而是可以实现持续沟通:设备可以在执行过程中接收反馈、暂停动作、理解新的需求,并及时调整后续行动。

能够看懂环境、理解人的意图后,物理AI还要跨过最后一道门槛——让真实设备将模型的判断转化为具体动作。京东的JoyAI-RA移动操控基础模型,正是解决了从决策到行动的转换难题:通过统一训练框架,让不同机器人与人类操作经验在同一套动作表达中完成对齐,再结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差。至此,物理AI在模型能力上才真正完成了从感知、理解、决策到行动的完整闭环。

即便机器人在模型中学会了看、听、理解和规划,进入现实世界后依然可能被一只摆歪的杯子“难住”。模型给出的只是智能上限,这些能力能否迁移到物理世界的真实任务中,很大程度上取决于机器人在物理世界中积累的经验。正如“读万卷书不如行万里路”,这个道理在机器人身上同样成立。随着机器人走向现实环境开展真实作业,具身数据采集这一关键环节的重要性日益凸显。

与大模型的语料训练相比,机器人学习所需的真实经验获取难度要大得多,即便数据规模上去了,机器人也可能因为低质量数据被“教坏”。京东曾做过一组直观的对比实验:分别用1万小时高质量数据和1万小时存在瑕疵的数据训练模型,结果发现,即便持续增加有瑕疵的数据量,模型效果也未必提升,甚至还会越练越差。

在京东看来,数据采集的时长只能反映采集规模,真正决定训练价值的,是动作、轨迹、任务结果和场景变化能否被准确记录和理解,这背后还牵涉标注模型、算法精度与数据处理等一整套技术链路。由此形成的“数据采集—模型训练—真机验证—反哺采集”的数据采集闭环,才是物理AI真正走进现实世界的关键。

目前这套围绕真实数据持续运转的具身智能数据采集飞轮已经取得了最新进展:京东已经动员60万人参与数据采集,建设了全球最大的具身数据采集中心,预计两年内将采集1000万小时的人类真实数据。围绕数据采集、仿真训练与真机验证,京东还构建起了全球首个覆盖“采、存、标、训、评、仿、测”的全链路具身数据基础设施,从人类的操作方式,到机器人的学习路径、错误修正方向,再到后续缺失的数据补充,全部被纳入同一个持续循环的系统中。

这条数据链路的最新成果也被带到了本届WAIC现场。京东在展会上开源了行业规模最大的人类第一视角数据集EgoLive,该数据集包含2000小时视频、65866个Episode,覆盖346项真实世界任务,将人类在生活和作业现场积累的操作经验转化为具身模型可以反复学习的“现实教材”。

京东选择第一视角的数据采集方式,背后有着明确的行业判断:具身智能真正稀缺的,是能够同时保留环境信息、动作过程与任务意图的高质量真实数据,而第一视角采集恰好提供了一条适合规模化的路径——它可以沿着人的视线,完整记录看到的场景、双手的动作以及任务的完成过程,同时减少对特定机器人本体的依赖。目前这条路线已经在多个实际任务中得到验证,使用京东第一视角数据和机器人数据后,任务准确率实现了两位数的提升。

为了让观众更直观地感受具身智能的完整链路,京东在展会现场搭建了展示场景:参观者戴上京东自研的超高清采集终端JoyEgoCam,在货架前完成一次真实作业,人看到的画面、手部的移动轨迹以及物品的拿起和摆放过程,都会以第一视角完整记录下来。这些数据随后经过自动标注、质量优化和结构化处理,被送入数字孪生环境中进行训练和评测,最后再部署到实体机器人上,完整跑通了具身数据从采集到训练、再到真机验证的闭环。

AI真正走进物理世界的最终落脚点,是能否在真实场景中解决实际问题。不同场景的AI嵌入难度差异巨大:工厂和物流更像是边界清晰的封闭题,货物来源、机械臂操作路径、设备运行规则大多可以提前定义,任务完成与否也有明确的量化指标;但家庭场景则要复杂得多,家里的各类设备都有各自的系统和交互逻辑,数据分散在不同设备中,更难以预测的是人和环境的突发变化——比如孩子突然哭闹、老人深夜起床、宠物挡住扫地机器人等情况,几乎无法提前穷举。正因如此,家庭场景成为物理AI最难进入,但同时也是最具战略价值的场景之一。

目前京东已经将模型与数据能力接入到各类具体设备中,通过智能终端将AI技术真正带进了家庭场景。面向真实的物理场景,京东将自研JoyAI大模型的能力封装成了一套面向智能硬件的AI大脑——JoyInside。从定位来看,JoyInside更像是连接模型与硬件的AI系统,它将JoyAI的感知、理解、记忆和交互能力接入具体设备,同时处理家庭场景中的语音识别、意图理解、长期记忆和多设备协同。

京东对于家庭设备有着更具“具身”意味的理解:此前京东科技AI创新业务相关负责人曾提到,家里的台灯、床垫、空调、机器人和AI玩具,其实可以被看作一台拆散了的“积木式机器人”,每台设备负责一种感知或行动,而JoyInside则让它们逐步理解家庭成员的需求,并在不同场景中相互配合。

这套思路在本届WAIC现场得到了具象化展示。比如搭载JoyInside的智能睡眠床垫,可以持续捕捉用户的睡眠体征,并结合当前状态主动询问用户的感受,让传统床垫拥有了持续感知、主动判断和提供服务的能力。

再比如学习场景中的JoyInside AI投影台灯,通过无屏漫反射投影与多模态扫题批改功能,它可以识别纸面题目、书写内容和学习进度,将模型生成的讲解与反馈直接投射到桌面,实现实时答疑和订正。这意味着AI的交互界面开始从屏幕里的对话框延伸到真实的学习空间,一盏传统台灯也由此升级为具备“感知—理解—反馈”能力的物理AI终端。

由这些智能硬件组成的物理AI网络,扩张速度远超预期。目前接入JoyInside的智能硬件,对话轮次平均提升超过120%,JoyInside的合作范围已经覆盖近200个家电家居、机器人和AI玩具等行业品牌,预计到今年年底,JoyInside将接入超过千万台终端设备。

回过头来看,京东提出的“全球最大物理世界运营中心”战略目标,已经从最初的愿景,逐渐成长为包含模型、数据、设备和真实场景的完整体系。对于这家从零售起家的企业来说,物理世界从来都不是抽象的概念——货物如何流动、仓库如何运转、设备如何协同、用户需要什么,都是京东过去二十多年每天都在处理的日常问题。当模型、数据、基础设施、终端与业务场景逐步贯通,物理AI形成了一套持续循环的运行机制:在真实环境中感知与行动,在执行过程中获得反馈,再将反馈沉淀为数据,推动模型进一步迭代。AI也由此从云端,一步步走向了京东最熟悉、积累最深的物理世界,物理世界的AI终于迎来了它最理想的形态。

 

以上内容不代表本平台立场,仅供读者参考