京东JoyAI构建物理AI闭环:数据与模型双驱动

在2026年的行业展会中,机器人已经多到难以成为新闻。它们可以完成跳舞、递物、整理货架等流畅的固定动作,但越是顺滑的演示,越容易掩盖行业真正的核心难题:只要稍微改变环境,比如调整货架位置、调暗灯光,或是延长任务时长,演示的确定性就会快速消失。
今年有超过200家具身智能企业参与这场展会,行业竞争表面仍围绕机器人本体、关节和基础动作展开,但展台背后,一场更关键的较量已经悄然开启:谁能让模型持续理解变化中的现实场景,谁能规模化获取更多真实操作经验,谁又能把机器人运行中的失败重新转化为训练数据,实现闭环迭代。
这正是物理AI受到广泛关注并快速升温的核心原因之一。物理AI的竞争早已超出单台机器人的性能范畴,真正拉开差距的,是数据、模型、终端与场景能否形成持续迭代的完整闭环。
在这条更长也更具挑战的赛道上,京东是一位特殊的参与者。作为领先的电商巨头,京东选择全力押注物理AI领域,今年上半年陆续开源JoyAI系列多款模型,围绕真实世界的感知、交互和行动构建了完整的技术体系,并提出了「建设全球最大物理世界运营中心」的战略目标。
在近期举办的「AI 进入物理世界」主题分论坛上,京东集中对外展示了这套完整布局。除了首次集体亮相的JoyAI全系列大模型矩阵,具身数据采集体系、JoyInside智能硬件和京东云AI基础设施也一同登场,它们连同全链路业务场景共同组成了京东的物理AI闭环。
京东这套布局,试图回答行业共同面对的关键问题:当AI从文本、图像和软件环境走向物理世界,究竟需要怎样的能力体系?为此京东抛出了「数字智能 - 附身智能 - 具身智能」的三阶技术路线:数字智能负责构建语言、多模态与智能体的基础能力;附身智能将这些能力嵌入手机、汽车、家电等不同终端设备;具身智能则进一步把模型部署到机器人等硬件中,使其能够在真实环境中完成实际操作。
在这条技术路线的指引下,模型、数据、云基础设施、智能终端和业务场景被真正咬合联动,形成了一套能够把每次运行转化为反馈、把每次失误沉淀为经验,并反过来推动模型持续迭代的物理AI系统。
看懂世界只是第一步 模型要能择机而动
哪怕单项能力再强,只要感知、判断和执行之间出现断档,机器人依然无法完成实际工作。京东要补齐的,正是物理AI从「看见」到「行动」的完整链路。
物理世界的任务很少只涉及单一模态,比如机器人整理货架,需要同时识别商品与空间位置、判断抓取顺序,并根据现场变化随时调整动作。这要求模型既要看懂当下的场景,也要理解变化的过程,还要在合适的时机做出回应,并将判断转化为设备可以执行的具体动作。沿着这条链路,JoyAI系列模型正在逐步构建起AI进入物理世界所需的全部核心能力。
首先在视觉与空间层面,JoyAI-Image将图像理解、文字生图和指令编辑纳入统一框架,并重点强化了空间关系建模能力。JoyAI-Image-Edit则进一步聚焦指令驱动的精确空间编辑,支持物体位移、旋转和视角变化,在编辑过程中尽可能保持主体特征、场景结构和遮挡关系的稳定。
对于物理AI来说,JoyAI-Image系列的价值早已超出图像生成本身。机器人要在现实世界中完成抓取、搬运和导航,首先必须准确识别物体的位置、距离以及遮挡关系、视角变化。如果缺少稳定的空间认知能力,再逼真的画面也无法转化为可靠的行动。空间理解与可控编辑能力的提升,恰恰为VLA系统和世界模型补上了关键的视觉底座。
物理AI面对的是持续变化的真实环境,除了空间关系,还需要处理时间维度上的连续过程。JoyAI-Echo面向长时、多镜头音视频联合生成,通过缓解生成过程中的误差累积和时序连贯性问题,能够保持跨镜头角色外观与音色的一致性。
本次论坛亮相的JoyAI-Video-Edit则将视频能力延伸至流式编辑,展示了更接近实时交互的视频创作方式。用户面对变化中的视频画面,可以直接用自然语言增删物体、替换人物、迁移服装,甚至重构整个场景。模型可以在连续帧中识别人物与物体,追踪其位置和动作,并让修改后的内容保持稳定一致。
这彻底改写了视频编辑的生产方式,过去需要专业软件和繁复流程才能完成的工作,如今只需看着画面、说出想法,就能实时完成修改。
实时响应正在取代过去「提交指令、等待结果」的传统人机交互模式,沿着这个方向,京东从视觉和语音两个维度展开了更深入的布局。
JoyAI-VL-Interaction可以持续处理视频流,并根据现场状态自主判断何时回应、何时保持安静,或是将复杂任务交由后台模型和智能体处理。它对应的是AI在物理世界中的持续在线能力,比如观察用户动作、识别操作是否中断,并在必要时主动提供帮助。
同样在本次论坛亮相的JoyAI-Talker实时语音交互模型,将AI与人的交互进一步推向了全双工语音时代。它在保留认知与推理能力的基础上,强化了情绪理解、共情反馈和自然表达能力,能够在低延迟的连续对话中实现边听、边想、边回应。
对于未来的家庭终端、陪伴设备和服务机器人来说,AI可以承担更完整的交互闭环,既能听懂指令、确认意图,也能捕捉用户情绪并给予恰当回应。人机交互将从机械问答,逐渐演变成真正有节奏、有情绪、能持续推进的自然交流。
能力链的最后一环,落在了JoyAI-RA模型上。作为面向通用机器人自主操作的VLA模型,它可以接收视觉观察与语言指令,直接将模型对环境和任务的理解转化为可执行的动作。前面的模型让AI看懂、听懂并理解现实世界,而JoyAI-RA则负责让这些认知真正落实到机器人的实际行动中,至此物理AI从感知、理解、决策到行动的关键链路正式闭合。
要教会机器人干活 先把现实变成数据
模型能够理解空间、输出动作,但无法凭空获得现实世界的操作经验。真正卡住具身智能发展的数据问题,不只是「数量不够」,更在于如何低成本、规模化地记录人类的实际操作,并将这些经验转化为机器人可以学习和复用的训练材料。
传统互联网数据可以提供知识和视觉表征,但缺少连续、细粒度的物理操作过程数据。而真机遥操作数据虽然能够与机器人的动作空间直接对齐,但其采集成本高、扩展速度慢,很难在短时间内覆盖家庭、零售、工业和服务等高度开放的真实场景。
京东选择从人类第一视角视频入手,希望在数据质量与采集规模之间找到新的平衡:不依赖昂贵的真机完成全部采集,先记录人类在现实任务中的自然操作,再从中提取动作轨迹、空间结构和任务语义。
京东开源的EgoLive数据集,是目前行业规模最大、面向真实世界任务演示的第一人称视角数据集,也是这一方向的重要阶段性成果。
该数据集包含2000小时、60帧率的高保真双目视频,采集了65866个任务片段,覆盖家庭服务、零售、物流等场景的346项真实任务,并提供了相机位姿、三维手部关键点、深度、手部与交互物体分割、子任务切分和语言描述等多维度标注。
而EgoLive这样的大规模具身数据集,依靠京东自研的超高清采集终端JoyEgoCam来完成采集。该设备搭载了双目RGB相机并集成IMU,前者可以提供类似人眼的宽视场,后者的测量频率达到200Hz。在不干扰双手操作的前提下,它可以记录人类在居家、户外和产线中的自然行为,并为后续的动作轨迹、空间结构和语义标注提供原始数据。
目前JoyEgoCam可以在多种场景下实现即戴即采。在家庭场景中,京东打造了全国首个具身智能数据采集社区,让普通人在擦桌子、叠衣服、整理收纳、地面清洁等日常活动中就能完成工业级别的数据采集。围绕JoyEgoCam打造的数据采集网络还扩展到了物流仓储、工业制造、健康医疗、城市运维等其他核心场景。
今年3月,京东提出将建设全球最大的具身智能数据采集中心,目标是在两年内采集1000万小时高质量数据。通过提供标准化、可分布式部署的采集设备,JoyEgoCam降低了分布式采集的设备门槛,但要兑现1000万小时的采集目标,仍需要采集网络、质量控制和数据处理成本实现同步扩张。
并且,数据采集只是京东打造具身数据全链路基础设施的第一步。数据上传至云端之后,还要经过清洗、对齐、转换、预标注和其他标准化处理,再经由JoyBuilder仿真平台补充真实采集中难以覆盖的长尾场景,最终进入模型训练、评测和部署环节。具身大模型JoyAI-RA就是以自采数据为核心训练而来的。
这套数据体系的核心价值,在于让具身数据摆脱一次性采集的局限,转入持续生产的循环。真实场景会不断产生新的操作样本,而模型能力提升后又会反过来提高数据筛选与标注的效率,推动物理AI学会更多任务,并进入更多的应用场景。
从训练到部署 还需闯过端云两道关
如果说模型和数据解决的是机器人「如何学会干活」的问题,那么智能终端和云基础设施则决定了这些能力能否走出训练场、进入具体设备,并从单次演示转变成大规模、常态化的运行。
在京东的整体布局中,JoyInside承担了智能终端层的角色,它将感知、理解、记忆和交互等能力嵌入具体的设备中,让模型能够通过硬件接触用户和现实环境。其接入范围从AI玩具、下棋机器人和机器狗,扩展到了智能床垫、打印机、小夜灯等家电与健康设备。
随着接入品类的增加,京东也开始探索多个终端围绕同一生活需求协同工作的「AI空间」,比如在卧室场景中,床垫、灯光等设备可以围绕睡眠需求提供一体化服务。这一方向仍处于逐步搭建的阶段,但已经反映出智能硬件竞争正在发生的重要变化。
过去,AI更多是以问答和控制功能附着在单个设备上,但在更大的物理空间中,设备需要感知环境、理解用户状态,并把交互结果反馈到后续的服务流程中。因此,终端之间是否有能力围绕具体任务形成协作,已经成为新的竞争变量。
目前,JoyInside已经与近200个家电家居、机器人和AI玩具品牌开展合作。今年内,JoyInside预计将接入超过1000万台智能硬件设备,这也是其「连接万物、构建AI World」目标的重要组成部分。
智能终端负责把AI带入现实空间,而京东云则支撑起背后的计算与工程体系。
物理AI对基础设施提出了更为严苛的要求:它面对的数据体量更大、任务链条更长,部署环境也更加分散。从实验室进入真实环境后,模型必须连续跨过数据处理、训练调优、推理部署、版本迭代和运行监控等多道工程关口,任何一个环节出现问题,都可能让模型停留在演示阶段。京东云打通并托住了整条链路,让物理AI从「能够运行」进一步走向「稳定运行、持续迭代和规模化落地」。
智能终端与云基础设施的结合,让物理AI真正具备了进入现实世界并连续运转的根基:智能终端打开入口,让模型抵达家庭、零售、工业和服务现场;云基础设施托住后方,承接不断增长的计算、部署与运维压力。
物理AI的终局 落在现实世界的持续运营
物理AI的最终价值,需要到真实场景中去验证。展会中的各种预设操作,只能证明模型与本体的单项能力,但当进入家庭、仓库、门店或工业现场后,系统面对的是随时变化的空间、突然出现的状况或是训练数据未曾覆盖的场景。能否在这些不确定性中连续工作、兜住故障并越用越好,成为决定物理AI能走多远的核心因素。
家庭是京东连接物理世界的其中一个入口,其更具差异化的竞争基础,来自于运行成熟的零售、物流、工业、健康、家政、外卖等服务网络,这些场景为模型训练、部署和验证提供了丰富的实践基础。每天,海量商品、人员、设备与业务系统在其中流动,共同构成了一张规模庞大的物理网络。
这让京东「建设全球最大物理世界运营中心」的战略目标有了更具体的落点:JoyAI模型矩阵构成能力中枢,具身数据体系记录真实世界经验,京东云承担训练与运行支撑,JoyInside和机器人等终端将模型接入现实场景,并在具体业务中完成验证和迭代。
展会中的演示终会结束,但物理世界中的任务却不会停止。京东这一战略目标的最终实现,取决于以上各个环节是否真正打通,以及AI在现实业务中能够创造出多大的实际价值。


