文章摘要
在JDD大会上,京东展示了服务视障群体的AI辅助眼镜,该产品搭载全球首个全栈开源实时自主交互多模态大模型JoyAI-VL-Interaction。本次大会京东升级发布JoyAI物理AI基础模型矩阵,构建完整技术数据链路,推出多个落地行业模型,公布未来三年技术里程碑,明确AI从数字世界走向物理世界的战略布局。

「麻烦你,帮我看一下。」

这是视障人士在陌生环境中常挂在嘴边的一句话,而一副AI辅助眼镜的价值,或许就藏在少说这样一句求助的瞬间里。对于视障群体来说,在陌生场景中最需要的不是能闲聊的AI助手,而是能精准感知环境、适时给出提醒的陪伴者:该提醒时及时发声,无需打扰时安静待命,不造成信息过载。

京东在本次JDD大会上展示的AI辅助设备,正是瞄准了这一需求:这款眼镜接入了JoyAI-VL-Interaction模型,通过第一视角持续感知周围环境,为全盲和低视力人群提供贴身辅助,减少他们不得不开口求助的时刻。这不仅是一款充满人文关怀的智能硬件,更是观察京东AI技术布局的关键切口。

大会期间,京东不仅发布并开源了JoyAI-Echo WM实时可交互世界模型,还带来了一整套面向物理世界的JoyAI基础模型矩阵升级。从看懂实时环境,到判断是否需要介入,再到预判行动可能带来的变化,一副眼镜背后,展现的是京东从数字世界走向真实物理世界的完整技术链路。

何时开口,才是核心难题

很多人以为AI辅助设备的难点是“看懂”周围环境,但实际戴上眼镜才会发现,第一道门槛是“该不该开口”。当你走在马路上,左侧车辆正在倒车、右侧有台阶、前方有人招呼,所有信息同时涌来,没有聊天框等待你输入指令,设备必须自主判断:左侧的车辆需要提醒吗?前方的招呼要不要传达?台阶是立刻告知还是等走近再说?

过去两年的AI竞赛更多聚焦在“回答准确率”,但可穿戴设备的第一题,却是“是否需要给出回应”。传统的辅助方案往往采用多模块拼凑的架构:先用传感器识别物体,再通过规则引擎判断距离,最后调用语言模型生成语音播报。这种架构环节多、延迟高,往往需要数秒才能完成响应,更棘手的是,在复杂动态的真实场景中,很容易出现“误报”或者“失语”——该提醒的没说,无关的信息却吵个不停。

JoyAI-VL-Interaction走出了完全不同的技术路线。这款8B规模、以视觉为核心的交互模型,是全球首个全栈开源的交互模型与系统。从架构层面,它将感知、推理和交互决策整合在同一个模型中,不再依赖外部的检测器和规则引擎。

它可以对持续的视频流进行实时理解,自主判断何时该发声、何时该静默,将响应延迟压缩到亚秒级。当遇到需要调用工具或深度推理的复杂问题时,它会将任务异步委托给后台Agent处理,前台依然会持续监控现场环境,不会因为后台忙碌而让使用者陷入无回应的尴尬。

根据京东集团副总裁、京东探索研究院副院长段楠的介绍,这是全球首个开源的、可实现真正实时自主交互的多模态理解大模型。在58项真人盲评测试中,它对比豆包视频通话助手的胜率达到77.6%,对比Gemini的胜率达到87.9%,在流式交互模型领域达到了顶尖水平。这种设计背后,是AI交互范式的彻底切换:从“被动回答问题”转向“主动持续在场”。

屏幕内的聪明,已无法适配物理世界

当AI通过可穿戴设备持续感知真实环境时,它需要的能力早已超越了读懂一段文字或一张图片的范畴。理解、生成、实时交互、世界建模、具身操作,任何一个环节的缺失,都会让AI只能停留在屏幕的虚拟世界中。

段楠曾指出,相比数字AI,物理AI不仅需要物理数据的规模化,还需要持续学习的规模化、物理基础模型的突破性进展,以及一个数字AI不具备的新维度——硬件规模化协同。只有数据、模型、算法和硬件四条腿协同前进,才能真正走进物理世界。

这也是本次JDD大会京东集中展示JoyAI基础模型矩阵的核心逻辑。物理世界的真实场景,天然需要一整套协作的能力栈:从生成视觉内容、实时编辑视频,到听懂语音、生成自然语言,再到理解并模拟世界运行规律,最终落地到机器人操作。每一个模型都是独立的能力单元,组合起来则构成了从“看见”到“动手”的完整技术链路。

在这套模型矩阵中,最值得关注的是JoyAI-Echo WM。和侧重物理保真度的视频模型不同,JoyAI-Echo WM聚焦的是交互保真度:当人类进入模拟的虚拟世界后,环境会如何根据人的动作做出响应。作为一款实时可交互世界模型,它可以根据用户的控制信号持续生成并动态调整画面与声音。在WBench导航评测中,它拿到了81.7的综合得分,交互得分更是达到87.2,位列行业前茅。

更关键的是,它生成的不只是静态画面——环境音效、背景音乐、语音提示都会和画面同步演化,构建出一个可以“沉浸式交互”的虚拟世界,而非一段播放完毕就结束的视频。JoyAI-Echo WM本质上是沉浸式环境的交互引擎,而它的技术积累离不开JoyAI-Echo的前期研发。段楠提到,JoyAI-Echo在长程视频多模态记忆、音画同步和后训练方面实现了关键创新,为后续的视频世界模型打下了坚实基础。

2026年,世界模型赛道已是AI行业最拥挤的赛道之一,但京东的差异化优势不在于模型参数规模,而在于它手握仓库、门店、产线等大量真实物理场景。这些场景没有标准化的布景和预设的灯光,甚至地面平整度都无法保证,但也正是这种非标准化的真实场景,让率先跑通落地的企业能够拿到物理AI的入场券。

从模型到真实世界:数据闭环与行业落地

基础模型矩阵是能力的核心,但要让技术真正走进物理世界,还需要两条关键管道:一条通向数据验证与迭代,另一条通向真实业务场景落地。

在数据管线方面,京东同步展示了三项技术成果:

  • EgoLive是目前开源的规模最大、聚焦真实世界任务导向型人类日常活动的第一人称标注数据集,收录了2000小时60fps的高保真双目视频,包含65866段数据和346个真实场景任务,覆盖仓储、家庭、药房等多个场景。
  • JoyAI-Sim是一套仿真工具链,可以通过合成符合人类认知的数据,低成本评估机器人模型性能,同时补充真实数据集难以覆盖的极端或长尾场景。该工具链让仿真表现和真机表现的一致性达到90%,效率提升了3.2倍。
  • JoyAI-RA 0.5是一个通用视觉-语言-世界-动作框架,通过双重动作对齐机制,将物理世界动态先验与视觉语义结合,实现跨异构数据的规模化操作学习,让机器人在真实场景中的操作更加稳定可靠。

这三项技术共同构成了“采集真实数据→构建仿真环境→真机落地验证”的完整数据闭环管线。

在业务落地层面,大会还同步展示了五大行业的专属模型,这些模型不再面对标准化的提示词,而是直接对接真实业务中的订单、病历、图纸和设备:

  • 京医千询3.0在HealthBench评测中拿下双榜第一,可以自主读取CT、核磁等医学影像,3D阅片准确率比GPT-5.5高出近15个百分点。
  • JoyIndustrial 2.0经受了超过10亿次工业调用,VisCAD 1.0打通了从文本生成CAD图到零件装配的全链路,核心设计任务准确率领先通用模型15%。
  • OxygenVLM 4.0已经支撑了图搜、素材质检等核心电商业务,物流超脑3.0和政务大模型也各自在自身业务流程中完成了落地。

AI的用户,正在从人变成整个世界

从更宏观的视角来看,京东的AI战略路径已经非常清晰:从数字智能到附身智能,再到具身智能。段楠在本次发布中系统阐释了京东对AI演进的判断:过去75年,AI经历了从早期专家系统、统计模型到深度学习和基础模型的四次重要变革,整个演进的核心是围绕数据、算力和模型的持续规模化。而现在,AI正迎来第五次技术变革:从数字世界走向物理世界。

其落地路径也十分明确:用蕴含更多物理信息的数据训练全模态和具身基础模型,让模型与环境持续交互迭代,最终将模型部署到各类物理硬件和设备中,在真实世界中辅助人类完成各类任务。基于这一判断,京东将自身的技术体系划分为三个层级:

  • 数字智能:先在数字世界中完成内容理解,夯实模型能力基础。
  • 附身智能:将AI模型部署到各类真实硬件设备中,实现人与设备之间自然、实时的交互。
  • 具身智能:将模型部署到具身机器人本体上,帮助人类完成生产和生活中的各类任务。

京东的底气不仅来自人才和技术积累,更来自自身独有的优势:20多年积累的仓储、物流、零售、健康等丰富业务场景,海量的具身终端,真实的操作数据,以及完整的反馈闭环。段楠还公布了京东未来三年的技术里程碑:

  • 2026年底,全模态实时交互模型达到世界顶尖水准,为附身智能打下基础。
  • 2027年,完成具身数据集的规模化采集,具身模型在通用能力和垂直场景中做到世界领先并实现落地。
  • 2028年,JoyAI基础模型矩阵全面走进生活和生产场景,服务千行百业和千家万户。

京东探索研究院想要打造的世界一流JoyAI基础模型矩阵,最终指向的目标非常明确:让AI从数字世界走进物理世界,助力京东成为全球最大的物理世界运营中心。

这句话听起来格局宏大,但拆解来看,都是需要深耕的扎实工作:采集数据、构建仿真、调试设备、优化流程,每一步都无法省略。也正是这些看似笨重的工作,构成了京东在物理AI领域的护城河。京东拥有20多年积累的真实业务场景,它的模型从诞生之初就浸泡在真实业务中,而非实验室里的Demo。

过去几年,AI的用户是坐在屏幕前打字的人:问题有边界,答案有终点,对话有明确的结束信号。但现在,AI的用户变成了这个持续变化、永不暂停的真实世界:没有人给它出题,也没有人告诉它何时可以交卷。

文章开头的那副AI眼镜,帮一个人看清了眼前的路。而京东想要做的,是让AI看清整个物理世界。从鼻梁上的一副辅助眼镜,到全球最大的物理世界运营中心,这条路很长,但方向已经无比清晰。

以上内容不代表本平台立场,仅供读者参考