梅涛:高IQ≠全能,智象全模态世界模型构建物理AI闭环

8月19日,2026世界机器人大会期间,一场聚焦物理AI发展的主题论坛在北京举行。本次论坛围绕“物理AI进行时”主题,集结了具身智能领域的顶尖学者、企业创始人和一线技术负责人,围绕通用物理智能的技术演进路径与产业落地方向展开深度探讨。
作为原生全模态世界模型领域的代表性企业,智象未来创始人兼CEO梅涛在论坛上发表了主旨演讲,以《原生全模态世界模型:从“模拟世界”到“交互世界”》为主题,从AI大模型的技术演化趋势切入,系统梳理了大模型从多模态向原生全模态、从模拟世界向交互世界演进的核心逻辑,为物理AI的底层能力建设提供了全新的技术视角与落地思路。
高IQ并非全能:AI从认知世界到改变物理世界
梅涛在演讲中提到,过去几年AI大模型的发展速度远超预期,大语言模型、多模态模型与具身智能三条原本独立演进的技术路线正在加速融合,不少行业从业者将2026年称为“世界模型元年”。
他分享了一组行业观测数据:今年年初,顶尖通用大模型的IQ水平约为130,相当于国内顶尖少年班的天才学生水平;而到2026年8月,最新一代大模型的IQ已经接近140。但梅涛特别强调,高IQ并不等同于全能,就像在校成绩优异的学生未必具备全面的实践能力一样,仅在测试中表现出色的大模型,未必能在真实物理世界中完成长期、稳定且可靠的任务,这也正是物理AI赛道受到广泛关注的核心原因。
不同类型的AI模型各有侧重:大语言模型擅长对世界的理解、知识压缩与逻辑推理;多模态模型擅长对世界的生成与趋势预测;具身交互模型则擅长与真实物理世界的互动。而真正的通用世界模型,需要同时具备完整的世界状态表达能力、物理规律与因果关系推演能力,以及世界重构能力。从文本、多模态到具身交互,三条独立演化的技术路线正在加速走向融合。
原生全模态架构:突破行业技术上限
基于自研的UiT(Unified Transformer)统一架构,智象未来近期正式发布了原生全模态交互式世界模型HiDream-O1-World。这款模型在首次参与权威榜单WBench测评时,便登顶了Navi分榜的榜首位置。
HiDream-O1-World支持文本、图像以及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力,同时可以构建多种主体与风格化场景:既能够高度还原真实物理空间,也可以生成二次元卡通、3A游戏渲染等风格化的虚拟世界。
从技术底层来看,这款模型的核心突破在于实现了长时程的时空一致性与物理一致性,能够在长时序的交互过程中“记住”已经探索过的场景结构,在复杂的交互场景中保持较高的物理合理性,避免出现违背现实物理规则的错误。
HiDream-O1-World正在打开全新的产业应用空间:在AI互动影游领域,用户可以成为叙事的主动参与者,而非被动的观看者;在具身智能仿真场景中,模型可以搭建高保真的虚拟训练底座,帮助机器人快速学习操作逻辑;在3D场景生成赛道,创作者可以高效生成结构完整的3D空间,大幅缩短从创意构思到成品落地的迭代周期。
以此为基础,智象未来正在围绕世界模型的定义持续拓展技术边界,逐步完善覆盖图像模型、视频模型及交互式世界模型等方向的全链路模型矩阵。
构建闭环:连接物理世界的核心逻辑
在谈到具身智能的能力底座时,梅涛将关键关系概括为:世界模型和具身智能的发展,需要将数据、世界模型、智能体和具身本体有机连接起来。具体来说,数据负责构建认知基础,世界模型负责理解世界状态、推演物理规律,智能体基于模型的预测结果进行决策与路径规划,具身本体则完成真实物理世界的动作执行,而真实环境的反馈又会回流成为新的训练数据,由此形成“数据—认知—行动—反馈”的闭环飞轮。
梅涛进一步指出,世界模型正是这一闭环飞轮中的认知中枢,没有高质量的世界模型,仿真环境难以逼近真实物理规则,具身智能的数据飞轮也无法真正运转起来。
整个闭环体系的最底层是数据底座,包含三类缺一不可的数据:互联网先验数据、仿真环境中的物理试错数据,以及行动闭环中的真实交互数据。真实环境的行动反馈会持续回流成为新的训练数据,驱动整个飞轮不断加速迭代。以互联网先验数据为例,智象未来目前已经积累了近千万小时的视频训练数据。
闭环的中间层是世界模型,作为具身智能的核心内核,负责推演世界运行规律,回答“世界是什么”以及“接下来会发生什么”的核心问题。最上层则是智能体与具身系统,基于世界模型的预测结果做出自主决策,并通过具身本体完成物理动作,实现从认知到行动的完整闭环。
梅涛还特别强调了仿真数据在物理AI发展中的重要价值,并以智象未来与诺亦腾机器人的合作为例进行说明:利用原生全模态大模型对真实采集的人体动作数据进行增强处理,可以生成大量符合物理约束的视频内容,确保同一动作在不同背景、不同场景、不同肤色下都能保持动作一致性。这种数据增强能力可以大幅降低真实数据采集的成本与压力,让机器人先在仿真环境中完成学习训练,再迁移到真实物理环境中进行实操。
这些实践背后,体现了智象未来对AI演进方向的一贯判断:大模型让AI实现对世界的理解,智能体与具身系统让AI能够在物理世界中行动,而原生全模态世界模型则将认知、行动与反馈三者连接为一体,让AI真正具备在物理世界中持续学习与进化的能力。
从模拟世界到理解世界,从推演世界到交互世界,智象未来将持续深耕原生全模态世界模型领域,以技术创新与生态协同作为双轮驱动,既服务于数字智能的发展,也加速具身智能在真实物理环境中的训练与落地,助力物理AI从技术探索阶段迈入规模化、商业化的全新发展阶段。

