全球首个多模态世界模型Atlas发布 影溯空间智能登顶榜单

20多年前,计算神经学家杰夫·霍金斯曾提出,智能不止于模式识别,更是对世界的建模。如今,全球范围内的世界模型技术正批量迎来关键的里程碑节点。
9月2日,由AI领域学者李飞飞创办的前沿AI研究机构发布了全球首个多模态世界模型Atlas。这款模型的核心突破在于,将文字、图像、视频以及3D信息整合进统一的空间上下文体系中,不再局限于生成视觉上合理的二维画面,而是能够真正在三维空间中理解并维持场景的完整结构。
仅依靠单张或多张静态图片,Atlas就能完成三维场景重建,支持生成全新的观察视角,还能让虚拟相机按照指定轨迹在场景中移动,全程保持空间结构的一致性。凭借震撼的视觉表现和高度统一的生成效果,Atlas一经推出便获得了广泛好评,不少行业观察者将其视为空间智能领域的重要突破,李飞飞本人也将这一成果称为行业里程碑。
值得注意的是,早在今年3月,国内的空间智能团队影溯就已经开源了具备类似能力的世界模型InSpatio-World。据影溯透露,该模型的升级版本即将发布,且会继续保持开源策略。
与Atlas不同的是,InSpatio-World的输入来源是普通视频:它可以从有限的时空观测数据中,构建出可持续探索的动态4D场景。用户不仅可以调整相机的运动轨迹,绕到未拍摄过的视角观察场景,还能改变观察的时间节点,从新的视角重新审视同一段动态过程——也就是说,时间维度也被纳入了模型的显式处理范畴。
尽管技术路径和能力侧重点各有不同,Atlas和InSpatio-World都指向了世界模型领域的同一发展趋势:从单纯生成看起来合理的视频内容,转向围绕持续存在的空间或时空状态,生成不同位置、不同视角下的观测结果。
如果用通俗的比喻来形容,Atlas更像是搭建了一座可以自由选择机位的AI虚拟片场,让虚拟世界的构建更加完整;而InSpatio-World则致力于将一段现实录像高效转化为可驱动的动态世界,能够为实体AI机器人提供批量的训练陪练场景。这两条技术路线的交汇,也让这家此前相对低调的国内空间智能团队走进了更多人的视野。
影溯近期最受关注的成果之一,便是登顶了世界模型权威评测榜单WorldArena 2.0。截至8月27日的首版阶段性公开榜单中,影溯的InSpatio-Curious模型以66.11分的总分,在77个参评模型中位列第一。
除了Track 1赛道的总分冠军,该模型还在Physics Adherence、Trajectory Accuracy、JEPA Similarity、Depth Accuracy四项核心指标上全部排名第一。具体来看,在Trajectory Accuracy指标上,InSpatio-Curious拿到64.89分,领先第二名3.02分;Depth Accuracy得分达到99.29分,体现出模型在生成过程中对物体运动轨迹和三维空间关系的精准保持能力。
在衡量时空表征一致性的JEPA Similarity指标上,该模型得分98.36分,意味着其生成结果在时空特征层面与真实世界高度贴合;而综合考察交互质量与轨迹准确性的Physics Adherence指标,它以73.24分位居榜首。
有趣的是,InSpatio-Curious的Image Quality得分仅为60.64分,比综合排名第二的模型低了近9分,但最终依然拿下了总分第一。这说明该模型的冠军并非依靠优化画面质感取得,而是凭借轨迹准确性、空间深度、时空表征一致性和交互一致性等底层核心能力实现的反超。
要理解这份成绩的含金量,需要先了解WorldArena评测体系的定位。该评测由清华大学、上海交通大学、香港大学等高校联合发起,是目前衡量具身世界模型实际可用性的权威测试之一,目前已经迭代至2.0版本。
与仅关注视频生成效果的传统评测不同,WorldArena 2.0更像是专门为具身世界模型设立的“机器人考场”:它不仅考察画面清晰度,还会验证机械臂运动轨迹的准确性、场景深度与空间关系的稳定性,以及物体在受到外力作用后是否能遵循合理的物理逻辑继续运动。
对于具身智能领域而言,如果世界模型生成的视频画面清晰,但运动轨迹出错、空间关系混乱,甚至违背基本物理规律,那么这类模型很难真正应用于机器人的训练与决策。因此,影溯能够在这一强调实际可用性的榜单上登顶,足以证明其团队的技术实力。
不过,尽管WorldArena 2.0相比前一版本已经有了显著进步,当前的评测体系仍存在一定局限性。目前的评测主要围绕标准化仿真环境和机器人操作任务展开,与真实世界相比,其覆盖的场景、物体、动态过程和交互方式都相对有限,更无法涵盖工厂、家庭、城市、户外等复杂环境中层出不穷的长尾场景。
此外,InSpatio-Curious所在的Track 1赛道,总分主要来自15项生成与视觉代理指标,能够判断碰撞在视觉和运动层面的合理性,但无法直接测量真实世界中的力、摩擦、质量和惯性等物理参数。也就是说,模型在固定评测题库中取得高分,并不代表更换场景、更换机器人类型,或是遇到陌生物体时,仍能保持稳定的表现。
客观而言,这并不影响WorldArena 2.0在现阶段作为诊断工具的价值,但也意味着该评测目前仅能证明模型在特定任务和数据分布下的能力,还不能作为通用空间智能的最终认证。
正是在这样的行业背景下,影溯将目光投向了产业上游的基础设施建设。8月29日,在武汉举办的第二届中国空间智能大会上,影溯联合超过20家高校团队与行业机构,共同启动了大规模空间智能3D数据开放计划SIDO。
SIDO的核心目标非常明确:将空间数据生产者、模型训练者与实际应用者连接起来,打通从数据生产、模型训练到应用反馈的完整链路。目前,参与该计划的成员已经覆盖高校、激光雷达、机器人、3D生成、数字空间以及产业应用等多个环节。
该计划旨在解决空间智能领域长期缺乏统一、大规模、高质量数据底座的痛点。根据规划,未来两年内,SIDO将逐步建设百万级3D/4D场景数据底座,同时同步推进评测基准的建设工作,围绕3D重建与生成、场景理解、空间推理、动态预测和具身规划等任务,建立更统一的任务定义与评价标准。
可以说,当模型的发展触及现有数据和评测体系的边界时,下一阶段的行业竞争将不再局限于算法本身的优化,还包括数据体系、任务定义与评价标准的共同升级。

