文章摘要
李飞飞团队推出全球首个多模态世界模型Atlas,该模型采用全新多模态自回归扩散Transformer架构,具备像素级相机控制生成、高精度三维重建、时空模拟、多模态图像生成等能力,针对机器人模拟场景优化,性能超越当前同类先进模型,目前已开放早期访问,打通了机器人从真实到模拟的路径,是具身智能领域的重要成果。

一款被称为全球首个的多模态世界模型正式发布,它来自李飞飞带领的团队,这款模型名为Atlas

团队对这款模型的定位极具突破性,除了冠以「全球首个」的称号外,其官方宣传语也点明了核心能力边界:

建模世界,移动相机,模拟空间和时间。
这意味着Atlas不仅能生成可互动的视频内容,更可以实现像素级的相机控制来生成图像和视频帧,并完成高精度的3D重建,同时具备对空间和时间的理解能力。

李飞飞本人将Atlas视为团队的里程碑式成果,她在社交平台上置顶介绍了这款模型,表示其为从视觉特效到机器人的众多应用场景打开了大门。英伟达机器人主管Jim Fan也对这款模型给予了高度评价,认为这是机器人领域Real-to-Sim方向的重要突破。

具体来看,Atlas是一款多模态自回归扩散Transformer模型,其核心能力覆盖多个维度:

相机控制生成:仅需一张输入图片,Atlas就能生成具备像素级相机控制的图像和视频,最高可输出时长1分钟、分辨率1440p的超清视频。

空间重建:Atlas可以基于1到数十张输入图像,完成真实世界场景的三维重建,既可以生成任意新视角下的图像帧,也能输出显式的3D表示,其表现已经超过了当前专门针对3D重建训练的最先进模型。

时空模拟:Atlas可以根据输入的视频同时建模空间和时间维度,支持转换已有视频的观察视角,制作极具视觉冲击力的效果,同时完美适配机器人的Real-to-Sim工作流程。

图像生成:Atlas可以根据文本提示生成图片和360°全景图,能够精准遵循复杂的Prompt要求,准确渲染文字内容,同时支持生成多种不同的视觉风格。

针对机器人模拟场景,Atlas也有专门的优化:仅需输入几张真实场景的照片,它就能生成逼真的RGB图像和深度数据,让机器人可以在更多不同的模拟空间中完成训练和测试。

从技术架构来看,Atlas属于全能模型,其核心目标是在统一的模型架构中,同时处理多任务、多种类型的输入和输出数据。而空间控制,正是整个模型的核心设计思路。

为了实现这些目标,团队设计了全新的基础架构——多模态自回归扩散Transformer,作为下一代世界模型的底层支撑。所有的输入数据,包括文本、图像、视频、3D数据等,都会被锚定在三维空间中,形成统一的空间上下文,Atlas会基于这个上下文生成对应的多模态输出。举个简单的例子,将两张毫无关联的参考图片放入同一个空间上下文中,再分别指定它们在3D空间中的位置,Atlas就能将它们融合成一个空间自然且连续的完整世界。

我们可以从三个维度拆解这个架构的核心特点:

多模态设计:Atlas可以原生处理多种不同的数据类型,包括文本、图像、相机位姿、3D深度图等,而视频则会被表示为图像序列,每一张图像和每一幅深度图,都对应一个明确的相机位姿,确保空间信息的完整传递。

自回归机制:Atlas的操作基于一系列由不同模态元素组成的序列,每一次生成新的输出,都会以之前已经生成的序列内容作为条件,这种灵活的设计天然适配各类不同的任务,每一种任务本质上都可以看作是一种特定的输入输出序列。

扩散模型与Transformer结合:Atlas采用了Rectified Flow(校正流)模型作为基础,通过逐步去噪的方式生成输出内容,这类扩散模型尤其擅长对图片、视频这类高维连续数据进行建模,同时在推理阶段,可以通过调整去噪步骤的数量,灵活实现生成速度和内容质量之间的平衡。而Transformer作为当前世界模型领域最稳健的基础架构之一,也被充分融入到了模型设计中。

这种架构设计让Atlas融合了大语言模型和视频生成模型的大量优势:一方面,它可以直接复用大量服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等;另一方面,它也和现代图像、视频生成模型一样,属于潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等成熟算法,并引入了更先进的VAE架构。

研究团队针对相机控制生成和3D重建两个核心任务,对Atlas进行了定量评估。在相机控制生成任务中,Atlas的表现优于当前最先进的视频模型,而且随着相机轨迹复杂度的提升,Atlas的优势会更加明显。在基于稀疏输入视角的3D重建任务中,Atlas同样超过了表现最好的专业开源3D重建模型,在评分越低表现越好的评测体系中,Atlas取得了更优的成绩。

值得一提的是,Atlas从设计之初就为规模化扩展做好了准备,团队表示,已经观察到了充分的证据,证明Atlas的能力会随着规模扩大而继续提高。目前,Atlas已经向部分合作伙伴开放早期访问权限,感兴趣的开发者也可以通过官方网站申请试用资格。

这款模型的发布,让行业的目光再次聚焦到具身智能领域。结合团队今年的一系列动作,Atlas的战略意义也更加清晰。今年6月,李飞飞亲自定义了世界模型的分类体系,将其分为渲染器、模拟器、规划器三类,并明确指出模拟器是其中最关键的部分,因为模拟器承载了世界本身的几何、物理和动力学规则,是渲染和行动共同依赖的基础。

紧接着在7月21日,团队收购了机器人仿真公司SceniX;7月28日,公开了Real-to-Sim-to-Real系统,强调机器人训练的最大瓶颈在于缺乏廉价、可控且可规模化的训练数据。如今Atlas的发布,彻底打通了从真实照片或视频,到3D空间,再到机器人传感器视图和可变化的模拟环境的完整路径。

团队官方表示,未来Atlas将作为下一代Marble以及其他产品的底层模型,为更多应用场景提供支撑。

参考链接:https://www.worldlabs.ai/blog/atlas

以上内容不代表本平台立场,仅供读者参考