李飞飞发布多模态世界模型Atlas:一张照片就能生成3D世界

2026年9月2日,李飞飞创办的World Labs正式发布全球首个多模态世界模型Atlas。Atlas是一款面向空间智能的全能世界模型,从零开始预训练,原生处理文本、图像、视频、相机位姿与3D深度信息。仅需1到6张普通照片,它就能生成最长1分钟、1440p分辨率的视频,实现像素级相机控制。Atlas还能从2到25张游客随手拍的照片中重建完整的3D场景。李飞飞本人将其称为World Labs的“里程碑式”成果。

多模态世界模型Atlas:李飞飞空间智能理论的终极落地
李飞飞的名字在过去十年间几乎与计算机视觉画上了等号。从ImageNet到斯坦福AI Lab,她一直在追问同一个问题:机器如何才能像人一样“看见”世界?2024年2月,她带着这个追问创办了World Labs。2026年9月1日美国当地时间,答案终于以Atlas的名字出现在世人面前。
Atlas是一个“omni model”——全能模型。官方对它的定义是“面向空间智能的多模态世界模型”。它能够生成、重建和模拟任何可能的世界。“全球首个”四个字被World Labs反复强调,slogan也毫不含糊:建模世界,移动相机,模拟空间和时间。
李飞飞在斯坦福反复讲述的那个概念叫做Spatial Intelligence——空间智能。她的核心观点是:如果AI不能理解三维空间的物理法则和几何结构,就不可能真正理解世界。Atlas正是这一理论从学术构想走向工程实现的标志性产物。
Atlas的核心能力:四大支柱撑起一个三维世界
World Labs将Atlas的能力划分为四个类别。这四大能力共同构成了一个能够理解、生成和操控三维空间的完整系统。
相机控制生成是Atlas最直观也最震撼的能力。用户只需提供1到6张参考图片,指定任意相机位置和角度,Atlas就能生成对应视角的新画面。最高可输出1分钟、1440p分辨率的视频。与传统视频生成模型依赖模糊的文本提示不同,Atlas将精确的相机几何信息作为原生输入类型。你要什么角度、什么轨迹、走多快?直接给坐标。World Labs用了一个形象的比喻:创作者从此“坐进导演椅,而不是在拉老虎机的拉杆”。
空间重建解决的是“把真实世界恢复出来”的问题。Atlas可以从一张到数十张输入图像中重建真实场景,既生成新视角的图像帧,也输出点云和3D高斯泼溅这样的显式3D表示。传统3D重建需要成百上千张照片和昂贵的专业设备。Atlas用2到25张游客视角的地面平拍照片,就能重建斯坦福大学主方庭的完整场景——草坪、拱廊、纪念教堂外墙全部还原,镜头随后拔地而起,来了一段上帝视角航拍漫游。
时空模拟让Atlas能够同时建模空间和时间。输入一段普通手机拍摄的视频,Atlas可以预测每一帧的深度,再将这些信息组合成完整的3D重建。三到五台手机或运动相机拍摄的素材,就能合成《黑客帝国》般的“子弹时间”特效——时间“冻结”,视角自由旋转。这项能力还支持机器人的Real-to-Sim(真实到模拟)工作流。
图像生成是Atlas的第四项能力。它可以根据文本生成图像和360度全景图,能够遵循复杂提示、准确渲染文字,并生成多种视觉风格。World Labs展示的案例包括电影画面、室内设计、游戏场景和童话村庄全景图。不过,图像生成并非World Labs强调的主要方向——Atlas真正的独特之处在于,所有生成结果都建立在三维空间关系之上。
技术架构:当Transformer学会看三维空间
Atlas的技术架构是一个多模态自回归扩散Transformer。拆开来看,这四个关键词各自承载着关键的技术选择。
多模态意味着Atlas可以原生处理文本、图像、相机位姿和3D深度图等多种数据类型。视频被表示为图像序列。每一张图像和每一幅深度图都对应一个明确的相机位姿。Atlas不是在几种模态之间做简单的转换,而是在同一个模型架构中同时处理多任务、多种输入和输出数据。
自回归指Atlas操作的是一个由多种元素组成的序列。序列中的每一个元素都可以属于文本、图像、相机位姿或深度图中的任何一种模态。Atlas每次生成新的输出,都会以前面已经存在的序列内容作为条件。这种设计天然适用于各种不同任务——每一种任务本质上都只是一种不同类型的序列排列。
扩散部分采用Rectified Flow(校正流)模型,通过逐步去噪来生成输出。扩散模型尤其擅长对图片和视频这类高维连续数据进行建模。在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的灵活平衡。
Transformer是世界模型领域被验证为非常稳健的基础架构。Atlas实际上融合了大语言模型和视频模型两条技术线的精华。它既可以利用LLM侧的KV缓存、缓存感知路由、解耦式服务等推理加速技术,又可以享用视频模型侧的扩散蒸馏、无分类器引导、移位噪声调度等算法进展。
但Atlas最核心的设计并非这四个关键词中的任何一个——而是空间上下文(Spatial Context)。
大语言模型把输入编码成文本上下文,再基于上下文生成后续token。Atlas的流程相同,区别在于:进入上下文的每一张图像都被锚定在三维空间中的一个精确位置——它带着相机位姿一起进来。这相当于给模型提供了一个带有“坐标轴”和“比例尺”的三维草稿本。
这个改动带来的直接后果是:相机控制不再靠文字描述。过去让视频模型“向左推轨”“升降镜头”,只能把这些电影术语写进提示词里,模型理解到什么程度是个黑箱。Atlas把相机几何做成了原生输入类型。
更有意思的是对上下文的编排。你可以往空间上下文里放两张毫不相关的参考图,并指定它们在三维空间中的相对位置。Atlas会生成一个在两者之间平滑过渡的世界——它自己想象出门廊、走道和转角。World Labs的博客展示了一个例子:把一张站点图片和一张地面图片拼在一起,模型补出了中间从来不存在的空间。
Atlas从零开始完成预训练。World Labs强调,Atlas的性能随训练计算量的增加而提升,且这一趋势预计会随着持续扩展而保持。
横向对比:Atlas如何碾压传统视频生成模型
Atlas与Sora等传统视频生成模型有着本质区别。传统视频生成模型的核心逻辑是“猜像素”——给一段文本描述,模型通过扩散过程一步步生成看起来合理的2D画面。相机控制依赖模糊的语义描述,结果是“抽奖式”生成。
Atlas走的是另一条路。它不满足于“生成好看的画面”,而是试图让AI真正理解三维空间长什么样。输入的是带三维坐标和深度的空间信息,输出的是可漫游、可操控的三维世界。输出的也不只是一段视频文件,而是点云和3D高斯泼溅等显式3D模型,可以直接导入其他软件继续使用。
以下是Atlas与主要竞品在多个维度的横向对比:
| 对比维度 | Atlas (World Labs) | Sora (OpenAI) | Gemini Omni Flash (Google) | MiniMax H3 |
|---|---|---|---|---|
| 模型类型 | 多模态世界模型 | 视频生成模型 | 多模态模型 | 视频生成模型 |
| 输入类型 | 文本+图像+视频+相机位姿+3D深度 | 文本+图像 | 文本+图像+视频+音频 | 文本+图像 |
| 相机控制 | 像素级精确控制(几何原生输入) | 文本语义控制 | 文本语义控制 | 文本语义控制 |
| 3D输出 | 点云、3D高斯泼溅 | 无 | 无 | 无 |
| 3D重建 | 支持(1-100+张图像) | 不支持 | 不支持 | 不支持 |
| 时空模拟 | 支持(子弹时间、多视角合成) | 不支持 | 不支持 | 不支持 |
| 人类偏好胜率 | 基准 | 未披露 | 19% (Atlas 81%胜率) | 25% (Atlas 75%胜率) |
| 最大输出时长 | 1分钟 (1440p) | 1分钟 (1080p) | 视频生成能力有限 | 10秒左右 |
在人类评估的相机控制性能对比中,Atlas对Google Gemini Omni Flash的胜率达到81%,对MiniMax H3达到75%,对阿里HappyHorse 1.1达到86%,对FLUX 3达到93%,对字节Seedance 2.5同样取得显著优势。
在空间重建的定量评测中,Atlas在DTU、ETH3D、KITTI、ScanNet等七个标准数据集上的平均绝对相对误差为8.6(×10⁻³),低于对比的Pi3X(11.1)和Depth Anything 3(11.9)等专用模型。在DTU等公开数据集测试中,其稀疏视角重建误差为25.3‰,优于多个专门针对3D重建训练的模型。
机器人预训练:Atlas最深远的意义
Atlas发布后,英伟达机器人主管Jim Fan第一时间发声,指出这是机器人领域Real-to-Sim的一大步。这句话点出了Atlas最深远的意义——打通通往“具身智能”的路。
机器人训练长期面临一个核心难题:真实数据匮乏。在真实场地中训练机器人,需要反复布置场景、采集数据,环境一变就可能需要重新来过。成本高昂、效率低下、可重复性差。
Atlas提供的是一套全新的解决方案。仅需喂给它几张照片或一段手机视频,它就能生成逼真的RGB图像和深度数据。机器人的“眼睛”看到什么、深度传感器探测到什么,Atlas全部可以模拟出来。
World Labs在一组机器人演示中展示了两段手机视频分别重建两处大型空间,每段只取24帧,再让不同机器人沿不同路线在其中移动。灯光可以换、物体可以挪、障碍物可以重新摆放——都不必重新布置真实场地。一次实拍,就能变出一批不同的训练和测试环境。
Atlas不是机器人的“大脑”。它解决的是更前置的问题:把现实环境快速搬进仿真系统。机器人可以在Atlas生成的仿真世界里进行海量训练、反复试错——摔倒了重来,换任务时更容易调整。训练完成后再迁移到现实世界,效率将得到质的飞跃。
当然,仿真环境与真实世界之间的差距——所谓的Sim-to-Real gap——始终存在。对影视创作来说,镜头没拍到的地方AI补出一扇门一面墙,看着像就行。对机器人训练来说,台阶高度、障碍物位置和物体运动一旦猜错,错误也会跟着进入训练数据,最后由真机来买单。Atlas究竟能省下多少成本、能产出多少有效训练数据,还需要外部团队的实测来回答。
视觉特效与内容创作:导演坐在电脑前就能“开机”
Atlas的另一条应用主线是视觉特效和内容创作。
传统视频生成模型就像“抽卡”——你在提示词里敲下“镜头缓慢向左拉升、绕着人物微仰角旋转”,回车之后全凭运气。Atlas的做法完全不同:直接把相机位姿参数当作底层原生输入。你要什么角度、什么轨迹、走多快?直接给坐标。
这意味着创作者可以像真正的导演一样精确规划每一个镜头。输入1到6张普通照片,定好运镜轨迹,Atlas就能生成最长达1分钟、1440p分辨率的大片。画面不崩,空间几何丝滑一致。
更夸张的是它的空间“脑补”能力。输入一张只拍到机器人正面的照片,Atlas能把它的背影完整地“脑补”出来。给一张泳池边角照,它靠着“世界常识”,默默把隔壁没拍到的草坪和远山给补好了。甚至把两张毫无关联的照片往空间里一扔,Atlas都能强行“脑补”出走廊、大门和房间,把两个场景无缝焊接在一起。
当然,Atlas并非完美无缺。镜头一旦进入原图没有拍到的区域,模型实际上仍然需要依赖先验知识去猜测。视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露出来。它生成的更像是一个视觉上合理的三维世界,未必就是原来那个世界的精确数字复刻。
Atlas擅长构建几何连贯的静态空间,但对于物体碰撞、复杂动力学的通用物理模拟能力仍有待验证。它并非成熟的通用世界模拟器。但这些局限并不妨碍它在视觉特效、游戏设计、AR/VR等领域打开全新的可能性。
融资与商业化:50亿估值的空间智能赌局
Atlas的发布并非凭空而来。World Labs自2024年2月成立以来,一直是资本市场的宠儿。
2026年2月,World Labs完成10亿美元新一轮融资,估值飙升至50亿美元。投资方包括Andreessen Horowitz(a16z)、英伟达、AMD、Autodesk等巨头。2025年11月,公司推出首款产品Marble。2026年1月开放World API。7月收购SceniX。9月发布Atlas。
Atlas目前处于早期访问阶段,仅向部分战略合作伙伴开放。价格、通用可用性日期和早期访问合作伙伴名单均未披露。Atlas未来将用于驱动World Labs的Marble等产品。用户可通过官方渠道申请试用。
World Labs不走开源路线。Atlas不开源,论文也未同步发布。这种策略在AI社区引发了讨论——有人认为这是商业化的必然选择,也有人质疑缺乏透明度会限制社区的验证和改进。
从融资节奏和估值来看,资本市场对李飞飞的空间智能愿景投下了信任票。但Atlas能否将技术突破转化为可持续的商业回报,仍然是一个开放的问题。
行业反响与独到见解
Atlas发布后,行业反响热烈但并非一边倒的赞美。
肯定的一面:李飞飞本人将其置顶为World Labs的“里程碑式”成果。英伟达机器人主管Jim Fan称赞这是机器人领域Real-to-Sim的一大步。技术社区普遍认可Atlas在相机控制和3D重建上的突破。有评论认为,Atlas标志着AI从“生成画面”推进到了“生成可进入、可操控的世界”。
质疑的一面:有分析指出Atlas“延续了2024年的技术旧路径”。Atlas不开源、不发布论文、不公开合作伙伴名单的做法也引发了一些争议。技术边界方面,Atlas对复杂动力学的物理模拟能力仍有待验证。
独到见解:Atlas真正的意义或许不在于它今天能做到什么,而在于它指明了一个方向——AI的下一个战场不在文字和像素,而在三维空间。
过去十年,AI在语言和图像上取得了惊人的进步。但语言模型处理的是符号,图像模型处理的是像素——它们都停留在二维的抽象层面。人类生活在三维世界中,理解深度、距离、遮挡、透视、物理碰撞——这些是人类智能最基础也最容易被忽视的部分。
李飞飞从ImageNet时代就在追问:机器如何“看见”?Atlas给出了一个新的答案:不是看见像素,而是看见空间。不是生成画面,而是生成世界。
这个转向的影响可能比今天任何人预想的都要深远。当AI真正理解了三维空间,它就不再只是“回答问题”的工具——它可以走进物理世界,操作设备、规划路径、与真实环境互动。从工厂车间到家庭服务,从自动驾驶到手术机器人,空间智能是AI从数字世界走向物理世界的桥梁。
Atlas只是这座桥的第一块基石。
FAQ
问:李飞飞的Atlas是什么时候发布的?
答:Atlas于美国当地时间2026年9月1日、北京时间2026年9月2日正式发布。由李飞飞创办的World Labs在官方博客宣布了这一消息。
问:Atlas和Sora有什么区别?
答:Atlas与Sora有本质区别。Sora是视频生成模型,核心逻辑是“猜像素”——根据文本生成看起来合理的2D画面。Atlas是多模态世界模型,核心是理解三维空间——输入带相机位姿和深度的图像,输出可漫游、可操控的3D世界。Atlas还能输出点云和3D高斯泼溅等显式3D模型,这是Sora做不到的。
问:Atlas能做什么?
答:Atlas有四大核心能力:相机控制生成(1-6张图片生成最长1分钟1440p视频)、空间重建(从少量照片重建3D场景)、时空模拟(子弹时间特效和机器人仿真)、图像生成(文生图和360度全景图)。
问:Atlas对机器人有什么意义?
答:Atlas解决了机器人训练中“真实数据匮乏”的难题。仅需几张照片或一段手机视频,它就能生成逼真的三维模拟环境和传感器数据,让机器人在仿真世界里进行海量训练。英伟达机器人主管Jim Fan称这是机器人领域Real-to-Sim的一大步。
问:Atlas可以公开使用吗?
答:目前Atlas处于早期访问阶段,仅向部分战略合作伙伴开放。价格、通用可用性日期和早期访问合作伙伴名单尚未公布。未来几周内将向更广泛的早期访问者开放。
问:Atlas有哪些技术局限?
答:Atlas擅长构建几何连贯的静态空间,但对物体碰撞、复杂动力学的通用物理模拟能力仍有待验证。镜头转向完全未拍摄的区域时,模型需要依靠先验知识“想象”。生成路径越长,局部几何漂移和纹理闪烁越容易暴露。它生成的更像是视觉上合理的世界,未必是真实世界的精确复刻。
问:World Labs获得了哪些投资?
答:2026年2月,World Labs完成10亿美元新一轮融资,估值达50亿美元。投资方包括Andreessen Horowitz、英伟达、AMD、Autodesk等。

