李飞飞发布Atlas全模态世界模型 赋能机器人与创作

近日,李飞飞创立的World Labs正式推出了全新一代世界模型Atlas,其中一则展示案例引发关注:模型生成的画面中,李飞飞在办公室里叠衣服,视觉效果极具真实感,创始人本人也调侃道,现实中他们的办公室确实正在进行叠衣服的场景。
这款全新的全模态模型究竟有何特别之处?又是如何实现如此逼真的数字分身效果的?
全模态覆盖:四大核心能力
World Labs将Atlas定义为全模态模型,从零开始预训练,原生支持文本、图像、视频与3D数据的处理。官方表示,这是全球首个能够以像素级相机控制生成图像与视频帧,并将其重建为3D内容的多模态世界模型。
其核心能力主要包括四个方面:
- 相机可控生成:基于1到6张参考图,用户可以指定任意机位与角度生成新视角内容,最高可输出1440P分辨率、时长最长1分钟的视频。
- 空间重建:通过1到数十张输入图片重建真实场景,不仅可以生成新视角的图像帧,还能输出点云、3D高斯泼溅等显式3D结果。
- 时空模拟:从输入视频中同时建模空间与时间维度,可用于视频重构图以及机器人的Real-to-Sim流程。
- 图像生成:支持文本生成图像以及360度全景图的创作。
Atlas目前暂未开源,仅向少数合作伙伴开放早期访问申请,后续将作为核心技术驱动Marble以及World Labs的其他产品。
核心设计:空间上下文锚定
Atlas最核心的设计思路,被World Labs称为「空间上下文(spatial context)」。作为一款多模态自回归扩散Transformer,Atlas的输入会在三维空间中进行锚定,以此构建空间上下文并基于此生成多模态输出。
我们可以类比大语言模型的工作逻辑:LLM会将输入编码为上下文,再基于该上下文生成后续的token。Atlas的流程与之类似,但核心区别在于,每一张进入上下文的图像都会被锚定在三维空间的具体位置,并且携带相机位姿信息一同参与计算。
这一设计让相机控制不再依赖文字描述。过去要让视频模型实现「向左推轨」「升降镜头」这类运镜效果,只能将这类电影术语写入提示词,模型的理解程度往往难以把控。而Atlas将相机几何作为原生输入类型,让创作者可以直接指定相机参数,真正掌握创作的主动权,正如World Labs所说,创作者可以「坐进导演椅,而不是在拉老虎机的拉杆」。
更值得关注的是Atlas的上下文编排能力。用户可以将两张毫无关联的参考图输入模型,并指定它们在三维空间中的相对位置,Atlas就会自动生成两者之间平滑过渡的完整空间,自动补全门廊、走道、转角等原本不存在的场景。官方博客中就展示了一个案例:将一张站点图片和一张地面图片拼接输入后,模型自动补全了两者之间缺失的空间区域。
技术架构与性能表现
从技术架构来看,Atlas属于多模态自回归扩散Transformer,这一架构包含几个关键特性:
- 多模态:原生支持文本、图像、相机位姿与深度图的处理,视频则被转换为图像序列进行处理。
- 自回归:输出内容会逐个元素生成,不同的任务本质上只是不同的序列排列方式。
- 扩散:模型采用rectified flow技术,通过逐步去噪的方式生成最终结果。
- Transformer骨干:架构适配现代硬件设备,能够高效运行。
World Labs强调,Atlas是LLM技术与视频模型技术的混合体,因此可以同时复用LLM侧的推理优化技术,比如KV缓存、分离式部署,同时也能吸收视频侧的算法进展,包括扩散蒸馏、CFG、VAE改进等。
在性能评测方面,Atlas主要在两个维度进行了对比测试。首先是相机可控生成能力:团队使用单张输入图搭配1到3段电影化运镜指令,邀请第三方人类评分者进行盲选对比。测试结果显示,Atlas在与MiniMax H3的对比中胜率为75%,对Gemini Omni Flash为81%,对国内厂商的HappyHorse 1.1为86%,对FLUX 3为93%,对字节旗下Seedance 2.5为94%,且运镜轨迹越复杂,Atlas的优势越明显。
需要注意的是,World Labs在博客中明确说明,对比的其他模型并不支持将相机位姿作为原生输入,运镜只能通过文本提示来描述。因此75%到94%的胜率差距,更多体现的是「原生相机接口」与「文本描述运镜」两种方式的差异,而非单纯的画面生成质量差距,团队并未宣称Atlas的视频生成能力全面碾压上述模型。
在3D重建领域,在稀疏视角重建任务中,Atlas的平均误差(AbsRel×10⁻³)为25.3,优于Pi3X(posed)的28.7、π³的34.7、VGGT-Ω 1B的36.4、Depth Anything 3的39.3以及MapAnything的47.7。World Labs表示,所有基线模型的结果均由团队复现,以保证评测协议的一致性。不过团队也提醒,本次对比的对象仅限定为目前表现最好的开源专用重建模型,且Atlas并非在所有数据集上都能取得第一的成绩。
关于模型的缩放规律,World Labs仅在博客中进行了定性描述:训练过程中构建了一系列递增规模的模型,每提升一档算力都会解锁新的能力。不过团队并未公开模型参数量、训练数据规模、缩放曲线,也没有公布推理成本与延迟数据。
输入越多,生成越精准
根据官方博客展示的大量案例,整体来看,输入的参考图越多,Atlas的生成内容就越忠实于原始素材。当仅输入一张照片时,模型会自主填补大量未观测到的区域。比如在花园场景的案例中,仅输入一张地面照片时,模型可以生成航拍视角,但花园本体还原准确,其余区域均为模型自主生成的内容。当加入第二张小屋照片后,小屋的位置会被准确还原,但左侧的房屋依然是模型补全的内容。直到输入第三张照片后,整个场景才会完全匹配原始素材。
World Labs表示,Atlas通常在输入2到3张图片时就能给出较为忠实的场景重建,同时也可以支持超过100张输入图片的处理。比如斯坦福主方庭的案例中,仅使用2到25张地面拍摄的照片,Atlas就可以生成从校园上空航拍的飞行路径视频。官方博客中可交互浏览的高斯泼溅场景,则基于30张输入图片生成。
多场景落地能力
除了基础的图像与视频生成能力,Atlas还支持「子弹时间」这类时空模拟效果。World Labs表示,仅使用3到5台普通相机拍摄的素材,Atlas就可以实现时间冻结并重新构图,从原本不可能的角度回看同一个瞬间。这类镜头无需专业摄影师与专用设备,仅用手机、三脚架以及便携夹具就能完成拍摄。
机器人领域是Atlas的另一大核心应用方向,这也是今年7月World Labs收购仿真公司SceniX后,战略方向首次以模型形态落地。World Labs的具体实现方案是:使用手机视频扫描两个大型环境,每个环境提取24帧画面进行场景重建,随后模拟不同形态的机器人沿不同路径行走,由Atlas生成机器人机身相机在每一步应该捕捉到的RGB图像与深度数据。
这一方案的核心在于,虚拟世界与机器人对真实世界的观测来自同一个模型。传统的Real-to-Sim流程中,环境重建与传感器渲染往往是两套独立的系统,误差会在接缝处累积。而在操作任务中,Atlas还可以捕捉刚体、铰接体与可变形物体的交互行为,并且支持替换物体、调整位置、改变光照与背景,批量生成多样化的训练场景。
战略视角下的新方向
将Atlas的发布放在World Labs的发展时间线中来看,团队的发展节奏相当紧凑:2024年9月带着2.3亿美元融资走出隐身模式,2025年11月推出首款产品Marble,2026年1月开放World API,2月完成10亿美元新融资,投资方包括英伟达、AMD、Autodesk、Fidelity等,彼时估值约50亿美元,7月收购SceniX,9月正式发布Atlas。
这条发展路径呈现出清晰的战略转向:从最初「生成好看的世界」转向「生成够用的世界」。Marble主要服务于影视特效、游戏与建筑可视化领域,只需要视觉上的逼真效果即可;而机器人训练则需要物理上真实可信的场景,以及能够被传感器读取的深度数据与观测信息。Atlas将场景重建、内容生成与仿真训练整合进同一个模型,让行业看到了世界模型除了用于内容创作之外的更多可能性。
如需查看完整案例与技术细节,可访问官方技术博客。

