从造物到造世界!影眸WorldGen2-3分钟生成可交互3D场景

AI 3D生成技术正在完成关键的跨越:从单物体的“造物”升级到完整可交互世界的“造世界”。现在只需要上传一张场景照片,短短2到3分钟内,就能得到一个完全可编辑的3D场景——桌上的碗可以单独拿起,椅子能自由旋转挪动,不满意的家具随时可以替换,所有的物体都不是固定死的,而是拥有真实的空间和物理关系。
推出这项全新技术的是3D生成领域的头部团队,他们正式发布了世界生成模型WorldGen,将3D生成从单个资产的生成,推进到完整可落地的场景级创作。和市面上宽泛的“世界模型”概念不同,WorldGen的定位非常明确:它生成的不是只能围观的静态画面,而是真正可交互、可编辑、能直接投入真实生产环境的3D场景。
就像拼乐高积木一样,既可以随时添加新的模块,也能单独抽出、替换其中任意一块,每个组件都自带物理属性,如果移除关键支撑物,周围的物体也会按照物理规则发生位移甚至跌落,所有资产都不会和背景锁死,彼此的空间和物理关系清晰明确。也正是因为这种具体的定位,WorldGen离真实的生产工作非常近,无论是游戏关卡制作、影视片场搭建,还是机器人训练环境的搭建,都可以从WorldGen开始,它的生成能力已经足以直接进入真实的生产流程。
这项技术并非凭空出现,早在去年,该团队自研的场景级生成技术CAST就拿下了国际图形学顶会SIGGRAPH 2025的最佳论文,同期获奖的商业公司只有谷歌和Meta,而CAST正是WorldGen的技术基座。如果说AI 3D的第一步是回答“物体长什么样”,那么WorldGen解决的则是第二个核心问题:多个物体如何带着空间关系和物理属性,共同组成一个完整的场景。
打破传统场景生成的痛点
当前市面上绝大多数的整体式场景生成方案,都存在一个明显的通病:外观好看,但实用性极差。用户在生成的场景里只能走马观花地浏览,想要修改任何细节,都只能推翻整个场景重新生成,几乎没有继续编辑的空间。
问题的根源在于传统的生成方式,该团队创始人兼CEO吴迪曾表示,传统做法直接将整个场景作为一个整体模型生成,所有内容会被合并成不可拆解的单元,场景很难再进行二次使用。而WorldGen的核心变化,就是将场景拆解为可单独操作的独立资产,同时完整保留它们之间的空间和物理联系。
整个生成流程的操作非常简单:首先打开官方平台,选择WorldGen生成功能;上传一张场景照片后,系统会自动识别图中的主要物体,用户也可以手动框选,单独指定需要生成的部分;每个前景物体都会作为独立资产逐个生成,大约2到3秒就能生成预览;背景环境则通过3D Gaussian Splatting技术补全,兼顾视觉完整性,整个流程耗时仅需2到3分钟;如果开启SimReady模式,系统还会为每个资产补充碰撞体,并自动估计质量、摩擦系数、恢复系数等仿真所需的物理属性,最终就能复刻出类似“胡闹厨房”的可交互3D场景。
多行业的落地应用
游戏行业的使用场景最为直接。过去拿到关卡概念图后,美术和策划还有大量的后续工作。现有的图生3D技术虽然能缩短单个资产的制作时间,但生成的资产仍然需要人工一件件组装到场景中。而WorldGen可以直接从概念图生成对象化的完整场景,策划可以提前检查动线和空间布局,关卡设计师可以直接移动或替换道具,美术团队只需要对关键资产进行精修即可。
更方便的是,WorldGen生成的独立资产可以直接导入Blender、Unity、PlayCanvas、Unreal Engine等主流DCC和实时引擎环境,进行材质调整、动画绑定、关卡编辑和性能优化等二次创作。今年7月,该团队已经和Unity中国达成合作,共同构建从3D生成到实时游戏应用的完整工程闭环,在灰度测试阶段,就已经有多名游戏从业者表现出了浓厚的兴趣。
具身智能领域则通过WorldGen解决了场景数据的痛点。具身智能的训练对场景数据的需求非常迫切,传统的真实场景采集不仅需要承担场地、设备和人员的高额成本,像火灾、坍塌这类危险环境还无法安全复现;而传统的仿真场景搭建则需要工程师耗费大量时间手动搭建,不仅成本高,生成的场景和真实环境的偏差也很大。
WorldGen在二者之间找到了平衡:今年7月,该团队联合地瓜机器人、谋先飞发布了完整的闭环方案,由WorldGen负责从真实影像中生成可交互的3D场景,场景内的所有3D物品都具备仿真导入能力;谋先飞的MotrixSim引擎负责物理模拟和并行仿真,让机器人可以在场景中完成运动、抓取和交互;地瓜机器人则提供算力支持和开发工具链。三方整合后,形成了从场景准备、仿真运行到数据采集和策略验证的完整链路。作为NVIDIA Inception初创加速计划的成员,该团队还通过WorldGen连接了英伟达的全球仿真生态,将“单个资产用于Isaac Sim”的能力拓展到了“整个场景用于Isaac Sim”。
影视行业则看中了WorldGen作为“导演工作台”的潜力。创始人吴迪曾举过一个具体的例子:如果导演需要将画面左侧盘子里的苹果移到右侧,纯视频生成技术很难稳定控制这样的细节操作;而用WorldGen先搭建可控的3D场景基底,再结合视频生成模型提升最终画面质量,就能轻松实现精准的镜头调整。
目前已经有创作者将WorldGen和Seedance 2.5结合使用:先用WorldGen生成3D场景,完成镜头调度和构图调整,再将场景交给视频生成模型,补齐人物表演、材质光影和最终的风格效果。WorldGen的AI Render模块还具备AI渲染和自由运镜功能,同一个场景可以轻松变换多种视觉风格,大幅提升了产品概念演示、空间导览等内容的制作效率和品质。这种新的创作方式,让影视生成不再需要在可控性和视觉效果之间二选一,最终呈现的效果可以直接达到大片级水准。目前WorldGen已经进入了实际的影视项目制作流程,相关作品将在完成后陆续上线。
WorldGen的通用性在XR与空间计算领域也得到了验证。由于生成的场景可以从任意视角观察,主要对象也可以自由替换和移动,一张普通的照片就可以被转化为可以进入、浏览和调整的沉浸式空间。室内设计、沉浸式教育、空间展示等领域,都可以成为WorldGen的潜在应用场景。搭配Apple Vision Pro等XR设备,就能真正实现沉浸式的空间体验。
从顶会论文到产品落地的一年
要理解WorldGen的突破,还要从去年的CAST技术说起。场景级生成的难点不在于简单地将单物体生成技术重复运行多次,单张图片天生缺少深度信息、真实尺度和物体背面的细节,还存在遮挡和透视畸变的问题。比如一个被盘子挡住的苹果,模型需要先补全看不见的部分,如果生成的苹果尺寸不对,摆回桌面时就会穿进盘子;如果位置出现偏差,后续的碰撞体和支撑关系也会跟着出错,而且场景错误还会级联扩散,一步出错就会导致后续所有环节的问题,最终给用户带来大量的返工成本。
CAST的解决思路分为四步:首先,模型将输入的图片拆分为独立的对象,并估计相对深度,将一张没有结构的RGB图片转化为对象清单和空间线索;其次,针对每个物体独立生成完整的3D几何,通过遮挡感知机制参考可见部分和场景信息,补全图片中看不到的区域;第三步,将生成好的物体放回统一的空间坐标系中,系统需要估计物体的旋转、平移和尺度,尽量保持和原图的构图和位置一致;最后,建立更细致的物体关系图,描述接触、支撑、悬挂等物理关系,再结合SDF进行物理校正,减少物体互相穿透、悬空和不合理堆叠的问题。
这套框架最终拿下了SIGGRAPH的最佳论文,组委会评价称,CAST支持开放词汇的重建任务,在处理遮挡、精确对齐物体以及确保物理世界与输入图像的一致性方面表现卓越,为虚拟内容创作和具身智能相关领域开辟了新的可能性。不过,CAST距离产品化还有一定的差距,团队花了将近一年的时间,专门解决多模块串联导致的错误累积问题,通过减少冗余模块、重构底层流程和提升单环节的稳定性,最终让WorldGen以完整的形态正式发布。
该团队联创兼CTO张启煊曾解释过“世界生成模型”的定义:我们认为,世界生成模型是通过文本提示或单张图像,将其中描绘的场景还原为可用的三维世界。它既能生成开放式场景,也更接近“世界”的本质表达,仍然是广义世界模型的重要组成部分,只不过我们选择用3D作为承载世界外观与属性的载体。
AI 3D的场景级时代
回到最初的问题,WorldGen到底解决了什么核心问题?答案其实已经在实际应用中清晰显现。它不会直接生成一款可以上线的游戏,也不会直接完成一部完整的电影,更不会替具身智能完成训练和决策,但它解决了所有这些产业共同面对的前置难题:如何将创意和海量资产结合起来,快速实现场景化落地。
以Hyper3D Rodin Gen-2.5为代表的3D生成模型,已经将单个资产的制作周期从数天缩短到了分钟甚至秒级,但在真实的项目中,很少有只需要单个孤立资产的情况。后续不可避免地需要对不同形态、不同物理属性的资产进行拼装,包括识别、校准、导入引擎等环节,这些工作仍然需要大量的人工投入。而WorldGen改变的正是AI 3D的基础交付单位:从单个生成的物体,变成一份已经初步搭建完成的可编辑场景。虽然距离最终的成品还有进步空间,但对于游戏设计师、影视创作者和仿真工程师来说,WorldGen已经提供了一个可以继续打磨的起点。
场景要真正可用,仅仅“看起来像”是远远不够的,对物理规律的模拟才决定了WorldGen的上限。生成的场景细节越丰富,就越真实、越好用。当生成的场景能够承载内容、模拟交互,并接入现有的工作流时,它吸引的就不再只是尝鲜的普通用户,而是真正需要提升生产效率的专业创作者。
3D生成原本就是最接近生产流程的AI应用之一,只有当生成结果能够被持续编辑、复用并投入实际生产时,它的价值才能真正释放。过去限制3D生成落地的场景级缺口,正是WorldGen今天补位的部分,它的出现标志着3D生成正式进入场景级时代。
官方平台:https://hyper3d.ai

