文章摘要
近期兔展智能联合北大、鹏城实验室研发的 UniWorld - View 登顶世界模型榜,且模型适配国产昇腾算力。该模型能基于单图或单目视频生成任意视角视频,代码与权重已开源。它通过新技术解决点云渲染痛点,还能实现单目到多视角视频转换,兔展智能将推进其产品化。

近期,李飞飞团队主导的世界模型榜单迎来更新,榜首位置被国内团队拿下。登顶的是兔展智能联合北京大学、鹏城实验室研发的UniWorld-View(模型已适配国产昇腾算力)

这款模型的能力十分亮眼:用户上传一张图片或一段随手拍摄的单目视频,就能生成任意相机轨迹的新视角视频——推、拉、摇、移甚至360°环绕拍摄都可实现,提供精准的相机位姿控制。不管是单图3D生成还是视频4D生成,都能使用“同一套代码、同一个模型”完成,真正做到了统一的世界视角建模。

本次研发的训练数据来自北大系初创企业元空智能,相关代码与模型权重已全部开源,官方项目地址为:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View。

先来说明这项任务的难点所在。新视角合成(Novel View Synthesis)的本质,是让AI“脑补”未被拍摄到的场景角度,而核心难点集中在“大基线(large-baseline)”场景——简单来说就是,只给AI看物体的正面,却要求它生成侧面甚至后脑勺的画面。

传统的NeRF、3DGS方法采用“重建”逻辑,需要大量多角度的素材才能构建精准的3D场景,但随手拍摄的单目视频视角覆盖极有限,喂给这类模型后,轻则出现大量空洞和伪影,重则完全无法生成有效结果。而纯生成式路线虽然敢于直接创作,但大多只是将相机位姿作为抽象的条件向量输入扩散模型,没有显式的3D建模支撑,生成过程中容易出现画面飘移,大角度旋转时更是直接失控。

近两年行业内探索出了第三条技术路径:先用几何模型将单目素材转换为3D点云,再将目标视角的点云渲染图作为条件输入视频扩散模型,以此实现精准的相机位姿控制,ViewCrafter、英伟达GEN3C都采用了类似方案。不过研发团队发现,这条路径存在一个普遍却未被充分解决的痛点:点云渲染环节的问题。

点云本质上是一堆孤立的三维点,既没有点与点之间的连接关系,也没有朝向信息,当视角变化较大时,渲染结果会出现两种典型的穿帮问题:

  • 前景背景撕裂:深度边界处没有足够的连接信息,视角切换时前景纹理会被拉扯到背景区域,或者背景像素直接覆盖前景;
  • 背面漏光:由于点云没有“面”的概念,无法实现自动遮挡,当相机绕到物体背后时,原本朝向正面的点会直接显示出来,相当于隔着后脑勺看到了正面画面。

在小视角变化时,这些问题可能被生成模型掩盖,但当涉及大基线场景时,错误的几何信号会严重误导扩散模型,导致生成结果出现结构扭曲、大量伪影等问题。

UniWorld-View的第一板斧,就是针对这些痛点推出“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)技术,包含两大核心优化:

第一招:双重投影(Double-Reprojection),专治撕裂。将源画面先投影到目标视角,再将投影后的画面原路投影回原始视角,那些无法原路返回的像素区域,就是会被遮挡的区域。团队将这些区域沿相机轨迹逐帧累积为遮挡掩码,在渲染时直接挖去这些区域,让生成模型自行填补空缺,而非用错误的纹理误导模型。

第二招:法向过滤,专治背面漏光。为每个点云估计法向量,计算其与相机视线方向的夹角,将背对相机的点直接排除在渲染范围之外。

通过这两项优化,渲染得到的条件图不再包含错误的几何信号,只剩下可靠的3D结构和明确的待填补区域。

几何问题解决后,团队还面临另一个矛盾:点云渲染图位置准确但内容缺失,而原始素材内容完整但视角位置不对,如何让生成结果既贴合目标视角,又与原始素材保持一致?

UniWorld-View的答案是“双流条件注入”

  • “几何流”:将点云渲染图和遮挡掩码编码后加入扩散模型的潜变量中,负责把生成内容牢牢绑定在3D空间结构上;
  • “外观流”:源视频通过新设计的“Ref-DiT模块”,以新视角特征作为Query、源视频特征作为Key/Value进行交叉注意力计算,让模型自动从原始素材中匹配所需内容,不仅可以精准补全缺失的纹理,还能顺手修复点云渲染带来的伪影问题。

两个模块各司其职,一个保障构图精度,一个还原真实外观。

依托精准的任意视角生成能力,UniWorld-View还可以实现单目视频到多视角视频的转换,进而将动态3DGS重建从不可能任务变为常规操作。常规生成式方法通常将空间变换和时间推进耦合在一起,导致4D场景中的视角分布极不均匀。而UniWorld-View将两者解耦,采用两步生成方案:

  • “先拍定妆照”:将时间冻结在视频第一帧,绕场生成一圈静态环绕视图,作为整个场景的外观锚点;
  • “再开机拍动态”:在固定机位上生成同步多视角视频,每个机位的第一帧用“定妆照”对齐,前景的自遮挡问题通过迭代生成逐步补全。

生成多视角视频后,将其输入4DGS进行优化,就能得到完整的可自由漫游的4D场景,实现从单目随手拍摄到可交互4D场景的全流程打通。

兔展智能由北京大学校友与北京大学视觉领域青年领军人才联合创立,专注视觉AI大模型研发,拥有世界一流的基于视觉大模型的多模态大模型底层自研技术,是国内视觉AI大模型领域代表企业。

公司自主研发Open-Sora Plan、UniWorld等系列视觉AI模型,其中Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量位居全球第一;UniWorld视觉大模型率先探索理解与生成统一架构。2025年,兔展智能发布的UniWorld-V2理解与生成统一架构的视觉大模型,早于NanoBanana3个月发布,引领理解生成一体化新方向;2026年4月,公司发布UniWorld-V2.5,不仅与GPT-Image-2同周发布,而且在InfoGraph、图文交错、文字密集等场景上也对齐GPT-Image-2的生成能力。

在持续推进视觉AI大模型技术演进的同时,兔展智能正加快推进UniWorld的大模型能力产品化,近期将推出产模一体设计生产工具RabbitVis,进一步推动视觉AI进入商业设计工作流。

以上内容不代表本平台立场,仅供读者参考