文章摘要
联合科研团队推出针对全景输入的户外三维重建技术方案PanoLOG,开源了相关基准数据集。它采用两阶段梯度分区框架,解决了全景图像分区难题。测试显示,其效果优于现有主流方法,具备跨数据集泛化能力,为城市级三维重建提供新路径,有广阔应用前景。

近期,一支联合科研团队联合多所高校推出了PanoLOG,这是首个针对全景输入的大规模户外三维重建技术方案。团队基于多款全景采集设备,搭建了全新的3D高斯重建框架,同时开源了首个大规模全景户外重建基准数据集Pano360。相关开源资源已逐步公开:

全景重建的核心矛盾

长期以来,城市级大规模三维重建需要依赖大量窄视场相机拍摄的照片,通过分块训练完成重建,不仅采集和计算成本极高,还容易在拼接边界出现结构不一致的问题。全景相机单次拍摄即可覆盖360°全视野,理论上能大幅降低采集端的人力和时间投入,但全景拍摄带来的“处处可见”特性,却让传统的分区重建策略彻底失效。

传统的分区重建方案依赖针孔相机的局部可见性:每个场景块只会被部分相机覆盖,系统据此将相机分配到对应的区块中。但全景相机的360°视野意味着,几乎每台拍摄设备都能覆盖绝大多数场景区块,基于可见性的分区标准失去了区分意义,原本可以并行的分块优化只能退化为高成本的全局训练。

于是,如何设计一套专门适配全景图像的分区策略,成为了将全景技术真正应用于大规模户外重建的核心前提,这也正是PanoLOG所要解决的核心问题。

PanoLOG的核心设计:两阶段梯度分区框架

PanoLOG是一个由粗到精的两阶段框架,核心模块为G²PS(即GGPS)。其核心思路在于:既然全景场景下的处处可见特性让可见性判据失效,那么就不再判断某个区域能否被相机观测到,转而评估每台相机对每个场景区块的优化梯度贡献度。对于贡献度高的区域,纳入训练流程;对于贡献度低、距离过远或被遮挡的区域,则忽略不计。通过这种方式,即使在处处可见的全景环境中,也能重新建立清晰的相机与场景区块的分配关系,恢复分块并行训练的计算优势。

阶段一:全局粗优化建立几何先验

如果直接对原始SfM点云进行分区,会在区块外留下大量漂浮的无效点云,同时由于初始渲染质量不足,会导致相机与区块的分配结果不可靠。因此PanoLOG首先对所有输入的全景图像进行一次全局粗优化,建立稳定的几何先验。与仅依赖光度监督的主流框架不同,PanoLOG首次引入了全景单目深度监督,为后续基于梯度的分区提供可靠的几何锚点。这一阶段还包含两项针对户外场景的关键优化设计:

  • 显式天空球:天空区域没有有效的SfM几何信息,容易导致近场高斯向外漂移并产生飞屑。PanoLOG在半径为场景尺度10倍的远处球面上,均匀初始化了10万个专用天空高斯。在粗训练阶段,天空高斯的位置梯度被置零以防止漂移,仅优化颜色、旋转、不透明度等外观参数,且不参与致密化过程。

  • 全景深度监督:ERP图像的两极区域存在严重的像素拉伸问题,会降低SfM三角化的质量,导致初始点云稀疏且不可靠。PanoLOG采用原生支持ERP输入的深度模型DAP生成单目逆深度图,并按照每张图像的仿射参数对齐到SfM稀疏深度。深度损失的权重会随训练过程指数衰减,早期提供较强的几何引导,后期平滑过渡到以光度为主的优化,避免深度估计误差影响最终的重建质量。

阶段二:分块精修与梯度分区策略

G²PS通过两个互补的机制解决全景场景下的分区问题:基于几何的空间分区,以及基于梯度的相机与区块分配。

1. 基于几何的空间分区

  • 对于无边界的户外空间,如果直接进行均匀网格切分,会产生大量近乎为空的区块,造成计算负载严重失衡。G²PS首先根据相机分布和三角化可靠性,将场景收缩到一个自适应的轴对齐包围盒(AABB)中。具体来说,先通过相机质心和各轴基础半径圈定相机的轨迹范围;由于全景场景的内容会延伸到相机轨迹之外,再根据相邻全景图像之间的视差不确定性估计有效重建范围,自适应扩展边界,替代人工设定的固定边界。最后将收缩后的空间进行均匀切块,得到分布更均衡的高斯集群。

2. 基于梯度的相机与区块分配

  • 在阶段一收敛后,PanoLOG对所有训练视角进行一次前向-反向传播,统计每台相机对每个区块内高斯的平均梯度幅值。相机与区块的分配同时考虑几何归属和梯度重要性:只要一台相机在几何上属于某个区块,或者其归一化梯度得分超过阈值(默认值为0.8),就会被分配到该区块。这样即使某台相机物理上位于相邻区块,只要它对该区块有显著的观测贡献,也不会被遗漏。

3. 分块优化与合并

  • 每个区块都以阶段一得到的完整高斯集合作为初始化,再使用分配给它的相机进行独立优化。天空高斯在这个阶段全程保持冻结,以保证跨区块的外观一致性。为了自适应确定每个区块的有效空间范围,PanoLOG采用了周期性的不透明度重置:重置后所有场景高斯的不透明度会被压低到较低值,只有持续收到足够光度梯度的高斯才会恢复高不透明度,其余则保持透明并被剪枝。由于相邻区块共享部分重叠的相机集合,区块边界附近的高斯能够获得跨边界的一致监督,因此无需显式拼接就能在区块交界处得到连贯的几何和外观。

最后,在渲染表示环节,PanoLOG采用ERP投影方式:将三维点的球面坐标映射到像素坐标,并通过ERP雅可比将三维协方差投影为二维协方差。与针孔相机的渲染流程不同,这里的二维协方差由非线性的ERP雅可比计算得出,而非透视投影矩阵,从而能够正确处理360°的全视野范围。

从测试结果来看,无论是全景整体效果还是局部细节,PanoLOG都稳定优于四种现有主流方法。其中优势最为明显的是城市场景中的两个常见难点:远处物体和复杂玻璃幕墙,这两类场景最能体现重建结果是否经得起近距离观察。

PanoLOG与其他全景重建方法在ERP投影图像上的效果对比

实验效果与性能对比

本次测试中所有方法统一训练30000步,默认使用两个分区,所有实验均在单张NVIDIA RTX 4090(24GB)显卡上运行。对比对象包括大规模3DGS方法H3DGS、CityGaussian、DOGS、Momentum-GS(将ERP图像转换为六面cubemap后送入针孔模型);在公开数据集上,还额外对比了全景专用方法OmniGS、ODGS、SpaGS以及cubemap输入的3DGS基线。评价指标采用PSNR、SSIM、LPIPS和模型体积。

1. 无人机航拍场景测试(Pano360数据集子集NSC、NSK)

PanoLOG在NSC子集上取得了最优的PSNR、SSIM、LPIPS指标,同时模型体积最小;在NSK子集上则取得了最优的SSIM和LPIPS指标。

2. 手持街景测试(Pano360数据集子集BAX、NSN)

在难度更高的手持街景场景中,PanoLOG的PSNR表现比最强基线在BAX子集上高出0.64dB,在NSN子集上高出1.16dB,而模型体积仅为最强基线的1/2.9到1/7.5。作为对比,最强基线H3DGS为了适配场景规模,模型体积在这两个子集上分别达到了约7.6GB和5.7GB。

3. 公开数据集泛化性测试(Ricoh360、360Roam)

为验证模型的泛化能力,团队在Ricoh360和360Roam公开数据集上对比了全景专用重建方法。PanoLOG在两个数据集的PSNR、SSIM、LPIPS六项指标上全部取得最优,说明这套全景原生的重建设计并不局限于自建数据集,具备良好的跨数据集泛化能力。

技术价值与行业应用前景

PanoLOG最核心的贡献,在于改变了大规模场景重建长期依赖的分区假设:将分区判据从空间可见性转换为梯度贡献度。在全景相机的拍摄场景中,每张图像几乎覆盖全视野,基于可见性的分区框架彻底失效;而引入几何与梯度评估后,系统即使在处处可见的环境中,也能重建出清晰的相机与分区关联,让大规模3D高斯溅射技术首次真正适用于全景数据,为低成本的城市级三维重建提供了全新的技术路径。

将视野放到更广阔的行业愿景中,这项技术与全景影像厂商的长期产品布局高度契合。2026年7月,某全景影像厂商在成立十一周年之际,提出了Cameraman(摄影机器人)的产品愿景:这并非某一款单一的终极产品,也不局限于某一具体形态,而是一个自主拍摄的智能体概念——由AI影像系统作为大脑,镜头作为眼睛,音频作为耳朵,云台与无人机作为可活动的躯干,根据不同场景灵活适配最合适的载体,让人们从繁重的器材操作中解放出来,将感官和注意力交还给眼前的瞬间。全景航拍无人机正是这一愿景的早期雏形之一。

在这样的愿景中,重建可感知的三维世界,是让智能体理解并置身于真实环境的基础能力。一个自主拍摄的智能体,首先需要能够感知空间的结构与边界,才能谈得上自主构图、移动和完成拍摄。PanoLOG所做的,就是将全景相机采集到的现实场景,还原为结构一致、可自由漫游的三维表示。其价值可以从三个层面来看:

  • 面向C端用户:PanoLOG提供了一套轻量的纯视觉重建方案,仅需使用现有的全景采集设备即可完成数据采集,致力于将户外场景还原为可在手机、PC端拖拽漫游的360°三维场景。

  • 面向具身智能:全景重建与具身智能所需的基础数据高度匹配,真实且一致的物理世界正是智能体训练与仿真的核心基础。全景无人机在全景拍摄和高密度信息获取上具备天然优势。

  • 与世界模型互补:高斯重建能够提供与现实完全一致的物理世界表示,而视频生成或世界模型则能够提供可发散的虚拟未来世界,两者在应用和研究中可以取长补短、协同发展。

作为某全景影像研究院在全景空间智能方向上的学术成果,PanoLOG更像是通往上述愿景的一块技术积木,而非最终的终点。正如该厂商所描述的,摄影机器人是一条需要持续积累、逐步成形的长期路线;沿着这条路线,让全景影像不仅被记录、更被理解,是一个值得长期投入的研究方向。

以上内容不代表本平台立场,仅供读者参考