文章摘要
本文围绕 3D 高斯泼溅技术(3DGS)展开,指出其在落地时存在工程鸿沟。CVPR 2026 的研究从生产、运行、架构、应用四个维度突破,实现了从实验室原型到工业级工程利器的转变,使其成为具身智能核心物理底座。不过,要融入工业体系,还需攻克材质光照解耦、软硬件协同等问题,华人团队在该领域展现出强大实力。

3D高斯泼溅技术(3DGS)曾因实验室环境下惊艳的3D渲染效果引发广泛关注,但当真正落地到手机、机器人等真实场景时,算法往往会出现卡顿甚至崩溃的问题。实验室原型和工业现场可用的方案之间,横亘着一条难以逾越的工程鸿沟。到了CVPR 2026,这场技术内卷终于转向了实用化落地,前沿团队从生产、运行、架构、应用四个维度全面突破,让3DGS不再只是视觉展示工具,而是成为具身智能与世界模型的核心物理底座。本文将拆解8篇顶会代表性论文,完整呈现3DGS跨越工业化门槛的蜕变路径。

生产端:告别漫长等待,实现秒级生成与算力弹性分配

传统3DGS工作流中,场景构建往往需要数十分钟甚至更久的逐场景迭代优化,而且早期算法采用像素对齐策略,为每个输入像素生成一颗3D高斯图元,导致无论是无纹理的白墙还是复杂的枝叶,都被塞满了相同密度的高斯点,最终生成的场景文件臃肿不堪。针对这些痛点,研究者们提出了明确的破局思路:放弃漫长的逐场景优化,转向前馈神经网络实现秒级甚至毫秒级单次推理出图;同时打破“一像素一高斯”的死板限制,让高斯图元的数量和密度可以根据场景复杂度和硬件性能动态调整。

EcoSplat:像调整视频清晰度一样,按需裁剪3D模型

现有前馈重建模型通常只能预测固定数量的密集高斯图元,无法根据端侧设备的实际算力动态调整,将百万级高斯图元的模型部署到低配手机或VR头显,要么显存溢出,要么渲染卡顿。来自韩国科学技术院、中央大学与Flawless AI的联合团队提出的EcoSplat,为前馈模型加装了“重要性调度器”。该模型的训练分为两个阶段:先通过基础训练学会预测高斯图元,再引入“重要性感知透明度损失”进行微调,让模型学会为不重要的高斯图元压低透明度,建立起一套完整的重要性排序机制。在实际应用中,用户只需输入目标高斯数量K(比如50万或5万),EcoSplat就能在毫秒级推理中自动挑选出当前算力预算下最核心的Top-K高斯组合。在RealEstate10K数据集上的测试显示,即便将高斯图元削减至仅5%(约7.8万个),EcoSplat依然能保持24.72dB PSNR的高质量渲染,真正实现了“一套模型,跨端弹性部署”。

SparseSplat:智能稀疏化,让白墙少给点、细节多给点

如果说EcoSplat解决了高斯数量的弹性调度问题,复旦大学与上海科技大学的联合团队提出的SparseSplat,则从具身智能与工业落地的视角,进一步解决了高斯分布的智能稀疏化问题。针对白墙与花草被平铺相同数量高斯点的不合理现象,SparseSplat借用信息论中的信息熵概念,在推理时先计算局部窗口的复杂度:遇到平坦无纹理的区域,就用少量大尺寸高斯图元快速覆盖;遇到复杂的细节纹理,则集中铺设密集的小尺寸高斯图元。更巧妙的是,SparseSplat放弃了用全局特征预测单点的设计,转而在3D空间中查询锚点的K近邻,利用几何感知注意力机制精准预测高斯属性。这种稀疏化设计带来了惊人的效果:在DL3DV数据集上,SparseSplat仅用15万个高斯图元(仅为传统模型的22%),就达到了同等甚至超越当前最优方法的渲染画质(24.20dB PSNR);在极限压缩至1万到4万高斯的超稀疏模式下,渲染帧率更是飙升至600~1100+FPS,直接打通了移动端实时渲染与机器人调度的性能血脉。

运行端:榨干GPU性能,攻克大场景卡顿与收敛慢

完成了生产端的轻量化生成后,3DGS落地的下一个硬考验是运行渲染端。在无人机巡检城市街区、虚拟博物馆漫游、自动驾驶仿真等工业场景中,场景规模往往极其庞大,高斯图元数量动辄百万甚至千万。此时顶级显卡也会陷入两难:连续交互的动态渲染中,每一帧都重复执行视锥裁剪和深度排序,产生大量冗余计算;同时大场景中物体的几何复杂度极不均匀,天空区域几乎没有负载,而建筑细节区域的高斯点高度堆叠,导致GPU计算核心忙闲不均。此外,传统3DGS的训练优化阶段依赖漫长的高斯分裂试错过程,也极大拉长了场景收敛的时间。针对这些瓶颈,CVPR 2026的研究者们深入GPU底层算子与图形学渲染管线,通过缓存机制、负载均衡调度与一步到位的几何初始化,实现了渲染帧率与收敛速度的双重突破。

CaT-GS:借用游戏引擎缓存,大场景渲染提速10倍

交互式三维漫游中,相邻两帧的镜头移动往往非常微小,这一特性在传统游戏引擎中常被用于帧间优化,但传统3DGS渲染管线却会为每一帧重复执行视锥裁剪和高斯深度排序。上海交通大学与UIUC的联合团队提出的CaT-GS,首次将现代图形引擎的“缓存与推测调度”思想引入3DGS渲染管线。该方法将连续渲染过程划分为“关键帧”与“子帧”:在关键帧阶段采用“推测式多帧预处理”,通过预测相机轨迹计算未来几帧高斯图元扫过的空间轨迹包围盒;后续子帧则直接启用“视锥缓存”与“排序缓存”,沿用关键帧处理好的渲染列表,跳过重复的裁剪与排序计算。针对GPU核心忙闲不均的问题,CaT-GS重构了CUDA渲染算子,引入“负载感知任务拆分”机制,自动识别包含海量高斯图元的重负载图像块,将其切分为多个子任务分发给GPU的多个流多处理器并行处理,同时在数学上重构alpha混合公式,确保拆分并行计算后画面颜色依然精确。在包含700万以上高斯图元的无人机城市级重建数据集上,CaT-GS实现了相比传统3DGS高达10倍的渲染加速,在1080P高清分辨率下依然能跑出200+FPS的流畅帧率,彻底攻克了大场景交互卡顿的顽疾。

EDGS:告别繁琐试错,一步生成高精度几何表面

除了渲染时的GPU算子卡顿,场景模型训练端的传统高斯分裂机制也带来了巨大的时间成本。传统3DGS从稀疏的SfM点云开始,在训练过程中通过光度损失梯度逐步分裂、增密高斯图元,这个过程不仅收敛极慢,还容易在高频细节区域产生抖动和伪影。慕尼黑大学CompVis实验室的团队提出的EDGS,提出了一个颠覆性的方案:彻底消除高斯分裂步骤。该方法的核心逻辑是用高质量的初始化代替后期迭代试错:团队利用成熟的2D特征匹配算法(如RoMa),在训练前直接对多视角图像进行密集的像素匹配与三角化,结合重投影误差与匹配置信度,在场景中直接一步到位地铺设高质量的3D高斯点,并提前计算好位置、颜色、缩放以及球谐函数系数。由于初始高斯图元就被放置在精准的几何表面上,后续优化中高斯点的空间位移缩减了50倍。实验表明,EDGS在没有任何分裂步骤的情况下,仅需传统3DGS 15%的训练时间(训练5000步),就能达到甚至超越传统方法训练30000步的画质,这种“一步到位”的工程设计不仅大幅缩短了场景重建的等待时间,也让算法具备了极佳的稳定性。

架构端:打破像素绑定,实现端侧本地即时更新

攻克了生产速度与GPU渲染效率后,3DGS走向工业部署的第三道关卡是基础架构层面的问题。传统3DGS算法存在一个固有结构缺陷:倾向于将3D高斯图元与输入的2D图像像素或相机射线进行死板的“一对一”绑定。这种绑定在实验室标准数据集上表现尚可,但在真实世界复杂多变的移动端应用中,极易引发崩溃:一方面,现实拍摄的相机姿态数据往往包含噪声,死板的像素射线绑定会将姿态噪声成倍放大,导致重建出的3D场景充斥刺状伪影与悬浮杂质;另一方面,当模型部署到智能手机、AR头显或无人机等端侧设备后,面对新视角或光线变化时,设备无法承担昂贵的全局重优化,而传统微调方式又极易破坏模型原本学到的通用3D先验。针对这些架构痛点,NVIDIA研究团队提出的TokenGS,提出了解耦高斯预测与逐像素计算的全新架构,为3DGS在端侧设备的灵活部署与在线微调打开了新局面。

TokenGS借鉴了计算机视觉领域DETR的可学习Token思想,设计了全新的Encoder-Decoder架构。网络不再盲目沿每一条像素射线推算高斯点,而是将多视角图像特征提取后送入Transformer解码器,利用一组可学习的3D空间Token直接“查询”并回归全局空间中的3D高斯坐标与物理属性。这种架构解耦带来了两个关键优势:一是强抗噪性,由于预测过程不再依赖精准的逐像素射线几何投射,TokenGS对相机姿态噪声展现出极强的鲁棒性,即便输入图像的相机位姿存在偏差,模型依然能构建出干净平滑的3D几何表面;二是端侧在线微调(Test-Time Token Tuning, TTT),这是TokenGS最亮眼的工程特性:当用户在真实场景中漫游需要针对新视角微调时,系统完全不需要重新训练庞大的主干网络,端侧设备只需冻结全部主干参数,仅对极轻量的3D Token进行在线微调。在实际评估中,TokenGS证明了其架构的高效性,面对未见过的复杂场景与带姿态偏差的输入时,仅需在端侧进行极少步数的Token微调,就能大幅提升渲染画质,同时极大降低端侧显存与算力消耗,彻底避免了重新训练可能导致的模型参数遗忘。TokenGS在架构端的突破表明,3DGS正在脱离早期粗暴的“像素绑定”范式,向着模块化、低耦合以及可动态更新的现代神经网络架构演进,这种解耦设计不仅赋予了算法应对真实传感器噪声的鲁棒性,更为三维模型在移动终端上的“个性化在线学习”与“实时增量更新”奠定了坚实的架构基础。

应用端:摆脱观赏属性,打通导航、物理与机器人训练

攻克了生产速度、渲染效率与架构解耦后,3DGS离真正商业落地只剩最后一步:打破“只能看不能用”的观赏性壁垒,让高斯模型能够与物理世界进行交互。在过去的工业实践中,传统3DGS模型更像是精致的虚拟沙盘,由于缺乏物理质量、速度概念以及鲁棒的传感修正机制,机器人无法直接利用它进行实时避障导航,游戏物理引擎无法计算高斯物体的受力形变,自动驾驶与具身智能团队也难以将其转化为可用于模型训练的数据基础设施。针对这些系统对接的硬伤,CVPR 2026的三项代表性工作分别从视觉SLAM建图、连续物理仿真以及具身智能数据合成三个维度,打通了3DGS接入真实工业生产管线的最后一步。

SGAD-SLAM:实时纠正镜头误差,为机器人装上抗噪3D眼睛

对于在未知环境中自主探索的机器人或无人机而言,基于RGB-D相机的SLAM是其导航与避障的生命线,但真实工业级RGB-D传感器传回的深度图往往充斥着噪声,甚至在玻璃、高光或边缘区域出现大面积的深度偏移。如果直接使用带严重误差的原始深度输入,传统3DGS建图会发生严重的几何畸变与鬼影,最终导致机器人导航时发生碰撞事故。来自国防科技大学与中山大学的联合团队,以及美国韦恩州立大学机器感知实验室的研究,共同提出了带深度修正机制的3DGS实时建图框架SGAD-SLAM。该方法的核心逻辑是不再盲目信任硬件传感器传回的原始深度值,而是在训练与建图过程中引入动态的“深度偏移调整”模块,在建图的同时通过重投影残差与局部几何一致性约束,实时估计并补偿传感器的深度系统偏差。即便在传感器噪声剧烈或缺乏光照的恶劣环境下,系统依然能修正出平滑且几何精准的高斯地图,并实时输出高精度的相机位姿轨迹。这种抗噪能力的提升,意味着3DGS正式具备了作为“机器人导航高精地图”的工业可用性,机器人不仅能在复杂室内或工业厂房中实现毫秒级位姿跟踪,还能实时生成兼具高视觉逼真度与高几何精准度的三维环境地图。

ParticleGS:把高斯变成真实物理粒子,推算碰撞轨迹

如果说SGAD-SLAM解决了静态环境的导航问题,那么面对现实世界中的动态物体,传统3DGS就会暴露短板。以往的动态3DGS主要通过给高斯点添加随时间变化的变形场来实现动效,本质上是“背诵历史动作”的内插记忆,只要时间超出训练视频范围或物体受到外部碰撞,传统模型就无法预测未来运动,甚至出现严重的穿模和物体解体。浙江大学研究团队提出的ParticleGS,提出了颠覆性的解法:将每个3D高斯图元直接看作一颗真实的物理粒子,并为其赋予位置、质量、速度以及粒子间的作用力。为了准确建模连续的物理过程,ParticleGS引入了常微分方程神经网络(Neural ODE),算法在隐空间中学习连续时间下的神经力学场,利用神经网络拟合动量守恒、惯性与碰撞反弹等真实物理定律。通过这种物理引擎级的重构,ParticleGS实现了真正的未来运动外推:在机器人操控或游戏仿真中,给高斯物体施加一个推力,系统就能基于物理定律推算其未来的反弹轨迹和受力形变,让3DGS从“只能看不可动的像素点”,变成了“具备真实动力学响应的物理实体”。

Video2Robo:单目视频生成机器人训练数据

在具身智能领域,训练机器人操控物体的瓶颈从来不是算法本身,而是高质量训练数据的匮乏。传统做法依赖人类操作员手持手柄遥控机器人完成成千上万次重复实验,不仅效率低下,场景单一,一旦环境光照或背景改变,机器人就会失灵。北京理工大学研究团队提出的Video2Robo,提供了一条低成本高效率的数据生成路径:用一段随手拍摄的手机视频,通过3DGS快速构建数字孪生空间,批量合成海量机器人模仿学习训练数据。该方法的工作流程分为三个步骤:首先是单目视频三维资产提取,开发者只需拿着手机围绕目标物体拍摄一段短视频,系统就会自动将目标物体与环境分离,生成解耦的3DGS物体模型;其次是万能数据增强,在构建好的3DGS虚拟空间中,开发者可以随意改变光照方向、随机替换背景纹理、调整相机视角甚至改变物体初始摆放位置,瞬间扩增出成千上万种不同环境下的逼真仿真图像;最后是闭环策略训练与部署,将这些经过增强的高保真数据直接喂给机器人的端到端视觉策略网络进行训练,由于3DGS渲染出的画面极其逼真,机器人从虚拟环境中学到的操作技能可以无缝迁移到真实物理世界中,成功率大幅提升。Video2Robo的出现,将具身智能机器人训练的数据准备周期从“按周计算”缩短到“按小时计算”,真正搭建起了连接真实物理视觉与具身大脑训练的数字孪生工厂。

告别观赏时代,3DGS成为具身智能的物理底座

纵观CVPR 2026的这8篇代表性论文,3D高斯泼溅技术已经正式完成了从“实验室算法原型”到“工业级工程利器”的关键蜕变。从生产端的前馈秒级生成与算力弹性调控,到运行端的GPU算子重构与管线优化,再到架构端的解耦微调以及应用端的系统级集成,学术界与工业界正联合打通覆盖3DGS全生命周期的落地链条。

这场工程化变革最深远的影响,在于它彻底重新定义了3DGS的应用边界:它不再只是用来生成漂亮3D相册或虚拟漫游演示的视觉工具,而是正在加速成为具身智能与自动驾驶世界模型的核心物理底座。当高斯图元拥有了可自适应控制的算力规模、实时抗噪的传感器接口以及Neural ODE驱动的物理碰撞能力,机器人训练便不再极度依赖昂贵的人工遥控,开发者可以直接在3DGS搭建的高保真数字孪生空间中完成大规模强化学习,真正架起了连接真实物理世界与虚拟机器脑的通用桥梁。

当然,要让3DGS彻底融入现代工业体系,攻坚“下半场”仍需跨越若干硬伤。首先需要攻克的是材质与光照的解耦,算法需要摆脱将光影死板“烘焙”在球谐函数里的局限,将高斯图元拆解为粗糙度与法线等PBR材质属性,使其能够无缝接入现代图形引擎的动态光照系统。与此同时,软硬件协同的芯片化加速与工业传输标准的建立也将成为重头戏:随着软件算子优化逼近极限,未来的移动端SoC极可能会在硬件层引入专用的高斯渲染加速模块;而统一的压缩规范,则是把庞大场景压缩至数兆字节、实现Web端高并发分发的必由之路。

值得注意的是,在这场3DGS的全球范式转移中,华人学术与产业力量展现出了惊人的主导力与工程爆发力。从复旦、上科大、上交大等顶尖高校,到深耕具身智能与3D世界模型的一线创业团队,华人研究者们正站在这一轮空间计算与具身基础设施革新的最前沿。在下一期专题中,我们将深度梳理在3DGS、空间计算与具身智能领域大放异彩的华人顶尖团队与代表性工作,带大家看懂中国智造在3D世界模型上的核心硬实力。

深度拆解产业前沿,对话改变世界的50位领军人物。欢迎关注我们的【世界模型50人】重磅系列,如果你是本文提到工作的作者,或正深耕于3DGS领域,欢迎联系我们。我们将持续专访与追踪全球3D视觉、物理引擎、空间计算及具身智能领域的顶级科学家与产业开拓者,带你一窥下一代人工智能的物理真相。

以上内容不代表本平台立场,仅供读者参考