影溯科技Topos-Lite:三维场景从二维图像快速生成

从2D像素到3D场景Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。
只用手机随手拍几张照片,就能把现实场景变成可自由浏览的3D空间?这不再是科幻场景,如今已经有工具让普通人也能轻松实现。比如对着桌上的小摆件随手拍几张照片,短短几秒,原本平面的摆件就会从照片中“立”起来,变成可以随意旋转查看的3D模型,全程不需要专业扫描设备,也不用漫长等待,简单拍摄几张照片就能完成。
你也可以用手机从不同角度给楼下的咖啡店拍上6张照片,这个空间就会完整保存在手机里;即便是自家的卧室,经过几次拍摄后,也能变成可以自由探索的3D空间。聚餐、桌搭、毕业纪念、搬家留念、婚礼记录、日常点滴……手机原本只能记录平面的瞬间,现在却可以留下可进入的完整场景,分享给身边的朋友,体验感十足。
这款名为Crystal空间相机的免费工具,正是影溯科技将前沿研究成果落地的产品,让普通用户也能轻松体验3D空间拍摄的乐趣。
这款工具背后的核心技术,是影溯正式开源的前馈式3D高斯溅射生成技术QuerySplat。该技术仅需用户拍摄少量不同角度的照片,无需提供专业的相机位姿信息,就能通过一次前向推理,在秒级时间内生成可自由切换视角的完整3D场景。
在DL3DV-Evaluation大规模基准测试的2、4、12视图设置中,Topos-Lite模型在PSNR和SSIM两项指标上均取得最优结果;在更侧重感知相似度的LPIPS指标上,也在2视图和4视图设置中位居第一。从直观效果来看,该模型生成的物体边缘更锐利、纹理更清晰,跨视角的场景结构也更加稳定。
这一次,影溯选择将QuerySplat开源,不只是公开一项技术成果,更希望推动前馈式3D生成从少数团队的前沿探索,走向整个行业可以共同验证、持续迭代的技术基础,加速3D内容生产真正迈向规模化,并创造出更多好玩的3D应用。
-
项目主页:
-
GitHub 与模型权重:
-
技术报告:
重构三维场景的组织逻辑
Topos-Lite最值得关注的地方,并不只是把3D场景做得更清晰,而是改变了模型组织三维空间的方式。
传统的前馈式3DGS方法大多采用像素对齐的范式,简单来说,模型会从每张图片的每个像素出发,预测该像素在三维空间中的对应位置,再将大量预测结果组合成完整场景。但这种范式存在先天缺陷:高斯点被牢牢绑定在二维图像的像素和相机射线上,不同视角的像素一旦出现细微误差,就会在三维空间中产生冲突,最终导致重影、漂浮、结构偏移,或是出现大量小尺度、低效率的高斯球。这就好比几个人从不同角度给同一个花瓶描轮廓,再将多张透明描图纸叠在一起,理想状态下瓶口、瓶身和底座应该精准重合,但只要其中一张画偏,叠合后就会出现双重轮廓,周围还会留下零散的线条。
而Topos-Lite采用了基于Query的全新思路,它不再要求每个高斯点首先属于某一个像素,而是让一组可学习的Query充当“场景级位置槽位”。每个Query可以跨越多张图片、多个区域聚合信息,最终在连续三维空间中生成一组高斯基元。这让Transformer熟悉的Query和Attention机制真正承担起组织三维场景的角色:Query不再仅仅围绕二维Token工作,而是成为连续三维空间中的场景存储单元。
降低门槛:从专业工具到大众应用
传统的高质量3DGS往往需要围绕场景采集大量照片,获取或计算相机参数后,还要对单个场景进行较长时间的优化,虽然能得到不错的效果,但每处理一个新场景都要重复一遍流程。而前馈模型改变了这种成本结构:模型训练完成后,面对新场景无需从头优化,只需完成一次预测即可,就像图像生成模型不会为每张新图片重新训练一样,3D场景生成也从单个项目定制,变成了可重复调用的通用能力。
对于普通用户来说,这种前馈模型带来了三个最直观的改变:需要拍摄的照片数量大幅减少,无需手动提供专业的相机标定信息,等待时间也从传统流程压缩到秒级级别。
从测试结果来看,Topos-Lite在多种稀疏视图设置下的DL3DV-Evaluation基准测试中取得了目前最优的整体表现。尤其是在4视图设置中,该模型在PSNR、SSIM和LPIPS三项指标上均位居第一,即便仅输入两张照片,也能保持领先的场景结构和渲染质量。
除了顶尖的效果表现,Topos-Lite还提供了清晰的容量扩展接口。在训练过程中,Query的数量可以从1024逐步扩展到8192,每个Query负责解码一组高斯基元。更强的几何骨干、更大的解码器、更多的Query数量,以及更高分辨率的外观特征,都可以单独进行扩展。
这还不能简单地被称为已经验证了“3D缩放定律”,但它至少说明了一个关键问题:前馈化解决了新场景的边际生成成本,而基于Query的设计则为场景表达容量留下了持续扩展的空间,这意味着速度和质量不再需要二选一。
需要说明的是,Topos-Lite目前仍处于早期研究阶段,性能远未达到天花板。随着数据规模效应的持续推动,其3D生成的品质和精细度还将不断提升;更值得期待的是,未来该模型有望在端侧高效运行,实现3D内容的本地快速生成,解锁更多应用场景。
空间智能:AI进入真实世界的基础
在影溯科技看来,过去十年人工智能主要在学习人类已经表达出来的世界,而下一阶段,AI需要进一步理解世界本身。语言是智能理解人类文明的入口,而空间则是智能进入真实世界的基础。
图片和视频虽然包含丰富的空间线索,但本质上仍然是三维世界在特定时间、特定视角下的二维投影。同一个房间可以拍出无数张不同的画面,但背后不变的仍是房间本身的三维结构。因此,二维更像是观测数据,三维则更接近真实状态。
如果模型仅从二维像素中学习,不仅需要理解场景本身,还要反复处理视角、投影、遮挡和光照带来的变化。视频中的大量帧,可能只是在不同位置、不同时间重复记录同一面墙或同一张桌子,模型需要从这些高度冗余的观测数据中,反推出背后相对稳定的空间结构。而引入三维表征,则意味着将“世界的真实状态”和“我们的观测方式”分开。模型可以学习一种更紧凑、更稳定的空间表征,理解该状态如何在不同视角和条件下生成不同的观测结果,无需反复记忆大量相似画面,也能更高效地追踪环境、物体及其相互关系。
这也解释了为什么空间智能并非AI的边缘分支:语言模型可以回答“这是什么”和“这意味着什么”,但进入真实世界的智能系统还必须回答“我在哪里”、“物体之间是什么关系”、“下一步会发生什么”以及“我应该如何行动”。从数字智能迈向物理智能,空间理解不是可选项,而是必须掌握的基础能力,更是无法绕开的关键门槛。
二十年技术积累:从学术研究到产业落地
空间智能是一条很难依靠短期热点快速走通的技术路线,从相机模型、标定、SLAM,到三维重建和几何优化,再到神经网络训练、数据系统与产品部署,每个环节都有大量不为人知的工程细节。一项技术在论文中成立,不代表它能在真实环境中稳定运行;一个演示效果足够漂亮,也不代表它能以可控成本实现规模化应用。
而影溯的核心团队在SLAM、三维视觉和空间智能领域已有近二十年的积累,早已形成一套贯通基础研究、工程实现与产业落地的完整能力体系。二十多年来,影溯创始人章国锋教授始终在追问一个核心问题:机器究竟该如何理解真实的三维世界?
章国锋本科和研究生阶段均攻读计算机专业,在研究生时期加入鲍虎军教授团队,从大型科研项目中的摄像机跟踪问题切入三维视觉领域。最初他需要解决的是如何从一段视频中恢复摄像机的运动,之后问题从离线处理转向实时跟踪,从单一镜头扩展到SLAM、三维重建和空间智能。这些技术方向背后指向的都是同一个目标:机器不能只看到一帧画面,还要知道自身所处的位置、周围物体的分布,以及不同视角下的观测内容为何属于同一个空间。
此后,章国锋完整经历了三维技术从摄像机跟踪、移动端SLAM、实时空间重建,到NeRF、3D高斯溅射、生成式3D和世界模型的发展历程,技术表现形式不断变化,但核心问题始终未变:如何从有限的二维观测数据中,恢复、表征并推演背后相对稳定的三维世界。
如果说高校研究让他不断接近这个问题的技术本质,那么在商汤负责数字空间相关技术与业务的经历,则让他看到了另一面:一项三维技术在论文中成立,和它能否成为真实世界的基础能力,是两回事。三维技术要落地产品,不仅要追求精度,还要兼顾速度、稳定性、设备成本、系统效率和客户交付;要从一次精彩的演示走向规模化应用,就必须将单个场景单独优化的项目能力,转化为可持续复用、规模化调用的系统能力。
多年的双重身份淬炼,让他能够将空间智能的前沿算法转化为驱动产业变革的实际动能。而这些来自学术端的理论突破与产业端的落地认知,又通过联合创始人刘浩敏博士及其团队的工程化能力进一步放大,在产业一线完成了模型训练、效率优化与系统验证,让前沿算法能够在有限算力下实现实时响应和极致吞吐。
长期协作带来的价值远超简单的彼此熟悉:在底层技术研究中,大量问题没有标准答案,技术路线也往往无法提前验证,团队需要能够快速暴露问题、互相质疑结果,并在信息不充分、方向不确定的情况下依然形成共同判断。人才可以招聘、设备可以购置,但共同的技术语言、对问题的判断方式以及彼此间的信任,只能通过时间积累形成。
据行业观察,影溯的团队结构颇为特别:既有深耕多年的技术骨干,也充满年轻团队的活力。多位核心成员已在三维视觉领域深耕十余年,围绕3D研究积累了长期迭代的基础设施;与此同时,许多年轻研究者也能直接参与核心课题并承担关键工作——Topos-Lite的关键突破,就是由团队中的“00后”研究员主导完成的。长期积累与年轻研究者的快速成长在这里并不矛盾,反而共同构成了团队的研究效率。
这种组织方式背后,是影溯对研究效率的判断:真正有潜力的研究者,应当尽可能接近核心问题,并在真实任务中快速成长,年龄、资历和头衔可以作为参考,但不应成为人才参与核心创新的边界。
落地场景:从个人记录到产业应用
当然,空间智能的终极目标宏大,但三维技术的价值并不需要等到机器人真正进入千家万户才开始显现。更现实的路径是先降低三维内容的生产门槛,让它融入人们已有的记录、展示与创作需求。
首先是空间记录:当三维生成足够简单、快速且低成本,人们可以将几张照片变成可自由切换视角、重新体验的“空间照片”。即将搬离的第一套房子、孩子成长的房间、毕业前的教室或是婚礼当天的礼堂,都可以从一组平面影像变成完整的空间记忆。过去二维影像成为主流,很大程度上源于其捕捉、存储和传播成本更低,当三维内容的使用门槛接近普通拍照,记录生活的媒介也将随之改变。
其次是空间展示与远程体验:在房产、酒店、商业展陈、零售门店和室内设计等领域,用户真正关心的往往不只是几张精心挑选的平面图片,还包括空间布局、物体间的关系以及人在其中移动时的视觉变化。通过少量现场照片快速生成可浏览的三维场景,可以让看房、选房、展厅参观、装修沟通和商品陈列拥有更直观的表达方式,同时降低传统三维采集和内容制作的成本。
还有生成式内容生产:对于游戏、影视和互动内容创作者而言,这意味着二维生成、视频制作和三维场景之间可以建立更直接的连接。未来,一段生成视频或几张概念图,可能进一步转化为可自由浏览、继续编辑和用于虚拟拍摄的三维资产,从而融入游戏、影视、电商和互动内容等工作流。
而对于机器人来说,这些三维世界有着更重要的意义:当场景进一步具备物体语义、动态变化和物理规律,它们就不再仅仅是供人观看的内容,更可以成为机器进行仿真、验证和学习的训练场。机器人可以在进入真实世界之前,先在无数可生成、可控制、可重复的虚拟世界中体验环境、理解空间、学习行动。
先让三维技术进入真实场景,再通过真实使用产生的数据训练更强的空间智能,这可能是三维数据规模化落地的现实路径。
面向未来:构建物理智能的基础设施
如今,“世界模型”已经成为被广泛讨论的概念,从视频生成、可交互游戏环境到机器人控制系统,不同的技术路线都被纳入世界模型的讨论范畴。对于影溯而言,世界模型是实现目标的技术路径,空间智能才是长期发展方向。
他们希望构建的,是一种能够在现实世界中验证自身空间理解能力的智能:知道自身所处的位置,理解物体、环境与自身的关系,能够预测世界的变化,也能判断行动带来的结果。显然,Topos-Lite还不是这个终极目标,但它解决了一个基础且现实的问题:让Transformer借助明确的三维结构,从少量二维观测中快速组织出稳定、清晰、可渲染的三维场景。
更重要的是,它让影溯关于空间智能的长期判断,落实到了可公开体验、量化评测和持续迭代的技术成果上。未来的空间智能会继续沿着Transformer演进,还是转向JEPA或其他尚未出现的新架构,目前尚无定论,但无论架构如何变化,只要机器需要进入真实世界,空间理解就无法绕开;要形成这种能力,也离不开大规模、高质量的3D、4D数据,以及持续降低数据生产成本的基础设施。
在这一宏大的叙事中,影溯希望参与建设面向物理智能的模型、数据与工程基础设施。未来的机器人、智能汽车、智能眼镜和各类新型终端形态各异,但都需要一个“大脑”来理解自身所处的空间,并据此感知、预测和行动。Topos-Lite正是这条长路上的阶段性证明:三维场景可以生成得更快、更清晰,也可以更开放地被调用;Transformer的处理对象,也开始从语言和二维Token延伸到连续三维空间。
当空间能够像图片和视频一样被低成本记录、生成和分享,一个属于三维内容的全新网络,或许才刚刚拉开序幕……
影溯科技长期诚邀三维视觉、AIGC、世界模型、多模态大模型、AI Infra、AI系统工程师、AI产品及人工智能前沿研究的研究者与工程师加入,共同探索空间智能和三维世界模型的更多可能。招聘详情请关注“影溯科技”微信公众号,也欢迎通过hr@inspatio.com投递简历。


