文章摘要
8月28日,高德发布首款无长程依赖的万帧级流式3D重建模型ABot-Recon,它仅依靠连续12帧局部画面,就能实现万帧场景的实时稳定重建,解决了传统方案误差累积、显存占用高等问题,精度速度均达行业领先,现已开源并开放体验,可适配多领域应用需求。

随着自动驾驶、具身智能等技术向真实开放场景落地,物理智能不再局限于“看见”环境,而是需要在移动过程中持续完成空间理解——确定自身位置、识别周边环境、规划下一步行动。尤其是在商场、园区、仓库这类定位信号弱、环境变化快的私域场景中,依赖一次性建图或事后重建的方案往往难以适配实时需求。

当前行业主流的实时三维重建方案依赖流式3D重建技术,但这类方案普遍存在误差累积、显存占用过高的问题。为了维持长距离场景的全局一致性,传统模型会设置记忆锚点,需要依赖长程记忆反复保存、检索和融合历史信息,随着视频序列变长,模型的推理速度会变慢、精度会下降,显存占用也会持续攀升。

8月28日,高德正式发布了首款无长程依赖的万帧级流式3D重建模型ABot-Recon,这款模型跳出了传统方案的桎梏,仅依靠连续12帧的局部画面,就能实现上万帧场景的实时稳定重建,真正做到“边拍边建”。在KITTI、Oxford Spires、VBR等多个权威行业评测中,ABot-Recon都取得了最低误差的当前最优成绩。

ABot-Recon采用了全新的局部位姿预测+残差优化技术路线,彻底摒弃了依赖长程记忆锚点的记忆对齐方式。模型仅以最近12帧连续画面作为局部上下文窗口,每次只预测当前相机坐标系下的局部点云和相邻两帧之间的相对位姿,这样可以让计算复杂度保持恒定,同时保证轨迹平滑,再通过在线组合逐步拼接出完整的全局轨迹和三维场景。由于预测目标始终是局部的,和序列长度无关,模型的内存占用和单帧计算量不会随着视频变长而膨胀。

针对局部预测过程中可能出现的误差累积问题,ABot-Recon分别在预测端和训练端设计了纠偏与误差约束机制,可以实时校准轨迹误差,从根源上优化重建效果。

精度上,在Oxford Spires长序列基准测试中,ABot-Recon的平均轨迹误差比行业代表性方法LingBot-Map降低了40.6%;相对旋转误差RPE-R低至0.12°,是同类流式方法中的最优水平,较前代当前最优模型降低了约40%。

速度上,在KITTI-02测试中,ABot-Recon实现了24.45FPS的实时重建速度,推理速度达到行业代表性方法的1.24倍。在所有平均轨迹误差低于20米的方案中,ABot-Recon的吞吐率最高、显存占用最低。

显存方面,ABot-Recon的峰值显存仅约6.71GB,仅为同类模型的三分之一,这意味着普通消费级显卡GTX 1080Ti就可以流畅运行,大幅降低了流式3D重建技术的使用门槛。

值得一提的是,ABot-Recon仅需要单目RGB视频作为输入,无需额外的深度传感器,也不需要提前已知相机参数,就能完成万帧级的实时三维重建。这一特性让它的应用场景非常广泛,既可以服务测绘行业的私域建图和底图更新,也能在具身智能、自动驾驶、3D内容生产等领域发挥重要作用。

这些全方位的性能提升,印证了一个反直觉的结论:想要让模型实现更远距离的场景重建,未必需要依赖更多的历史记忆。仅以12帧画面作为输入的ABot-Recon,走出了一条更精准、更快速、更节省资源的技术路线。目前,ABot-Recon已经在GitHub开源了推理、评测代码以及模型权重,同时在魔搭社区上线了体验专区,方便开发者直接上手体验。

附:

项目主页:https://amap-cvlab.github.io/ABot-Recon-html

技术报告:https://github.com/amap-cvlab/ABot-Recon/blob/main/ABot-Recon-Tech-Report.pdf

魔搭:https://modelscope.cn/studios/amap_cvlab/ABot-Recon/

以上内容不代表本平台立场,仅供读者参考