文章摘要
当前大模型可识别城市街景地标,但长距离导航能力不足。多机构联合研究团队推出基于香港真实三维地理数据搭建的可交互城市仿真测试平台UrbanGround,测试10个多模态大模型发现:其短程导航最高成功率75%,长距离导航成功率仅0%-3.8%,方向判断、持续记忆、动态路况调整均存在明显缺陷。

大模型识别城市街景中的地标已经算不上难事,但如果真要让它在真实城市里完成完整的导航任务,却常常出现「走两步就忘路」的尴尬:眼前的短路线尚能走对,一旦拉长距离,之前做出的判断就接不上了。

短途导航的最高成功率能达到75.0%,但长距离路线的成功率却直接跌至0%到3.8%,仿佛模型刚记住的路线,转过几个路口就彻底遗忘。为了破解这个难题,由上海交通大学、新加坡国立大学、美团、香港中文大学、上海大学和牛津大学的研究团队共同推出了UrbanGround——一个基于香港真实三维地理数据搭建的城市沙盒测试平台。

UrbanGround并非简单的街景图库,而是一套完整的可交互城市仿真系统,由地理层、仿真层和智能体层三个核心部分组成。地理层以香港地政总署公开的三维可视化地图和步行网络为基础,将地理坐标、三维网格和步行路径统一到同一套沙盒坐标体系中;仿真层则把静态地图转化为可亲身行走的虚拟城市,建筑墙体、坡道地形都会影响移动轨迹,还支持切换昼夜、天气,模拟道路临时封闭和行人动态移动的真实场景,研究者可以反复运行同一条路线,仅调整环境变量来观察模型表现;智能体层则定义了模型的交互规则,它只能获取当前第一人称画面和任务说明,需要时可以打开全局地图,但地图仅标注当前位置和目标点,不会直接提供规划好的路线,完全依靠模型自主判断前进方向。

UrbanGround设置了十余类导航任务,但核心只有一个:模型刚刚做出的路线判断,在转弯、走远或是遇到路况变化后,还能不能继续生效?研究团队从空间定位、持续记忆和动态调整三个维度展开测试,最终整理出810个经过人工校验的任务实例,覆盖香港多个城区,并用统一的动作接口测试了10个多模态大模型。测试任务按照难度梯度设计:从识别眼前地标开始,逐步拉长路线长度,最后加入动态路况变化的挑战。

空间定位:认得出地标,却分不清方向

第一组测试针对最短距离的行动任务,分别验证了模型的视觉识别能力、方向判断能力和主动探索能力。视觉识别测试模型能否认出周围的目标,方向理解要求模型判断地标相对自身的方位,主动探索则允许模型移动几步,补充初始视角中未覆盖的线索。

识别周边目标并不困难,10个模型的视觉识别准确率在75.0%到93.8%之间,主动探索的准确率也达到了46.3%到82.5%,只要目标在附近,模型往往能一边观察一边移动,完成短距离任务。但方向判断的难度要高得多,10个模型的方向理解准确率仅在23.3%到58.3%之间。比如Gemini-3.1-Pro的视觉识别准确率达到82.5%,但方向理解准确率只有23.3%,甚至低于随机猜测的水平——它能认出地标,却很难在视角转动后判断地标到底在左侧还是右侧,还没走出多远,方向就已经出现偏差。

即使答对了视觉识别的问题,也不代表能走对路线。部分模型虽然找到了正确的目标线索,但移动轨迹却偏离了行人专用网络。比如GPT-5.5在回答「北京同仁堂旁边是哪家银行」的问题时,正确找到了药房旁的东亚银行,但在探索过程中却直接横穿马路,离开了允许步行的区域,答案虽然正确,但行动方式却不符合现实规则。

持续记忆:走两步,就忘了路

第二组测试拉长了路线长度,还加入了语言指令、路径限制、地点搜索和多地点规划等任务,核心难点在于:当地标离开视野范围后,模型能否重新将之前看到的线索、当前街景和全局地图对应起来,不会每过一个路口就重新开始寻找方向。

短途任务的表现尚可,GPT-5.5和Claude-Opus-4.6的短程导航成功率都达到了75.0%,但一旦切换到长距离路线,10个模型的成功率都跌到了0%到3.8%之间。GPT-5.5的成功率从75.0%直接降到0%,Claude-Opus-4.6也从75.0%跌至1.3%。这说明眼前几步能走对,并不代表能完整走完整条路线。

问题的关键并非只是路线更长、步骤更多,而是每次转弯、过街或是打开地图时,模型都需要重新判断自身位置和目标方向。它可能连续几步都走对,但一旦在某个路口出现偏差,又没有及时纠正,小误差会不断累积,最终彻底偏离正确路线。

按照起点到目标的距离分组测试可以发现,整体趋势非常明显:路线越长,短程导航和指令导航的成功率越低。虽然个别模型的表现会有起伏,不能说每多走一步性能就一定会下降,但总体来说,路线越长,模型走偏后无法纠正的情况就越多。

如果只看任务结束时是否到达终点,很容易误以为模型从一开始就走错了,但轨迹数据显示并非如此。长程任务结束时,各模型仍有52.5%到81.3%的轨迹比起点更接近目标,说明它们往往找对了大方向,也走完了其中一段路程,但最终还是卡在了半路。比如GPT-5.5的一段轨迹很有代表性:当绿篱挡住直行路线后,它找到了正式坡道,走上结构复杂的天桥继续朝目标前进,至少这一段它看懂了道路结构并选对了方向。但另一段轨迹则在关键节点出现问题:模型能识别道路、调整方向,却在走偏后没有重新规划路线,错误一直延续到任务结束。在GPT-5.5的长程任务中,57.5%的轨迹最终比起点更接近目标,34.6%的轨迹将距离缩短了至少20%,但整体任务的到达率仍为0%,部分轨迹虽然走近了目标,另一部分却绕得更远,整体几乎没有净进展。

动态调整:城市已经变了,模型还在走旧路

长距离路线考验的是模型能否始终保持之前的判断准确性,而动态环境则增加了另一层挑战:当路况发生变化时,模型能否及时调整路线?最后一组测试在模型行进过程中加入了道路临时封闭和移动行人的变量,观察模型是否会改道避让。

研究人员首先在同一地点、同一任务中切换时间和天气,发现局部问答的结果会有波动,但短程导航的成功率并没有普遍变差。以GPT-5.5为例,晴天、夜晚和阴天的短程导航成功率分别为75.0%、75.0%和76.3%,这说明长程导航的失败不能简单归咎于天黑或是恶劣天气。

随后,研究人员在模型行进到一半时封闭道路并加入移动行人。测试结果显示,各模型的路网遵循率在93.0%到96.4%之间,也就是大部分时间都走在合法的步行网络上,但封路遵守率仅为10.0%到46.7%,最终到达率也只有0%到3.3%。在移动行人的测试中,路网遵循率仍保持在90.6%到98.5%,但行人碰撞率却高达76.3%到90.0%。这说明这些模型虽然大部分时间都能遵守步行规则,但很难在遇到道路封闭时及时改道,也常常无法避开移动的行人,仅仅察觉到环境变化还不够,必须及时调整行动策略。

会认地标,也会走几步,为什么路一长就乱了

综合所有测试结果来看,最值得关注的不是模型有多少项任务没做好,而是模型刚刚做出的判断,能否在后续的行动中持续生效。短程导航的最高成功率为75.0%,但路线一旦拉长就跌到0%到3.8%,遇到道路封闭和行人时问题更加突出:模型大部分时间都走在步行网络上,但封路遵守率仅为10.0%到46.7%,碰撞率高达76.3%到90.0%。这说明模型在当下知道该怎么做,但无法将这个判断延续到后续的行动中。

这也是「走两步就忘路」的核心所在:模型并非完全不会认路,而是前一刻做出的判断,常常无法延续到后续的动作中。路线越长、途中的变化越多,这种前后衔接不上的问题就越明显。想要看清问题的根源,仅靠单张图片或是预设节点的测试是不够的,必须让模型在连续的虚拟城市中自主行走,研究者才能观察到它从哪一步开始偏离路线,又为什么无法重新找回正确方向。

为什么要在真实城市里做一场可重复的实验

在真实城市中开展机器人导航实验不仅成本高昂,也很难让每个模型都遇到完全相同的测试场景。UrbanGround将这类测试搬进了可重复运行的虚拟城市沙盒,同一条路线可以反复运行,也可以仅调整天气、道路封闭状态或是人流密度,让研究者能在机器人真正进入真实城市或园区前,提前找出它最容易出错的路段。

沙盒中的街景、三维几何和每一步移动都严格对应,模型每移动一步,下一帧的画面都会按照统一的城市几何规则更新,研究者可以将每一步的画面和动作一一对应,清晰观察模型从哪一步开始出现偏差,又是如何越走越远的。

以上内容不代表本平台立场,仅供读者参考