HA-VLN2.0:动态多人群视觉语言导航统一基准

现实痛点与项目起源
视觉语言导航技术旨在让智能体通过理解人类的自然语言指令,在三维虚拟环境中自主完成路径规划与导航任务。现有相关研究存在三个明显短板:一是缺乏社会感知能力,常将动态行人简单视为静态障碍物,无法遵守人际安全距离,也难以应对行人移动、停留等随机行为;二是导航指令粒度较粗,现有数据集多围绕物体描述生成指令,缺乏针对行人行为的细粒度表述,真实场景如“避开正在桌边交谈的路人”难以复现;三是假设环境静态,仿真场景中没有行人穿行、人群聚集等动态变化,难以训练智能体在部分可观测的条件下实时调整规划路径。
此前推出的HA-VLN1.0首次尝试将动态人物引入导航任务,但存在动作与场景对齐错误、仅偏向离散仿真模式、多人交互场景单一、指令颗粒度不足等问题,难以支撑实体机器人的研发测试。
核心创新点
针对上述问题,本次发布的HA-VLN 2.0统一基准框架具备多项核心优势:
- 统一离散与连续两种导航范式,设计兼顾导航精度与人际安全距离的综合评价体系
- 开源数据集与双仿真环境:升级得到HAPS2.0人体运动数据集,搭建HA-VLN-DE离散模式与HA-VLN-CE连续模式两套仿真环境,支持多人交互、户外场景、实时渲染与严谨碰撞检测
- 构建16844条具备社会感知能力的导航指令,实验证明主流导航智能体在动态行人与局部观测场景下性能会显著下降
- 完成四足机器人从仿真到真实环境的迁移测试,上线公开算法排行榜支持公平对比
任务定义与约束
HA-VLN 2.0将离散与连续导航任务统一建模为部分可观测马尔可夫决策过程(POMDP)。在每个时间步,智能体的状态包含三维空间位置、自身朝向与第一人称RGB-D视觉观测。
每个时间步下智能体的状态可表示为:$s_{t}=\left\langle p_{t}, o_{t}, \Theta_{t}^{FOV}\right\rangle$,其中$p_t$为机器人三维空间位置,$o_t$为机器人自身朝向,$\Theta_{t}^{FOV}$为第一人称RGB-D视觉观测。
统一的动作空间包含:$\mathcal{A}=\left\{a_{forward}, a_{left}, a_{right}, a_{up}, a_{down}, a_{stop}\right\}$,分别对应前进、左右转向、上下调整与停止指令。
任务附带三项硬性约束:
- 动态人体模型:加载HAPS2.0的人体运动序列,还原真实行人的多样化行为
- 个人安全空间约束:离散环境设置3米安全距离阈值,连续环境通过模型半径重叠判断碰撞,保证两种模式评价标准统一
- 面向人的导航指令:指令直接描述行人行为,要求智能体将文本描述与动态人物进行语义对齐。
值得注意的是,智能体下一时刻的状态不仅取决于自身动作,还受行人随机运动的影响,智能体仅能获取局部环境信息,需要推测行人意图并实时调整规划路径。任务目标是让智能体接收自然语言导航指令,在充满动态行人的高真实感三维场景中成功抵达目标点位,同时保持合理人际距离,避免碰撞。
核心数据集详情
本次工作发布两大核心数据集:
HAPS 2.0人体运动数据集
作为HAPS1.0的迭代升级版,解决了旧版本动作与场景错位、行为单一的问题。包含486条经过严格校验的SMPL人体运动序列,覆盖26种不同区域,兼顾室内与户外场景;整体标注工作量超430小时,通过多视图校验消除动作与三维场景错位问题;结合大模型与人工审核扩充多人交互场景,最终仿真库包含910个人体模型,支持双人、三人、四人小组互动,以及爬楼梯等复杂动作。
HA-R2R导航指令数据集
基于R2R-CE数据集扩充改造而来,共包含16844条具备社会感知的导航指令。数据集划分如下:训练集10819条、见过场景验证集778条、未见过场景验证集1839条、测试集3408条。与原始R2R-CE相比,单条指令平均词数从27提升至112,词汇量从2616扩充到5032,绝大多数指令中有20%-60%的内容用于描述行人行为与避让要求,例如“向前穿过走廊,注意避开正在桌边交谈的人群,不要打扰他们,走到衣柜门口停下”。
技术实现细节
HA-VLN双模式仿真器
仿真器分为离散模式HA-VLN-DE与连续模式HA-VLN-CE,对外提供统一API接口,具备三大核心功能:获取周边行人状态信息、动态更新场景信息、碰撞检测预判。
人体标注分为三个阶段:
- 粗粒度标注与PSO粒子群优化:划定场景区域边界,匹配场景物体与人体动作,通过PSO算法求解人体最优摆放位置,设置1米最小安全距离避免人物穿墙或与物体穿插。
- 细粒度多相机校验:在人物模型周围摆放9个虚拟相机,多角度观察画面以修正模型穿插与位置偏移,保证人体与三维几何环境完美匹配。
- 多人交互增强:借助大语言模型生成符合常识的多人交互脚本,经过四轮人工审核,丰富聚会、行走、聊天等多样化群体行为。
实时渲染采用生产者-消费者双线程架构:线程1定时发出画面刷新信号,线程2与机器人动作周期同步更新人体网格模型,将渲染延迟控制在50ms以内。一旦检测到碰撞,机器人会回退至上一个合法有效位置。
基线模型
本次研究提供两套基线模型供后续研究对比:
- HA-VLN-VL:基于Recurrent VLNBERT改造,使用Transformer搭配专用state token保存机器人历史状态,采用模仿学习训练,重点优化视觉语言多模态对齐能力,输入融合后的RGB-D特征与文本指令,输出动作概率分布。
- HA-VLN-CMA:采用双流编码器分别解析RGB与深度图像,通过BERT提取语言指令特征,使用多头跨模态注意力融合视觉与语言信息,结合GRU循环网络处理时序信息后通过MLP输出动作。引入EnvDrop模拟现实视觉遮挡,通过DAgger算法迭代修正轨迹误差,提升局部观测环境下的重规划能力。
实验验证与结果
评价指标
实验指标分为导航精度与社会合规两大类:
- NE导航误差:机器人终点与目标真实位置的平均距离,数值越小效果越好,计算公式为:$NE=\frac{\sum_{i=1}^{L} d_{i}}{L}$
- SR成功率:同时满足无碰撞且足够靠近目标的样本占比,占比越高效果越好
- TCR总碰撞率:统计在行人活动区域发生碰撞的时间步占比,占比越小效果越好
- CR碰撞发生率:整条轨迹至少发生一次碰撞的样本占比,占比越小效果越好
主要实验结果
- CE连续模式测试:BEVBert、ETPNav、NaVid、Navila等现有主流SOTA算法在充满动态行人的环境中性能明显下滑。使用HA-VLN数据集重新训练后的模型,相比零样本直接运行的模型,SR成功率显著提升,TCR碰撞率大幅下降,且在传统R2R-CE数据集上仍保持不错的泛化性能。
- DE离散模式测试:传统VLN智能体虽然导航目标可达率尚可,但CR碰撞发生率普遍较高,说明即使是离散视角跳转范式,避让动态行人仍是巨大挑战。
消融实验关键结论
- 行人动态带来的影响:将动态行人替换为静态圆柱体障碍物后,TCR碰撞率下降约36%,SR成功率提升约10%;去掉多人交互增强环节后,TCR下降22%,SR上升。由此可见,行人不能简单等价为普通障碍物,群体交互会显著增加导航任务难度。
- 步长大小的影响:当碰撞仅在动作终点检测时,增大步长接近离散跳转模式会让指标变好;但如果将大步长拆解为多个小步并在每一步都进行碰撞检测,模型性能会大幅下降,揭示了离散仿真存在类似“瞬移”的固有漏洞。
- 传感器输入消融:RGB+Depth同时输入的组合效果最优,去掉深度信息后碰撞变多、成功率下降,证明深度三维信息对避让动态行人至关重要。
真实机器人Sim-to-Real迁移验证
实验采用Unitree Go2-EDU四足机器人,搭载Realsense D435i RGB-D相机、MID360激光雷达与IMU惯性测量单元。测试场景包括办公室、客厅、走廊、大厅,场景内安排2-4名志愿者自由走动模拟真实人流。
实验现象包括:空旷环境下机器人导航表现稳定;狭窄走廊、行人突然改变行进方向时仍容易发生碰撞;在HA-VLN数据集训练的模型相比传统VLN-CE训练的模型,真机环境下导航成功率从0.12提升至0.18。实验证实仿真中学到的社会感知策略可以迁移到实体机器人,但现实中行人行为不可预测,仍存在不少待解决的难点。
总结与展望
HA-VLN2.0打造了一套完整的面向动态多人群的人类感知视觉语言导航开源基准,具体包括:
- 打通离散与连续两套仿真范式,解决过去两套体系割裂的问题
- 开源HAPS2.0与HA-R2R数据集,提供大规模人体运动数据与社会感知导航指令资源
- 大量实验证实动态人群与局部观测条件会显著削弱现有VLN算法性能,显式引入社会约束建模能够降低碰撞、提升导航鲁棒性
- 完成四足机器人真机迁移验证,仿真器、基线模型、数据集与排行榜全部对外开源。
目前算法在狭窄空间、行人突发变向的场景中表现仍不理想,后续研究者可以借助这套基准深入研究行人轨迹预测、社会感知规划、世界模型等方向,进一步推动服务机器人在拥挤室内场景的落地应用。

