AerialDojo-200K无人机基准发布 大模型搜索短板凸显

开放世界无人机目标搜索:从实际需求到标准化评测
灾害搜救、大型基建巡检、自主物资配送等场景中,无人机自主完成目标搜索的能力有着极高的实用价值。这类任务无需预先设定飞行路线,仅需给出目标描述或参考图像,让无人机自主探索复杂三维环境并完成目标定位与停靠。但当前该领域的研究仍处于早期阶段,缺乏统一的大规模评测平台来检验算法性能。
此前的同类基准存在诸多痛点:可用数据集规模极小,仅有少量两套基准可用;不同数据集的动作空间、数据格式差异巨大,难以开展跨平台对比研究;仿真场景类型单一,无法充分训练和测试无人机智能体的泛化能力。针对这些问题,相关团队推出了AerialDojo-200K,这一面向开放世界无人机目标搜索的大规模基准套件,为该领域的研究提供了统一的测试与训练框架。
基准的核心设计与技术细节
整体规模与核心贡献
AerialDojo-200K拥有远超现有同类基准的规模:总计包含42个仿真场景,205732条搜索任务实例,任务数量是现有最大同类基准的18.7倍。同时该基准完成了高质量人工标注工作:12名标注人员耗时两个月,手工标注了109个地标、2099个目标物体以及2099个物体锚点,每条任务还附带无碰撞参考飞行轨迹与多视角录像,所有参考轨迹的总里程高达4115公里。
该基准搭建了完整的闭环评测体系,将场景划分为分布内与分布外两类,设计多套量化评估指标,对5个开源与4个闭源多模态大模型开展系统性测试。实验结果显示,当前的通用多模态大模型距离落地可用的无人机自主搜索智能体仍存在显著差距。
仿真环境与场景配置
整个数据集基于虚幻引擎与微软Project AirSim搭建高保真仿真环境,覆盖四大类场景家族:城市、自然环境、基础设施与灾害场景,总计21种场景类型。每个场景还提供训练与测试两套副本,分别用于分布内训练与分布外泛化测试。
传感器配置方面,无人机搭载前、左、右、下四台相机,同步输出分辨率为640×640的RGB-D图像,视场角为90°,帧率为15FPS。同时该基准对智能体的感知能力提出真实约束:智能体无法获取GPS信号、全局地图或外部定位信息,只能依靠自身第一视角视觉数据完成感知与决策,更贴近真实无人机的使用场景。
动作空间包含8类共16个离散选择:三个方向的平移(可选1/3/5米三档位移)、上升/下降(1或2米)、左转/右转(偏航15°),以及最重要的停止动作。针对大型物体中心点无法到达的问题,基准采用人工标注锚点的方案:将任务成功的参考位置设置在物体边界外1米的无碰撞观测点,镜头朝向物体中心,避免了物理无法到达的判定问题。
任务体系与难度分级
每条搜索任务由初始位姿与目标信息两部分组成:初始位姿包含三维坐标与机头偏航角,目标信息则包括目标物体名称、附近地标、相对地标的8方位方向,以及目标的表达形式。
任务分为两大类型:语义目标搜索,即依靠文字描述寻找物体;以及图像目标搜索,即通过参考图片完成以图搜物。任务按照参考轨迹的飞行距离划分为Base、Standard、Long-Horizon三档难度,同时通过两个条件筛选掉过于简单的直线直达任务:起点与目标的直线距离大于3米,且参考轨迹的迂回比不小于1.05,确保任务具备足够的探索难度。
所有参考轨迹通过Hybrid A*算法生成,确保每条轨迹都是无碰撞的最优路径。
评测协议与评估指标
基准将42个场景对半拆分,21个作为分布内场景,21个作为分布外场景:其中分布内场景使用80%用于训练,剩余20%用于分布内测试;分布外场景则使用20%作为小样本适配集,剩余80%用于测试模型在陌生环境中的迁移能力。
闭环评测流程为:多模态大模型接收RGB-D观测画面、任务目标与历史交互记录,输出动作指令;动作指令被送入仿真器,生成下一帧观测数据,循环执行直至任务结束或达到动作预算。目标坐标与参考轨迹仅对评测程序可见,模型无法直接访问,确保了评测的公平性。
本次评测采用五大核心指标:
- SR成功率:核心主指标,指在动作预算内全程无碰撞,执行停止动作时距离目标锚点小于3米的任务占比
- OSR先知成功率:无论模型是否正确执行停止动作,只要无人机曾进入成功区域即计为有效,用于评估模型到达目标附近的能力
- DTS到目标距离:任务结束时刻,无人机到目标锚点的平均欧氏距离
- SPL加权路径长度:用于衡量导航效率,为各任务成功时的参考轨迹长度与实际飞行轨迹长度的比值加权平均
- CR碰撞率:发生碰撞的任务占比,数值越低代表避障效果越好
研究同时采用3米与5米两套成功阈值,验证评估标准对模型排名的影响。
实测结果与分析
本次测试共覆盖9个主流多模态大模型,包括Qwen3-VL-4B、InternVL3.5-8B、Ministral 3 8B、Phi-4-multimodal、MiniCPM-V 4.6五个开源模型,以及GPT-5.6 Sol、Grok-4.5、Gemini 3.8 Flash、Claude Opus 5四个闭源模型。所有模型均通过统一Prompt约束,仅输出JSON格式动作指令,且只能读取第一视角RGB-D画面作为决策依据。
整体性能表现堪忧
测试结果显示,现有模型的整体成功率极低:在Base难度的简单任务中,表现最优的Claude Opus 5的SR成功率仅为3.20%,开源模型中表现最好的Qwen3-VL-4B仅有0.71%;在Standard难度的中等任务中,最优模型的SR成功率仅为0.49%,长时序的复杂任务几乎无法完成。
一个有意思的现象是,不少任务中无人机其实已经飞到了目标附近,OSR指标的数值远高于SR,但模型无法判断何时应该执行停止动作,无法完成完整的闭环搜索任务。
阈值与场景对结果的影响
将成功阈值放宽到5米后,所有模型的成功率都出现了大幅上涨,甚至出现了模型排名反转的情况。这说明在该领域的研究中,必须明确标注所采用的成功距离阈值,否则研究结果不具备可比性。
不同模型在不同场景下的表现差异巨大:GPT-5.6 Sol在自然与基础设施场景中表现最好,而Claude Opus 5在灾害场景中的性能领先。不同场景下的碰撞率与最终目标距离差异显著,仅看全局平均指标会掩盖模型的具体优缺点,需要分场景族进行评估。
避障能力仍是核心短板
测试中发现部分模型的碰撞率超过50%,无人机在飞行过程中经常与环境障碍物发生碰撞,避障能力仍是当前多模态大模型应用于无人机自主搜索的核心短板之一。
研究总结与价值
AerialDojo-200K是当前规模最大的开放世界无人机目标搜索基准套件,覆盖了四大类现实场景,支持语义与图像两种目标搜索模式,配套了高质量的人工标注数据与完整的闭环评测框架。通过大规模实测,研究证实直接将现有多模态大模型应用于无人机自主搜索任务,在环境探索、目标定位、停止判断与避障等多个环节都存在明显短板,距离落地可用的通用空中智能体仍有巨大差距。
该基准为后续研究者提供了统一的训练与测试平台,能够有效推动兼顾环境探索、实例目标识别、避障与精准停止的无人机具身智能算法的发展。

