DriveTeach-VLA:BEV轨迹映射图像平面,自动驾驶性能达90.4 PDMS

这项最新的自动驾驶视觉-语言-动作(VLA)模型研究已被国际顶级计算机视觉会议ECCV 2026正式收录,相关代码与预训练模型已完全开源共享。
联合研发团队由国内顶尖科研机构与科技企业组成,长期深耕自动驾驶与具身智能领域,累计在ICLR、NeurIPS、CVPR等顶级学术会议发表数十篇高质量论文,与全球多所高校及科研机构保持广泛合作。
本次研究聚焦于自动驾驶场景下的自回归VLA模型训练,针对现有技术的核心痛点提出了两套创新方案,最终在主流评测集上取得了当前最优的性能表现。
研究背景与核心痛点
在实际自动驾驶场景中,多模态大模型基座往往已经具备了基础的场景语义理解能力,比如能够根据输入描述生成“减速礼让行人后左转”的应对策略,但这类能力仅停留在语言层面,无法保证模型在生成驾驶轨迹时真正关注到关键的交通要素。
例如当自车准备左转、右侧有行人靠近斑马线且前方大型车辆遮挡部分视野时,模型需要精准盯住行人、可行驶车道等关键目标,才能生成安全合理的驾驶轨迹。但现有VLA模型的训练多依赖以文本为中心的视觉问答和思维链推理数据,仅学习如何输出语言描述与对应轨迹,并未真正建立语言推理与空间规划之间的关联,容易出现注意力分散、无法准确匹配规划空间的问题。
核心技术方案:两大训练模块
研究团队没有通过堆叠更长的思维链文本提升模型性能,而是将VLA训练拆解为三个核心步骤:先引导模型识别需要关注的交通要素,再明确未来轨迹对应的视觉位置,最后校准实际驾驶动作,具体通过两大创新模块实现。
1. 交通感知的视觉特征蒸馏(DVD)
现有多模态基座模型在预训练中学习了海量的视觉知识,但在自动驾驶场景中,路边广告牌等无关元素与横穿行人、交通灯等关键要素对轨迹生成的重要性完全不同。为此团队设计了驾驶知识驱动的视觉蒸馏方法(Driving-aware Vision Distillation,DVD)。
训练过程中,首先通过GroundingDINO目标检测模型标注出车辆、行人、路障和交通灯等关键交通对象,利用自蒸馏思想将基座模型的视觉编码器拆分为教师和学生两个分支:教师分支接收带有标注框的图像,注意力会自然偏向被标记的关键交通要素;学生分支仅接收原始图像,学习教师分支经过注意力矫正后的特征。为了最大化保留特征变化,蒸馏过程采用类似Swin Transformer的块级感知蒸馏,先将特征图分块再进行平均池化。
团队还通过随机丢弃标注框和框扰动的方式验证了方法的稳定性,实验显示DVD能够带来约1.4个PDMS指标的提升,即使加入20%的噪声,依然能够保持稳定的性能增益。
2. 图像空间的轨迹提示对齐(2D-TGP)
现有VLA模型的另一大痛点是自动驾驶规划通常在鸟瞰(BEV)坐标系中输出轨迹,而多模态基座模型难以直接理解BEV轨迹的空间含义。团队提出2D轨迹引导提示(2D Trajectory-Guided Prompt,2D-TGP),通过相机内外参将专家驾驶轨迹从BEV坐标系投影到图像平面,生成对应的像素坐标序列,再将这些坐标转化为文本提示输入模型。
这一设计让模型不再仅接收“左转”这类抽象语义指令,同时获得了具体的视觉参照,明确未来轨迹需要经过图像中的哪些位置,直接建立了规划空间与多模态基座模型识图能力的关联。
在系统实现上,团队使用两个轻量化的多模态模型进行分工:第一个模型负责根据当前图像、车辆状态和驾驶指令预测图像平面上的2D-TGP;第二个模型结合图像、车辆状态、驾驶指令与预测的2D-TGP,生成最终的BEV轨迹。训练过程采用启发自大模型“下一个token”预测的teacher-forcing范式,使用专家轨迹投影得到的真值提示训练规划模型,而推理阶段则使用第一个模型生成的提示,团队验证了这一方案的训练测试差距可控,即使图像轨迹存在小幅误差,整体性能也不会出现明显下降。
实验验证与性能表现
团队基于Qwen2.5-VL-3B基座模型开展了细致的消融实验,基线模型的PDMS指标为84.8;加入视觉问答与思维链监督后提升至86.4,证明语言监督确实能够有效提升模型性能;继续加入DVD模块后指标达到87.3,加入2D-TGP模块后进一步提升至88.2;经过GRPO行为对齐后,完整系统单次推理的PDMS达到90.4,EPDMS达到85.4。
值得注意的是,本次研究的性能提升并非来自模型规模的扩大,所用的规划模型依然为3B级别的轻量化模型,优化核心在于训练方式和中间表示的设计。团队在NAVSIM和nuScene两大主流评测集上开展了测试,均超过了当前前沿的VLA模型:在NAVSIM上PDMS达到90.4,在nuScene上的L2误差仅为0.3。
此外,由于模型继承了大语言模型的采样特性,允许每个场景生成12条候选轨迹并通过Drivor轨迹选择器筛选后,PDMS指标进一步提升至92.7,EPDMS达到89.0,展现了该方案的性能上限潜力,后续可通过模型蒸馏等方式进一步落地应用。
研究价值与总结
这项研究的核心价值不仅在于提升了自动驾驶VLA模型的实际性能,更在于找到了连接BEV轨迹空间与多模态基座模型识图能力的有效桥梁,能够有效降低大规模VLA训练的数据依赖,让模型直接理解轨迹的内在空间含义。结合团队此前的CuriousVLA研究,这套技术路线为自动驾驶VLA模型的规模化发展提供了清晰的蓝图:通过多模态基座承担场景理解与推理,通过显式空间提示将BEV轨迹对接至图像空间,最终通过自回归推理实现大规模自动驾驶数据的高效训练。
本次研究的完整论文题目为《Teaching Vision-Language-Action Models What to See and Where to Look》,相关开源资源已在公开社区发布,可供行业研究者参考复用。

