全球首个!Qwen开源自动驾驶统一全流程VLM模型

行业技术团队近期开源了Qwen-Drive-1.0-4B自动驾驶视觉语言模型,这是全球首个同时集成3D感知、驾驶场景问答与运动规划能力的专用VLM模型。该模型在保留通用视觉理解能力的基础上,在nuScenes、NAVSIM等权威自动驾驶评测基准中取得了领先的性能表现。
Qwen-Drive-1.0-4B基于原生多模态模型Qwen3.5-4B构建,在预训练阶段就完成了3D感知与视觉问答的统一,后续进一步扩展了运动规划能力,且全程保持了预训练VLM的原始架构未做修改。模型采用分阶段训练方案,将驾驶领域监督数据与通用视觉语言数据集结合,既获得了专属的驾驶场景能力,也保留了通用视觉理解与指令遵循的核心优势。该模型还提供了SFT和RL两种规划专家版本,官方评测覆盖了3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划全链路场景。
全链路自动驾驶能力覆盖
Qwen-Drive-1.0的BEV感知头可以同时完成三项核心3D感知任务:3D目标检测、语义占用预测和BEV地图分割。官方演示中将多摄像头视角的3D检测框投影回原始图像,同时在鸟瞰视角中展示检测结果,语义占用和地图分割模块还会直接对比预测结果与真实标注的差异。
在驾驶场景问答环节,模型不仅可以识别单帧画面内容,还能结合多摄像头视角与连续时序画面判断车辆状态、空间距离和道路规则。官方展示的四组典型案例覆盖了时序状态估计、规划因果推理、跨视角距离判断和车道识别四类场景:比如在连续画面中判断最终场景无停放车辆,在夜间施工场景中识别前方车辆与停车标志并给出停车决策,跨视角场景下准确给出22米的距离判断(与真实值22.93米接近),以及通过持续出现的左转箭头识别自车所在车道,测试中用红绿标记区分正确与错误识别结果。
官方规划案例同时展示了推理文本、预测轨迹与鸟瞰视角效果:在开环场景中,模型可以主动为横穿道路的动物减速,沿右转专用车道完成转弯,并横向调整轨迹绕过停靠的车辆;闭环测试场景则展示了模型可以根据红绿灯、前车状态和道路结构变化实时更新规划结果。
技术架构与训练流程
Qwen-Drive-1.0以原生多模态的Qwen3.5-4B作为共享视觉语言模型,视觉编码器和语言模型可以处理普通图像、单视角驾驶画面、多视角画面和多帧序列数据,通过原有语言解码器即可回答通用和驾驶相关的视觉问题。该模型没有为驾驶任务修改VLM的主体架构,而是在共享视觉语言路径之外新增了两个专属模块:
- BEV感知头:该模块结合了两类特征信息,视觉编码器提供进入VLM之前的图像外观特征,VLM输出则包含场景上下文的语义特征。前者通过深度估计和视角变换构建3D体素表示,后者通过特征金字塔和BEV Transformer汇聚到鸟瞰平面,最终通过三个任务分支分别完成3D检测、语义占用预测和地图分割。这个模块相当于可检查的3D探针,可以将共享表示中的空间信息转换为可可视化的检测框、占用网格和地图元素。
- Planning Expert:这是一个32层的扩散Transformer,隐藏维度为1024,参数量约1.1B。它利用VLM中8个分组查询Softmax Attention层缓存的Key和Value作为条件输入,从高斯噪声出发,通过Flow Matching和10步Euler求解生成未来轨迹。每条轨迹包含50个航点,覆盖未来5秒的行驶状态,频率为10Hz,每个航点包含自车坐标系下的纵向位置、横向位置和航向角。模型既可以直接生成轨迹规划,也可以先生成文字推理过程,再通过推理和视觉上下文共同约束轨迹生成。
模型采用四阶段训练方案:
- 第一阶段:冻结视觉编码器和VLM的参数,仅初始化BEV感知头模块进行训练;
- 第二阶段:联合训练感知头、视觉编码器和VLM,混合3D感知、驾驶VQA与通用视觉语言数据进行训练;
- 第三阶段:重新冻结共享VLM的参数,仅通过Flow Matching训练Planning Expert,得到Qwen-Drive-1.0-SFT版本;
- 第四阶段:继续冻结共享表示参数,通过任务级奖励优化Planning Expert,得到Qwen-Drive-1.0-RL版本。
在数据处理方面,研发团队将不同感知数据集的标签映射到统一空间,统一了驾驶问答的格式标准,并将多个公开规划数据集转换为相同的航点表示格式。公开驾驶视觉语言数据经过重写和一致性过滤后,从553万条缩减至309万条;第二阶段的实际训练集包含154万条样本,并混入通用视觉语言数据以减轻领域适配带来的灾难性遗忘问题。
权威评测性能表现
3D感知性能
官方测试数据显示,Qwen-Drive-1.0在nuScenes数据集上取得了43.95 mAP和60.99的地图分割mIoU,在OpenScene数据集上的3D检测mAP为43.45,地图分割mIoU达到71.27。
驾驶问答与通用视觉能力
在官方统一复现的驾驶VQA评测中,Qwen-Drive-1.0-SFT版本在LingoQA、Ego3D、VLAD、SURDS、WaymoQA、PAI-AV Chain-of-Causation和内部中文驾驶决策集等多个评测项目上,相比基础模型Qwen3.5-4B都有明显提升。其中LingoQA评测使用Qwen-Plus作为评审标准,按照官方LingoJudge协议,Qwen-Drive-1.0-SFT的LingoScore为79.4。
通用视觉能力方面,模型总体保持稳定:在知识、推理与识别组的10项测试设置中,Qwen-Drive-1.0-SFT的平均得分为66.41,基础模型Qwen3.5-4B为67.40,仅相差0.99分;在空间理解与定位组的5项测试中,两者的平均成绩分别为53.96和52.99。
开环、伪闭环与闭环规划性能
Qwen-Drive-1.0-RL版本在NAVSIM v1.1 navtest测试集上取得了90.7 PDMS,best-of-6策略下得分达到91.4;在WOD-E2E测试集上的RFS得分为7.91。与SFT版本相比,RL版本在NAVSIM和WOD-E2E上的得分更高,但在NVIDIA PhysicalAI的3秒minADE指标上,SFT版本的表现更优。
模型部署与使用方法
模型与代码下载
pip install -U modelscope git clone https://github.com/QwenLM/Qwen-Drive-1.0.git qwen-drive cd qwen-drive modelscope download \ --model Qwen/Qwen-Drive-1.0-4B \ --local_dir ./Qwen-Drive-1.0-4B
模型目录结构如下:
Qwen-Drive-1.0-4B/ 9.1 GB 共享VLM,可单独用于VQA ├── planner-sft/ 2.1 GB 模仿学习后的Planning Expert ├── planner-rl/ 2.1 GB 奖励优化后的Planning Expert └── perception/ 0.5 GB BEV感知头
安装依赖
conda create -n qwen-drive python=3.10 conda activate qwen-drive pip install -e . --no-build-isolation
运行官方规划Demo
官方仓库在data/demo/中提供4个WOD-E2E规划场景及对应图像,包括夜间路口绿灯、左转、右转和经过停靠卡车时减速等场景。
export PYTHONPATH=src python scripts/demo.py \ --model Qwen-Drive-1.0-4B \ --planner Qwen-Drive-1.0-4B/planner-rl \ --scenes data/demo/planning_scenes.jsonl \ --image-archive data/demo/frames.parquet \ --plot demo.png
planner-sft同时支持直接规划和推理式规划;planner-rl仅在带推理条件的rollout上进行奖励优化,使用时应选择REASONING_PLANNING模式。num_samples=6表示从独立初始噪声批量生成6条候选轨迹,并非代表模型执行6轮推理。
驾驶场景问答
python scripts/run_vqa.py \ --model Qwen-Drive-1.0-4B \ --image front.jpg \ --image front_left.jpg \ --question "Is it safe to change into the left lane?"
3D感知
python scripts/run_perception.py \ --vlm Qwen-Drive-1.0-4B \ --model Qwen-Drive-1.0-4B/perception \ --frames data/demo/perception \ --output outputs/perception_demo

