文章摘要
近期技术团队开源了全球首个同时集成3D感知、驾驶场景问答与运动规划全流程能力的自动驾驶专用VLM模型Qwen-Drive-1.0-4B。该模型基于Qwen3.5-4B构建,未修改原VLM主体架构,提供SFT、RL两个规划版本,在多项权威自动驾驶评测中取得领先性能,现已开放相关资源与部署教程。

行业技术团队近期开源了Qwen-Drive-1.0-4B自动驾驶视觉语言模型,这是全球首个同时集成3D感知、驾驶场景问答与运动规划能力的专用VLM模型。该模型在保留通用视觉理解能力的基础上,在nuScenes、NAVSIM等权威自动驾驶评测基准中取得了领先的性能表现。

Qwen-Drive-1.0-4B基于原生多模态模型Qwen3.5-4B构建,在预训练阶段就完成了3D感知与视觉问答的统一,后续进一步扩展了运动规划能力,且全程保持了预训练VLM的原始架构未做修改。模型采用分阶段训练方案,将驾驶领域监督数据与通用视觉语言数据集结合,既获得了专属的驾驶场景能力,也保留了通用视觉理解与指令遵循的核心优势。该模型还提供了SFT和RL两种规划专家版本,官方评测覆盖了3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划全链路场景。

全链路自动驾驶能力覆盖

Qwen-Drive-1.0的BEV感知头可以同时完成三项核心3D感知任务:3D目标检测、语义占用预测和BEV地图分割。官方演示中将多摄像头视角的3D检测框投影回原始图像,同时在鸟瞰视角中展示检测结果,语义占用和地图分割模块还会直接对比预测结果与真实标注的差异。

在驾驶场景问答环节,模型不仅可以识别单帧画面内容,还能结合多摄像头视角与连续时序画面判断车辆状态、空间距离和道路规则。官方展示的四组典型案例覆盖了时序状态估计、规划因果推理、跨视角距离判断和车道识别四类场景:比如在连续画面中判断最终场景无停放车辆,在夜间施工场景中识别前方车辆与停车标志并给出停车决策,跨视角场景下准确给出22米的距离判断(与真实值22.93米接近),以及通过持续出现的左转箭头识别自车所在车道,测试中用红绿标记区分正确与错误识别结果。

官方规划案例同时展示了推理文本、预测轨迹与鸟瞰视角效果:在开环场景中,模型可以主动为横穿道路的动物减速,沿右转专用车道完成转弯,并横向调整轨迹绕过停靠的车辆;闭环测试场景则展示了模型可以根据红绿灯、前车状态和道路结构变化实时更新规划结果。

技术架构与训练流程

Qwen-Drive-1.0以原生多模态的Qwen3.5-4B作为共享视觉语言模型,视觉编码器和语言模型可以处理普通图像、单视角驾驶画面、多视角画面和多帧序列数据,通过原有语言解码器即可回答通用和驾驶相关的视觉问题。该模型没有为驾驶任务修改VLM的主体架构,而是在共享视觉语言路径之外新增了两个专属模块:

  • BEV感知头:该模块结合了两类特征信息,视觉编码器提供进入VLM之前的图像外观特征,VLM输出则包含场景上下文的语义特征。前者通过深度估计和视角变换构建3D体素表示,后者通过特征金字塔和BEV Transformer汇聚到鸟瞰平面,最终通过三个任务分支分别完成3D检测、语义占用预测和地图分割。这个模块相当于可检查的3D探针,可以将共享表示中的空间信息转换为可可视化的检测框、占用网格和地图元素。
  • Planning Expert:这是一个32层的扩散Transformer,隐藏维度为1024,参数量约1.1B。它利用VLM中8个分组查询Softmax Attention层缓存的Key和Value作为条件输入,从高斯噪声出发,通过Flow Matching和10步Euler求解生成未来轨迹。每条轨迹包含50个航点,覆盖未来5秒的行驶状态,频率为10Hz,每个航点包含自车坐标系下的纵向位置、横向位置和航向角。模型既可以直接生成轨迹规划,也可以先生成文字推理过程,再通过推理和视觉上下文共同约束轨迹生成。

模型采用四阶段训练方案:

  1. 第一阶段:冻结视觉编码器和VLM的参数,仅初始化BEV感知头模块进行训练;
  2. 第二阶段:联合训练感知头、视觉编码器和VLM,混合3D感知、驾驶VQA与通用视觉语言数据进行训练;
  3. 第三阶段:重新冻结共享VLM的参数,仅通过Flow Matching训练Planning Expert,得到Qwen-Drive-1.0-SFT版本;
  4. 第四阶段:继续冻结共享表示参数,通过任务级奖励优化Planning Expert,得到Qwen-Drive-1.0-RL版本。

在数据处理方面,研发团队将不同感知数据集的标签映射到统一空间,统一了驾驶问答的格式标准,并将多个公开规划数据集转换为相同的航点表示格式。公开驾驶视觉语言数据经过重写和一致性过滤后,从553万条缩减至309万条;第二阶段的实际训练集包含154万条样本,并混入通用视觉语言数据以减轻领域适配带来的灾难性遗忘问题。

权威评测性能表现

3D感知性能
官方测试数据显示,Qwen-Drive-1.0在nuScenes数据集上取得了43.95 mAP和60.99的地图分割mIoU,在OpenScene数据集上的3D检测mAP为43.45,地图分割mIoU达到71.27。

驾驶问答与通用视觉能力
在官方统一复现的驾驶VQA评测中,Qwen-Drive-1.0-SFT版本在LingoQA、Ego3D、VLAD、SURDS、WaymoQA、PAI-AV Chain-of-Causation和内部中文驾驶决策集等多个评测项目上,相比基础模型Qwen3.5-4B都有明显提升。其中LingoQA评测使用Qwen-Plus作为评审标准,按照官方LingoJudge协议,Qwen-Drive-1.0-SFT的LingoScore为79.4。
通用视觉能力方面,模型总体保持稳定:在知识、推理与识别组的10项测试设置中,Qwen-Drive-1.0-SFT的平均得分为66.41,基础模型Qwen3.5-4B为67.40,仅相差0.99分;在空间理解与定位组的5项测试中,两者的平均成绩分别为53.96和52.99。

开环、伪闭环与闭环规划性能
Qwen-Drive-1.0-RL版本在NAVSIM v1.1 navtest测试集上取得了90.7 PDMS,best-of-6策略下得分达到91.4;在WOD-E2E测试集上的RFS得分为7.91。与SFT版本相比,RL版本在NAVSIM和WOD-E2E上的得分更高,但在NVIDIA PhysicalAI的3秒minADE指标上,SFT版本的表现更优。

模型部署与使用方法

模型与代码下载

pip install -U modelscope
git clone https://github.com/QwenLM/Qwen-Drive-1.0.git qwen-drive
cd qwen-drive
modelscope download \
  --model Qwen/Qwen-Drive-1.0-4B \
  --local_dir ./Qwen-Drive-1.0-4B

模型目录结构如下:

Qwen-Drive-1.0-4B/        9.1 GB  共享VLM,可单独用于VQA
├── planner-sft/          2.1 GB  模仿学习后的Planning Expert
├── planner-rl/           2.1 GB  奖励优化后的Planning Expert
└── perception/           0.5 GB  BEV感知头

安装依赖

conda create -n qwen-drive python=3.10
conda activate qwen-drive
pip install -e . --no-build-isolation

运行官方规划Demo
官方仓库在data/demo/中提供4个WOD-E2E规划场景及对应图像,包括夜间路口绿灯、左转、右转和经过停靠卡车时减速等场景。

export PYTHONPATH=src
python scripts/demo.py \
  --model Qwen-Drive-1.0-4B \
  --planner Qwen-Drive-1.0-4B/planner-rl \
  --scenes data/demo/planning_scenes.jsonl \
  --image-archive data/demo/frames.parquet \
  --plot demo.png

planner-sft同时支持直接规划和推理式规划;planner-rl仅在带推理条件的rollout上进行奖励优化,使用时应选择REASONING_PLANNING模式。num_samples=6表示从独立初始噪声批量生成6条候选轨迹,并非代表模型执行6轮推理。

驾驶场景问答

python scripts/run_vqa.py \
  --model Qwen-Drive-1.0-4B \
  --image front.jpg \
  --image front_left.jpg \
  --question "Is it safe to change into the left lane?"

3D感知

python scripts/run_perception.py \
  --vlm Qwen-Drive-1.0-4B \
  --model Qwen-Drive-1.0-4B/perception \
  --frames data/demo/perception \
  --output outputs/perception_demo
以上内容不代表本平台立场,仅供读者参考