模型 / 官方
面向自动驾驶的视觉语言基础模型首次亮相
通义团队与华中科技大学联合推出Qwen-Drive-1.0,这是一款面向自动驾驶场景的视觉语言基础模型。该模型以Qwen3.5-4B为共享视觉语言主干,外挂BEV感知头和规划专家两个模块,将3D目标检测、语义占用预测、BEV地图分割与轨迹规划整合于统一框架之内,同时保留原有的通用视觉问答能力。在规划基准NAVSIM v1.1上,经强化学习优化后的版本PDMS得分达到90.7,Waymo端到端测试RFS为7.91。在驾驶场景问答方面,Qwen-Drive-1.0-SFT在LingoQA、SURDS、WaymoQA等多项指标上均显著优于InternVL3.5-8B、Cosmos系列及MiMo-Embodied-7B等同类模型。模型权重已上传至Hugging Face与ModelScope,完整推理仅需一块24GB显存的GPU即可运行。
Qwen-Drive-1.0由阿里巴巴通义团队与华中科技大学联合研发,定位为自动驾驶领域的视觉语言基础模型的初步探索。其核心架构沿用预训练的Qwen3.5-4B视觉语言模型,并在此基础上附加两个外部模块:BEV感知头负责3D目标检测、语义占用预测和鸟瞰图地图分割;规划专家则基于共享的视觉语言表征生成未来自车轨迹。原始语言解码器保持不变,可同时处理通用视觉问答和驾驶专项问答任务。
为兼顾驾驶专项能力与通用视觉理解,研究团队设计了分阶段训练策略,将感知、语言和规划目标融合训练。配套的统一数据管线承担三项关键工作:将异构感知标注映射至共享标签空间;对驾驶问答回复进行重新标注以确保格式与事实一致性;以及将多个公开驾驶数据集的轨迹标准化为统一的路点表示。这一设计使模型在获得驾驶专项监督的同时,不损失广泛的视觉指令跟随能力。
在规划性能方面,SFT版本在NAVSIM v1.1导航测试中PDMS得分为88.2,经强化学习优化后提升至90.7,best-of-6采样下可达91.4。Waymo端到端测试中,RL版本RFS为7.91,优于SFT版本的7.78。在NVIDIA PhysicalAI开环评测中,SFT版本3秒最小平均位移误差为0.34米,展现出较强的轨迹预测精度。
驾驶场景理解方面,Qwen-Drive-1.0-SFT在LingoQA得分77.8,Ego3D RMSE降至7.78,SURDS达66.5,WaymoQA安全类得分70.7,全类得分74.5,PAI-AV因果推理链CoC得分41.3,内部中文城市驾驶决策集IH得分71.0,全面领先InternVL3.5-8B-Instruct、Cosmos-Reason2-32B等参数量更大的竞品模型,体现出专项训练策略的有效性。
在通用视觉能力保留方面,Qwen-Drive-1.0-SFT在MMBench、MMStar、MMMU等标准基准上的表现与基础模型Qwen3.5-4B基本持平,空间理解指标EmbSpatial和ERQA也维持在较高水平。模型以单一目录形式分发,总体积约13.7GB,包含VLM主体、SFT规划专家、RL规划专家和BEV感知头四个组件,支持按需加载,安装和推理流程简洁,配套提供了涵盖夜间路口、左转、右转等场景的演示数据。
要点
- Qwen-Drive-1.0以4B参数量的Qwen3.5为主干,通过外挂BEV感知头和规划专家,将3D感知、问答与轨迹规划统一于单一框架,无需修改原始语言解码器。
- 经强化学习优化的规划专家在NAVSIM v1.1上PDMS达90.7,在Waymo端到端测试中RFS为7.91,规划性能具备竞争力。
- 驾驶专项问答指标全面超越InternVL3.5-8B、Cosmos系列等同类模型,同时通用视觉问答能力未出现明显退化。
- 统一数据管线解决了多源异构标注对齐问题,分阶段训练策略是兼顾专项与通用能力的关键设计。
- 模型权重已开源至Hugging Face和ModelScope,单卡24GB显存即可完整运行,具备较低的落地门槛。
原始标题:QwenLM/Qwen-Drive-1.0 — An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。