产业 / 媒体
能解释为何刹车,但解释未必与实际操作吻合
阿里巴巴研究部门发布了Qwen-Drive 1.0,这是一个将环境空间感知、交通场景问答和行驶路径规划整合于单一架构的自动驾驶AI模型。该模型基于Qwen3.5-4B构建,并新增了鸟瞰图生成模块与路径规划专家模块两个组件。研究团队指出,现有驾驶模型普遍存在两大缺陷:一是依赖交通问答数据微调的模型无法可靠感知三维空间中的距离与位置;二是过度专项训练会导致模型遗忘原有通用知识,在罕见突发路况中表现失常。Qwen-Drive 1.0通过同时训练视觉语言模型本身与附加模块来解决上述问题。在仿真测试中,经强化学习优化后的版本将车辆偏离道路的概率从24%降至12%。然而,模型的自然语言解释并不总能准确对应其实际驾驶决策,这一局限性在复杂场景中尤为明显。
阿里巴巴研究部门推出的Qwen-Drive 1.0,旨在用单一AI模型同时承担自动驾驶的三项核心任务:对周围环境进行三维空间感知、回答与交通场景相关的问题,以及规划未来数秒内的行驶路径。该模型基于今年2月发布的Qwen3.5-4B打造,并在其基础上新增了两个专用模块,分别负责构建环境鸟瞰图和生成行驶轨迹规划。
研究团队在论文中明确指出,现有驾驶AI存在两个系统性弱点。其一,主要依靠交通问答数据微调的模型,即便能够流畅描述图像内容,也无法可靠判断物体距离、位置和可通行空间。其二,过度专项化训练会引发研究者所称的灾难性遗忘,导致模型丧失原有的广泛通用知识——而这类知识恰恰在罕见突发路况中最为关键。谷歌DeepMind于2023年构建PaLM-E时也曾遭遇类似问题,较小参数量的版本在机器人训练后损失了大量语言能力。
为解决上述问题,Qwen-Drive 1.0采用了分阶段训练策略:先训练感知模块,再结合感知与问答能力,随后加入路径规划,最后通过强化学习对模型行为进行精细调整。视觉语言组件的训练融合了24个公开交通场景数据集,并借助AI模型对不同格式的问答数据进行标准化处理。团队还自行构建了解释驾驶决策原因的示例数据,例如标注是哪个具体物体触发了刹车动作。
在现代汽车中,座舱娱乐系统与驾驶控制系统正逐步融合至同一计算单元。研究团队认为,若模型为追求纯粹驾驶性能而牺牲通用能力,座舱侧仍需单独配备模型来处理对话和开放性问题,反而增加计算负担。Qwen-Drive 1.0在阿里巴巴自有基准测试中,在多数驾驶与感知类别上超越了专项模型,且在驾驶领域之外的通用测试中几乎未出现能力下滑。
尽管如此,该模型仍存在明显局限。在仿真测试中,模型对每个场景都会给出语言解释,例如因路面有动物或前方红灯而刹车,但这些解释并不总能准确指向实际触发决策的原因。红灯与儿童突然冲入道路需要截然不同的反应时间,而模型有时会将两者混淆。此外,规划的行驶轨迹与事先给出的推理说明之间也存在不一致,部分评测结果依赖研究团队自行设计的测试流程,距离真实复杂路况仍有差距。
在安全性方面,将语言模型与驾驶功能结合也带来了新的攻击面。加州大学圣克鲁兹分校的研究人员曾通过在摄像头视野中放置特制标识,成功诱导DriveLM驾驶系统朝正在过马路的行人方向转向,尽管系统此前已正确识别了这些行人。Qwen团队表示将向研究社区开放该模型,而学界目前也在向世界行动模型方向转移,这类模型还能预测智能体自身行为对环境产生的影响。
要点
- Qwen-Drive 1.0将空间感知、交通问答与路径规划整合于单一模型,并通过新增两个专用模块解决三维空间理解不足的问题,避免了过度专项训练导致的灾难性遗忘。
- 研究证实,具备图像描述能力的视觉语言模型并不自动具备三维空间理解能力,空间感知必须通过专项训练主动构建。
- 经强化学习优化后,模型在仿真中将车辆偏离道路概率从24%降至12%,但模型的语言解释与实际驾驶决策之间仍存在不一致,复杂场景下尤为突出。
- 将语言模型与驾驶系统结合引入了新的对抗攻击风险,已有研究表明特制视觉输入可诱导驾驶AI做出危险决策。
- 该模型面向研究社区开放,但当前评测部分依赖自定义测试流程,且对不同摄像头配置的泛化能力仍有待提升。
原始标题:Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。