产业 / 媒体
用自然语言指挥自动驾驶汽车,大模型让乘客变身「副驾驶」
自动驾驶汽车的驾驶风格通常由工程师在出厂前预先调定,乘客几乎没有实时干预的余地。荷兰代尔夫特理工大学(TU Delft)的研究人员开发了一套新系统,利用大型语言模型(LLM)将乘客的自然语言请求转化为对运动规划算法参数的调整。乘客可以用日常语言表达偏好,例如「我感到头晕,请开稳一点」或「我要迟到了,快一点」,系统会在保证安全的前提下相应调整车速、转向平滑度等参数。在执行任何调整之前,系统会以非技术性语言向乘客描述即将做出的改变,并请乘客确认,从而将人类保留在决策回路中。该研究预印本已发布于arXiv,并将于今年9月在IEEE智能交通系统大会上正式发表。研究人员在自动驾驶仿真平台nuPlan中对系统进行了测试,结果显示其能够准确响应八种不同类型的自然语言指令。
自动驾驶汽车在行驶过程中需要精细平衡速度、加速度、转向平滑度等多项参数,这些参数通常由工程师在车辆上路前统一调定。然而,乘客的实际需求因人而异、因时而变——赶时间的商务人士希望车辆快速行驶,而晕车的乘客则更需要平稳舒适的驾驶体验。现有系统缺乏让乘客实时表达偏好的机制,这一痛点促使代尔夫特理工大学的研究团队寻求新的解决方案。
研究团队的核心思路是将LLM的语言理解与推理能力和确定性运动规划算法相结合,而非让LLM直接控制车辆。系统底层采用研究人员此前开发的模型预测路径积分控制器,该控制器会生成多条候选路径,并依据速度、转向角、碰撞概率等标准对其评分,最终选出综合得分最优的路径。LLM的作用在于解析乘客的自然语言输入,并将其转化为对各项评分标准权重的调整,从而间接影响控制器的路径选择。
研究团队选用了OpenAI的GPT-4o-mini模型来处理乘客的语言输入。当乘客发出指令时,模型会同时接收乘客的提示词和对当前行驶场景的自然语言描述,据此判断应如何调整各项参数的相对权重。例如,若乘客表示感到头晕,模型会提高平滑转向和温和加速的权重,使车辆倾向于更平稳的行驶方式;若乘客表示赶时间,则会相应提升速度相关参数的权重。所有调整均在研究人员预设的安全基线范围内进行。
该系统的一个重要设计原则是保持人类在决策回路中的参与。在实施任何参数调整之前,系统会以通俗易懂的语言向乘客描述计划中的变化,并请乘客确认。若乘客对调整结果不满意,或驾驶偏好发生变化,可以随时发出新的指令进行进一步调整。首席研究员Diego Martinez-Baselga将这一交互过程比作与出租车司机或朋友同乘时的自然沟通,这种机制也有助于纠正模型对指令的误解。
研究团队在自动驾驶仿真平台nuPlan中对系统进行了测试,场景设定为并入繁忙高速公路。测试结果显示,系统在八种不同指令下均能按照乘客意图调整控制器参数,追求舒适的指令会提升行驶平滑度,而表达紧迫感的指令则会带来更高的行驶速度。不过,来自苏黎世联邦理工学院和慕尼黑工业大学的外部研究人员也指出,该系统目前尚未提供可数学验证的安全保证,如何在语言交互灵活性与严格安全约束之间取得平衡,仍是该领域需要持续攻克的核心挑战。
这项研究并非LLM介入自动驾驶运动规划的首次尝试。苏黎世联邦理工学院的Nicolas Baumann此前已发表研究,将LLM用于调整模型赛车控制器的参数。慕尼黑工业大学的Matthias Althoff教授则走得更远,其团队构建的系统会在LLM提出驾驶决策后,通过数学方法对其进行安全验证。各方研究路径的差异折射出业界对LLM在自动驾驶中角色定位的不同思考:是作为灵活的人机交互接口,还是深度嵌入决策链路的核心组件。
要点
- 代尔夫特理工大学研究团队开发的系统让乘客可通过自然语言实时调整自动驾驶汽车的驾驶风格,LLM负责将模糊的人类偏好转化为运动规划算法的参数权重调整。
- 系统采用「LLM调参、确定性控制器执行」的分层架构,将语言交互的灵活性与传统运动规划算法的安全可控性相结合,避免了LLM直接控制车辆可能带来的响应延迟和安全风险。
- 人类确认机制是系统设计的核心环节,所有参数调整在执行前均需乘客审阅并确认,有效降低了模型误解指令的风险。
- 该系统在nuPlan仿真平台的测试中表现良好,但外部专家指出其缺乏可数学验证的安全保证,这是当前方案与工业级部署之间仍需弥合的关键差距。
- 如何在LLM带来的交互灵活性与严格的安全约束之间取得平衡,是自动驾驶领域将LLM融入决策系统时面临的共同核心挑战。
原始标题:Self-Driving Cars Could Someday Take Requests
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。