阿里千问开源自动驾驶视觉语言模型
「阿里千问本周开源Qwen-Drive-1.0-4B,这是首个面向自动驾驶的视觉语言基础模型。基于Qwen3.5-4B构建,统一3D感知、视觉问答与运动规划,分阶段训练保留通用能力,提供SFT和RL两种规划专家,在人类偏好对齐和闭环安全性方面表现全面提升。」
阿里千问近期宣布开源Qwen-Drive-1.0-4B,这是一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。官方称其为首个面向自动驾驶的视觉语言基础模型,其在预训练阶段就统一了3D感知与视觉问答能力,并进一步扩展至运动规划任务,同时完整保留了预训练视觉语言模型的原始架构。
该模型采用分阶段训练方案,巧妙地将驾驶监督数据与通用视觉语言数据相结合。这种做法使得模型在获得驾驶领域特定能力的同时,仍能保持通用视觉理解与指令遵循能力,避免了以往专有模型在迁移到其他任务时出现的性能退化问题。这种平衡策略为自动驾驶模型的多任务泛化提供了新的思路。
Qwen-Drive-1.0-4B同时提供了SFT(监督微调)和RL(强化学习)两个规划专家版本。官方评测覆盖了多个维度,包括3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。这种全面的评估体系能够更真实地反映模型在实际驾驶环境中的表现,而不仅仅停留在静态指标上。
据介绍,Qwen-Drive-1.0在构建规划样本时仅使用公开来源的数据,并统一了各数据集的轨迹格式,降低了数据异构性带来的训练困难。模型从开环预测到闭环驾驶均进行了全面评估。其中SFT模型在所有基准上已经展现出竞争力,而经过强化学习后的版本,虽然付出了微小的开环位移误差代价,却在人类偏好对齐和闭环安全性方面取得了全面提升,这对于自动驾驶的实际应用至关重要。
目前,Qwen-Drive-1.0-4B的权重已同步发布在Hugging Face和ModelScope平台,开发者可以便捷获取并基于该模型进行二次开发与评测。此次开源有望推动自动驾驶领域视觉语言模型的研究与落地,也为行业提供了一套可复现的训练与评估基准。
来源:Heooo AI工具导航