大模型之家讯 9月6日,阿里千问开源了基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型 Qwen-Drive-1.0-4B,官方称其为首个面向自动驾驶的视觉语言基础模型。该模型在预训练阶段统一了 3D 感知与视觉问答,并扩展至运动规划,同时保留预训练 VLM 的原始架构。模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,提供 SFT 和 RL 两个规划专家,仅使用公开来源构建规划样本。经强化学习后,该模型仅以微小开环位移误差为代价,在人类偏好对齐和闭环安全性方面实现全面提升。模型已在 GitHub、Hugging Face 和 ModelScope 上线。