自动驾驶这两年被"端到端"推着往前跑,但一个老问题始终横在中间:通用视觉语言模型看不懂 3D 世界,而传统驾驶栈又没有语言与推理。8 月 31 日,Qwen 团队在 arXiv 上传了 Qwen-Drive-1.0,标题直译过来就是《迈向自动驾驶视觉语言基座模型的第一步》,16 位作者署名,两天内冲上 Hugging Face 论文热榜当日第二、335 个点赞——这是 Qwen 第一次把自家 VLM 正式开进驾驶场景。

主干不动,外挂两个模块

Qwen-Drive-1.0 最值得注意的设计选择,是预训练 VLM 的架构完全保留、一行主干不改,只在外面挂两个模块。

一个是 BEV 感知头,联合执行 3D 目标检测、语义占据预测和 BEV 地图分割三项任务。论文特意把它定位成"探针"——探测共享表征里到底能榨出多少 3D 信息,同时给 3D 场景结构提供一个显式、可检查的接口。

另一个是规划专家(Planning Expert),以共享 VLM 表征为条件生成自车未来轨迹。论文一作 Xin Zhou 在 HF 评论区补充了两个摘要里没写的细节:基座是原生多模态的 Qwen3.5-4B,轨迹生成走 flow matching。

分阶段训练:学会开车,别忘聊天

领域适配最怕"学了驾驶、丢了通用"。Qwen-Drive-1.0 用分阶段训练配方,把驾驶监督数据与通用视觉语言数据混合,在拿到驾驶专长的同时,保住宽泛的视觉理解与指令跟随能力。

评测覆盖开环、伪闭环、闭环三类设定,任务面包括 3D 感知、驾驶视觉问答与运动规划。论文的结论措辞很克制:3D 感知与驾驶场景理解表现强,通用视觉语言能力"基本保留",运动规划在三类设定下"高度竞争"。

权重还没放,代码在路上

按时间线提醒一句:arXiv 页面写的是代码"将"在 GitHub(QwenLM/Qwen-Drive-1.0)开放,HF 详情页显示关联模型数为 0——此刻只能读论文,下不到权重跑推理。一作称它是"首个在预训练阶段统一 3D 感知与视觉问答的自动驾驶视觉语言基座模型",注意"首个"是作者口径,留给独立评测检验。

所以呢

Qwen-Drive-1.0 的真正信号不在跑分,而在范式:与其从零训练驾驶专用模型,不如拿通用 VLM 当底座、外挂领域专家——这与"基座模型 + 领域适配"的行业大方向完全同频。下一步只看一件事:驾驶场景会不会成为 VLM 基座厂商的下一个必争之地?

参考资料:https://arxiv.org/abs/2609.00111