news 2026/10/5 2:31:29

阿里与华科大团队联合研发自动驾驶模型:给通用 VLM 装上“眼睛”和“方向盘”的一次开源尝试

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
阿里与华科大团队联合研发自动驾驶模型:给通用 VLM 装上“眼睛”和“方向盘”的一次开源尝试
论文:Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
作者:Qwen Team × 华中科技大学(Xin Zhou, Zongchuang Zhao, …, Dingkang Liang, Xiang Bai)
arXiv:2609.00111(2026-08-31)|开源:HuggingFace / ModelScope / GitHub(Apache 2.0 协议)
一句话总结:在一个 4B 通用视觉语言模型(VLM,Vision-Language Model)上,外挂一个鸟瞰图(BEV,Bird's-Eye-View)3D 感知头和一个基于流匹配(Flow Matching)的规划专家,让同一个模型同时会"看 3D 世界、聊驾驶场景、开 5 秒钟车",且预训练主干架构完全不改。

0. 为什么这篇论文重要:驾驶 VLM 的两大"病灶"

过去两年,驾驶领域的 VLA(Vision-Language-Action,视觉-语言-动作)路线基本是一种配方:拿一个通用 VLM,用驾驶 VQA(Visual Question Answering,视觉问答)数据继续训练。把场景描述、因果推理、决策解释全部塞进自回归语言接口,看起来优雅,但论文一针见血地指出两个结构性缺陷:

  1. 文本监督锁不住 3D 几何。VQA 目标从不直接约束 3D 布局、深度或占据关系。一个模型可以把车流描述得天花乱坠,同时对空间位置一塌糊涂——"语言流畅 ≠ 空间精确",而且没有任何显式探针(probe)能测量它的 3D 理解到底有多少。
  2. 灾难性遗忘(Catastrophic Forgetting)。有限的驾驶数据集永远覆盖不了真实世界的长尾 OOD(Out-of-Distribution,分布外)场景,而预训练学到的广义世界知识恰恰是 OOD 推理的压舱石。把模型彻底"洗"成驾驶专才,等于拆掉了安全气囊。

还有一个容易被学术界忽略、但产业界极其真实的动机:舱驾一体。量产车正在把智能座舱和智能驾驶合并到同一个计算平台上,这就要求一个模型既会开车、又会陪聊——通用能力是硬需求,不是锦上添花。

Qwen-Drive-1.0 的设计三原则:预训练主干架构不动、加一个显式 3D 感知探针、驾驶能力与通用能力兼得。

1. 总体架构:主干不动,外挂两个"器官"

Qwen-Drive-1.0 的底座是原生多模态的Qwen3.5-4B。视觉编码器(Vision Encoder)把每帧图像转成视觉 token(visual token),VLM 将视觉 token 与文本提示(prompt)一起自回归地生成回复。在此之上,两个外挂模块消费共享通路的特征,却不改动 VLM 的任何结构:

  • BEV 感知头(BEV Perception Head):融合视觉编码器特征与 VLM 输出特征,构建自车坐标系 BEV 表征,联合完成 3D 目标检测、语义占据预测、BEV 地图分割三项任务;
  • 规划专家(Planning Expert):以 VLM 缓存的注意力键值(K/V,Key/Value)为条件,通过流匹配(Flow Matching)生成未来 5 秒自车轨迹。

▲ 论文 Figure 2:统一架构——同一个 Qwen3.5-4B 上外挂 BEV 感知头与 Planning Expert,支持单目/多目驾驶图像、视频序列与普通通用图像三类输入,产出 3D 感知、VQA 回复与规划轨迹三类输出。

1.1 多视角多帧输入:不加新词表,纯靠"标签协议"

视觉 token 序列本身不携带视角和时间信息,团队用普通词表中已有的 token打上 8 个规范视角标签(<FRONT VIEW>…<BACK LEFT VIEW>)和帧标签(frame: k)。关键在于序列化顺序随任务切换:

  • VQA 用帧优先(frame-major):同一时间步的所有视角排在一起(先建立空间全景);
  • 规划用视角优先(view-major):同一视角的连续帧排在一起(暴露该视角的时间变化,这对动态环境中的控制至关重要)。

需要说明:这些标签确实复用现有词表 token、不引入新的特殊 token,"主干不改"成立;但帧优先/视角优先的切换本身就是一个需要训练去适配的设计决策,并非零成本。

1.2 文本生成目标

2. BEV 感知头:双特征流 + 显式几何探针

▲ 论文 Figure 3:(a) BEV 感知头内部结构;(b) 规划专家——8 个 GQA(Grouped-Query Attention,分组查询注意力)层的 K/V 缓存喂给 4 层扩散 Transformer,轨迹 token 经 AdaLN(Adaptive Layer Normalization,自适应层归一化)注入条件。

2.1 深度视角变换

2.2 BEV Transformer 与三路解码

  • 3D 检测:DETR 式可变形注意力解码器;
  • 语义占据:B 沿高度维展开并与 V\mathbf{V} 融合,浅层 3D UNet 逐体素预测;
  • 地图分割:BEV 平面 UNet 式头部。

▲ 感知三路输出的定性可视化:3D 目标检测框、语义占据、BEV 地图分割。出自论文 Figure 7。

2.3 三任务联合损失

占据沿用 FlashOcc 的损失组合:

2.4 跨数据集标签与空间统一

  • 标签统一:检测合并为 7 类;占据映射到共享 10 类;地图对两套矢量图在线栅格化到统一 6 类 schema;缺失类别离线补伪标签(只补语义、不做光线遮罩)。
  • 空间统一:两数据集体素网格物理尺寸不同(nuScenes ±40 m/0.4 m vs OpenScene ±50 m/0.5 m,LiDAR 外参含 ~1.84 m 垂直偏移)。解法是保留各自原生网格,在预测特征上做对齐:一次可微三线性采样把连续体素特征映到数据集特定的占据网格(而非对离散类别概率重采样),同一占据头零改动兼容两种分辨率。

▲ 占据标签处理前后对比(论文 Figure 5(b)):nuScenes 17 类与 OpenScene 原始标注分别映射进共享 10 类空间,并对缺失类别做离线补全。

3. 规划专家:流匹配生成 5 秒未来

3.1 条件生成建模

3.2 结构:K/V 缓存复用 + AdaLN 条件注入

规划专家为 32 层扩散 Transformer(隐藏维度 1024,约 1.1B 参数)。VLM 内部是门控线性注意力(GLA)与 GQA 交替;团队缓存全部 8 个 GQA 层 RoPE 后的 K/V,每份缓存喂给规划专家 4 个连续层,轨迹 token 将自己的 K/V 与缓存 K/V 拼接做联合注意力。每个轨迹 token = 含噪路点 + 历史轨迹编码;流时间 tt、n、e经共享 AdaLN 注入。

3.3 流匹配与预测干净样本(x-prediction)

4. 四阶段训练:让确定性流长出"可微的随机性"

▲ 四阶段训练配方(Figure 4):Stage 1 冻结主干预训练 BEV 头;Stage 2 解冻主干做感知+VQA 联合训练;Stage 3 冻结主干训练规划专家;Stage 4 仅训练规划专家做强化学习。火焰为可训练模块,雪花为冻结模块。

先澄清一个易被"主干不动"口号掩盖的事实:主干并非全程冻结。Stage 1 与 Stage 3/4 中视觉编码器和 VLM 冻结;但Stage 2 中二者以极低学习率参与联合训练(BEV 头用 VLM 的 20 倍学习率,"任务模块快变、主干慢漂")。准确说法是"架构不改 + 分阶段冻结策略"。

Stage 1:感知头预训练(主干冻结)

只训 BEV 头。论文诚实报告:只训头效果有限——预训练表征不会自动暴露足够的 3D 结构。

Stage 2:感知 + VQA 联合训练(核心阶段)

工程细节:(1)dummy input 技巧——给未激活分支喂哑输入再剔除输出,保持分布式 workers 计算图一致;(2)20× 学习率。混合消融:VL 训练使 Driving QA +6.55、CoC +38.39;3D 感知监督把通用 VLM 指标保持在 1 分以内——双向都不丢。

Stage 3:规划专家预训练(主干冻结)

只训规划专家,得Qwen-Drive-1.0-SFT。

Stage 4:强化学习(RL)

用任务级奖励(NAVSIM 的 PDMS、WOD-E2E 的 RFS + 共享位移项)优化规划专家,得Qwen-Drive-1.0-RL。

问题:流匹配推理除初始噪声外无转移概率,策略梯度无从求导。解法三连:

对式 (11) 的两点补充讨论:其一,18 维仅占完整输出空间(50 x 3=150 维)的 12%,子空间是否足以覆盖真实机动差异(变道、绕行等)论文未做消融,但作者的选择逻辑是"宁可探索少而有效,不要多而抖动";其二,这 1.7 m/步是 RL 训练时的探索噪声,不是部署时施加的扰动,且每步都有式 (10) 的分数修正把状态往回拉,因此"5 步累积 8.5 m"的线性累加算法不成立——探索的期望漂移被修正项抵消,噪声只在策略梯度估计中起作用。

策略对数似然也只在模态系数上定义:

▲ 同一 NAVSIM 左转场景下 RL 前后的规划对比(论文 Figure 10):(a) SFT 模型预测轨迹偏离录制轨迹,(b) RL 后预测与录制轨迹贴合。

5. 数据配方:55.9% 留存率的"质检流水线"

感知数据来自 nuScenes 与 OpenScene(这两个是感知数据集,不在"24 个"之内)。驾驶 VL 数据聚合24 个公开驾驶 VQA 数据集(CODA-LM、DRAMA、DriveLM、LingoQA、Talk2Car、WaymoQA 等):

  1. 重写:Qwen3.5-Plus 统一对话 schema;检测框归一化到 [0,1000)[0,1000),插入视角/帧标签;
  2. 一致性过滤:Qwen3.5-Flash 逐条判定改写回答与源标注语义一致性。

结果:5.53M → 3.09M(留存 55.9%)。

▲ 数据配方全景(论文 Figure 6):(a) 过滤后 3.09M 驾驶 VL 样本的输入格式分布;(b) Stage 2 混合配方 1.54M 条(驾驶 VL 64.3% / 通用 VL 26.0% / 感知 9.7%);(c) 场景多样性。Stage 2 混合 1.54M 条:9.7% 感知 / 26.0% 通用 VL / 64.3% 驾驶 VL;按重复因子放大后有效监督 12.7% / 31.0% / 56.3%。大模型当数据质检员 + 混合比例当遗忘旋钮,是抗遗忘的两个抓手。

6. 结果速览与冷静解读

▲ 论文 Figure 1 性能全景:驾驶 VQA、通用 VQA、3D 感知、运动规划四大象限。Qwen-Drive-1.0(深紫色)在驾驶 VQA 和规划上全面领先,通用 VQA 基本保住底座水平。

维度

关键数字

3D 感知

nuScenes 43.95 mAP / 60.99 map mIoU;OpenScene 43.45 mAP / 71.27 map mIoU

驾驶 VQA

LingoScore 79.4;CoC 平均 58.30(次优 Gemma4-12B 仅 22.05)

通用 VQA

知识推理组 66.41 vs 底座 67.40(-0.99);空间理解组 53.96 vs 52.99(反升)

开环规划

NAVSIM v1.1 PDMS 90.7(best-of-6 91.4);WOD-E2E 测试集 RFS 7.91

闭环规划

AlpaSim:off-road 24.0%→12.0%;at-fault 碰撞接近率 11.0% 持平 Alpamayo-1.5(0.27→0.37)

冷静解读三点:

  • 推理条件:收益真实但微小。带推理监督样本为 142K/557K(约 25.5%,称"几乎免费"不准确),"先推理再规划"对 RFS 提升仅 7.76→7.78(+0.02),论文未报显著性检验,不能排除噪声。公允结论:方向为正、幅度待证,更实在的价值在可解释性。
  • RL 可迁移性:证据有限。验证集 RFS 7.95→8.45、测试集 7.78→7.91 同时提升,看似支持"学到偏好对齐而非记忆";但验证集同样有标注,提升不自动排除记忆效应,严格论证需跨数据集/OOD 测试,论文未提供。
  • 安全-进度权衡(论文 Tab.7,916 个 AlpaSim 场景):RL 使 progress 54%→48%,all-event 接近率 41.0%(Alpamayo-1.5 为 37.0%),at-fault 持平 11.0%,模型更保守;论文自归因之一是视觉输入时间采样差异,属未排除的混杂因素。顺带一提,论文特意提醒 AlpaSim 分数不能孤立解读:DriveWAM 的 at-fault 分数 0.53 看似更高,但其 progress 只有 35%(经常近乎停车不动),all-event 接近率反而高达 56%——"停着不动"和"开得太冲"都会扭曲单项指标。

7. 横向坐标:与同期工作的相对位置

  • WAM-Flow(CVPR 2026,1.5B,基于 Janus):同为"流匹配 + GRPO"路线,但用离散流匹配 + 度量对齐数值分词器,NAVSIM v1 上 1 步 89.1 / 5 步 90.3 PDMS。与 Qwen-Drive 的 90.7(v1.1 navtest)不在同一评测划分,不能直接比大小,但"1/3 参数量、同量级分数"说明该路线已被独立验证;Qwen-Drive 的增量在"统一感知+VQA+规划"框架与冻结主干的外挂式设计。
  • OPTED(2026-09):其 Table I 最后一列报告两个大 VLA 的推理时延——Qwen-Drive 1.0 为1181 ms、Alpamayo 1.5 为940 ms,并明确写道这个量级不适合实时执行。对车端 10 Hz 控制环这是硬伤,4B VLM 上车的瓶颈目前不在精度而在时延。注意该数据的测量条件(硬件型号、是否含视觉编码、是否带推理链)OPTED 正文交代有限,引用时不宜直接当作车端实测值。其 62–356M 小策略经闭环微调后 AlpaSim 反超 Qwen-Drive,提示"大模型理解 + 小策略控制"的混合架构仍务实。
  • Alpamayo 2 Super:NVIDIA 官方报告其在 913 个重建场景自有划分上 AlpaSim 得分 1.50±0.13——与本文复现协议(0.16/0.37 vs Alpamayo-1.5 0.23/0.45)不是同一套场景集,不可直接比较;且 Alpamayo 用 8 万小时轨迹 + 3M 条 CoC 推理链的私有数据,规模不在一个量级。

8. 批判性阅读:它还"不会"什么

  1. 推理-轨迹一致性未打通。r 是条件而非监督对象——模型可以一边推理"应加速"一边生成减速轨迹。后续路线:一是可微对齐(推理 token 表示与轨迹嵌入做对比约束,但离散语言与连续轨迹间缺乏天然可微桥梁);二是偏好优化(以"推理与轨迹是否自洽"作奖励进 GRPO,工程上更现实,代价是需要额外的自洽性验证器)。
  2. 感知单帧、规划多帧的时间尺度错配。BEV 头只做单帧环视,给出的 3D 表征里没有速度/运动趋势,鬼探头类强动态场景是感知-规划衔接处最脆弱的地方,论文未讨论。
  3. RL 随机性改造是近似的(低维子空间 + 近似 score 修正),理论上不保证边缘分布不变。
  4. 评测全在公开数据集 + 仿真器。量化退化、多任务并发算力争抢、长尾 corner case 未涉及;BEV 头约 0.5B 额外参数的舱驾算力占比也是未知数。
  5. 证据缺口汇总:双流特征消融、RFS +0.02 显著性、AlpaSim 差距的时间采样归因——三处论文均未闭合。

9. 结语:一条被验证的路线,而不是一个终态模型

  1. 通用 VLM 的表征里确实埋着 3D 信息——需显式感知头 + 联合训练才能挖出来;
  2. 架构不改 + 外挂专家 + 分阶段冻结/微调配方,让小模型身兼"感知、对话、规划"三职,舱驾一体第一次有了 4B 级开源载体;
  3. 确定性生成模型可以做 RL——共享噪声 + 输出端随机化 + 低频子空间探索 + 组相对优势,这套工具有望外溢到机器人操作等领域;WAM-Flow 的独立复现从旁佐证。

下一步关键一跃是把"推理-轨迹一致性"从口号变成目标——谁先解决,谁才能让驾驶 VLM 从"会聊开车的语言模型"进化成"会解释自己的司机"。

参考资料

  • Qwen-Drive-1.0论文:https://arxiv.org/abs/2609.00111

  • GitHub:https://github.com/QwenLM/Qwen-Drive-1.0
  • HuggingFace:https://huggingface.co/Qwen/Qwen-Drive-1.0-4B
  • ModelScope:https://modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B
  • WAM-Flow论文:https://arxiv.org/abs/2512.06112
  • OPTED论文:https://arxiv.org/html/2609.20756v1
  • Alpamayo 2论文:https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/

创作不易,禁止抄袭,转载请附上原文标题及其链接

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 2:31:14

外贸网站谷歌SEO怎么收费?报价主要看哪些因素?

外贸网站谷歌SEO费用&#xff0c;可以先按“检查与规划、内容、技术实施、发布复验、持续协作”拆开看。网站基础、市场语言、内容资料和系统复杂度影响工作量&#xff0c;双方分工决定哪些工作进入服务费。 对已有开发团队的企业而言&#xff0c;最容易漏问的不是总价&#x…

作者头像 李华
网站建设 2026/10/5 2:31:09

机器学习数学基础──第 5 章 导数:变化的速度

第 5 章 导数:变化的速度 5.1 从一个问题开始:这一刻有多快 先说说我当年卡了半年的一个点,也许你也会卡在同一处:定义式里明明写着 h→0h \to 0h→0,但一动手就忍不住把 h=0h = 0

作者头像 李华
网站建设 2026/10/5 2:30:00

装饰器decorator总结(函数即是变量、高阶函数、嵌套函数、参数组)

装饰器 decorator的本质他就是函数原则&#xff1a;–对于被装饰的函数他不发生任何变化&#xff0c;他是透明的。 不能修改被装饰的函数的源代码不能修改被装饰的函数的调用方式 函数就是”变量“&#xff1a; 普通变量。先定义后使用&#xff1a;如x1&#xff0c;先定义变量x…

作者头像 李华
网站建设 2026/10/5 2:29:51

第068篇 sealed class:状态建模的利器

sealed class 在 Kotlin 里的地位,相当于"用类型系统表达状态机"。它的价值不在语法,而在一个很实际的痛点:当一个值有多种可能形态时,怎么保证"处理了这几种形态"这件事不会漏。 面试里问 sealed class,问的往往不是"是什么",而是"你…

作者头像 李华
网站建设 2026/10/5 2:28:57

Android 自定义 View 从零到实战:手写 6 大高频组件,附绘制异常排查清单

摘要:从零手写 Android 自定义 View 的实战指南。深入拆解 Measure、Layout、Draw 三大核心步骤,带你完成月份选择器、防滚动列表、动态饼图、广告轮播等 6 个高频组件,并附赠绘制异常排查清单。全程代码可复制、可直接落地。 目录 ① 视图构建核心三步骤解析 1.1 onMeasure…

作者头像 李华