Qwen-Drive-1.0-4B logo

Qwen-Drive-1.0-4B

打开

Qwen-Drive-1.0-4B 是阿里 Apache-2.0 的驾驶视觉语言模型,把三维感知、VQA 和运动规划放在同一套权重里。

分享:
查看替代方案

Qwen-Drive-1.0-4B 是阿里面向自动驾驶的视觉语言基础模型。Hugging Face 卡片 写协议 Apache-2.0,管线 image-text-to-text,Qwen3.5-4B 这颗 VLM 保持不动,旁边再挂 BEV 感知头和 Planning Expert。2026-09-09 Hugging Face 显示 97 likes、近一个月下载 1,579createdAt 是 2026-08-27。代码仓库 QwenLM/Qwen-Drive-1.0 当天 313 star。r/LocalLLaMA 热榜有这张卡片。技术报告:arXiv:2609.00111

若要更早的通用 LVLM 快照,看 Qwen-VL。若要截图加文本智能体的视觉模型,看 DeepSeek-V4-Flash-Vision-Exp。若要没有驾驶头的稠密本地对话模型,看 Qwen3.8-27B

核心功能

  • VLM 不动,两个头外挂:卡片写原生多模态的 Qwen3.5-4B 回答驾驶 VQA。BEV 头同时做三维检测、语义占据和 BEV 地图分割。Planning Expert 吃共享 VLM 特征,用 flow matching 生成未来自车轨迹。
  • 两个规划器planner-sft 覆盖直接规划和带推理规划。planner-rl 在 NAVSIM PDMS、WOD-E2E RFS 和位移项上做了奖励优化。卡片写 planner-rl 要用推理规划模式。
  • 一个目录:根目录 VLM 约 9.1 GBplanner-sft/planner-rl/ 各约 2.1 GBperception/0.5 GB
  • 厂商引用的驾驶 VQA:卡片列 LingoQA 77.8(评委是 Qwen-Plus;官方 LingoJudge 协议 79.4)、Ego3D RMSE 7.78、WaymoQA all 74.5。当作第一方数字,我们没有复跑。
  • 卡片上的推理路径:Transformers QwenDriveForPlanning、vLLM vllm serve、SGLang、Docker Model Runner。推理代码从 GitHub 仓库 pip install -e .

限制:这是驾驶栈,不是通用电脑操作智能体。卡片上闭环 AlpaSim at-fault 分数,RL 是 0.37,Alpamayo-1.5 是 0.45。要挂规划器得用 Qwen-Drive 包装,不能拿随便一个 VLM pipeline。97 likes 是热度信号,不是评测。

规格

来源
基座 VLM Qwen3.5-4B HF 卡片
协议 Apache-2.0 同上
likes / 近一个月下载 97 / 1,579 HF API,2026-09-09
GitHub star 313 QwenLM/Qwen-Drive-1.0,2026-09-09
软件价格 $0 权重 Apache-2.0

适用场景

  • 驾驶实验室,想用一份权重同时做 VQA、BEV 感知和开环轨迹。
  • 研究员,要在公开 WOD-E2E / NAVSIM 数字上对比,不想每个数据集单独训一个专家。
  • LocalLLaMA 读者,在热榜看到 HF 链接,要的是 4B 驾驶 SKU,不是通用闲聊 VLM。

若要的是桌面截图,从 DeepSeek-V4-Flash-Vision-Exp 开始,不要用这一页。

快速开始

  1. 打开 Qwen/Qwen-Drive-1.0-4B
  2. git clone https://github.com/QwenLM/Qwen-Drive-1.0 qwen-drive && cd qwen-drive && pip install -e . --no-build-isolation
  3. hf download Qwen/Qwen-Drive-1.0-4B --local-dir Qwen-Drive-1.0-4B
  4. 推理规划用 QwenDriveForPlanning 并指定 planner="Qwen-Drive-1.0-4B/planner-rl";只要 VQA 就不要挂规划器。

第一方资源:Qwen-Drive-1.0 模型卡

常见问题

4B 是整套栈吗?

VLM 是 4B 的 Qwen3.5。规划器和感知头是旁边的额外目录。HF safetensors 根快照大约 5B 参数。

能当普通聊天 VLM 用吗?

能。卡片写只加载根目录、不挂规划器,就可以回答自由形式的驾驶问题。

有托管 API 吗?

2026-09-09 卡片上没有 Inference Provider 部署。承诺 $0 托管席位前请再确认。

替代方案

  • Qwen-VL:更早的通用 Qwen 视觉快照,没有驾驶规划器。
  • DeepSeek-V4-Flash-Vision-Exp:MIT 的 Flash 视觉实验,面向截图加文本智能体。
  • Qwen3.8-27B:更稠的 Apache-2.0 对话模型,没有 BEV 头。

使用技巧

  1. planner-rl 只用推理规划模式。planner-sft 覆盖直接和推理两种。
  2. 不要把 Alpamayo 闭环分数抄到这一页。
  3. 引用 NAVSIM 之前,先跑 GitHub 仓库里的 scripts/demo.py

总结

Qwen-Drive-1.0-4B 是 r/LocalLLaMA 指向的 Apache-2.0 驾驶 VLM:不动的 Qwen3.5-4B、一根 BEV 探针、两个规划专家。从 Hugging Face 卡片 开始。若要通用截图智能体,去 DeepSeek-V4-Flash-Vision-Exp

评论

还没有评论。成为第一个评论的人!