Qwen-Drive-1.0-4B 是阿里面向自动驾驶的视觉语言基础模型。Hugging Face 卡片 写协议 Apache-2.0,管线 image-text-to-text,Qwen3.5-4B 这颗 VLM 保持不动,旁边再挂 BEV 感知头和 Planning Expert。2026-09-09 Hugging Face 显示 97 likes、近一个月下载 1,579。createdAt 是 2026-08-27。代码仓库 QwenLM/Qwen-Drive-1.0 当天 313 star。r/LocalLLaMA 热榜有这张卡片。技术报告:arXiv:2609.00111。
若要更早的通用 LVLM 快照,看 Qwen-VL。若要截图加文本智能体的视觉模型,看 DeepSeek-V4-Flash-Vision-Exp。若要没有驾驶头的稠密本地对话模型,看 Qwen3.8-27B。
核心功能
- VLM 不动,两个头外挂:卡片写原生多模态的 Qwen3.5-4B 回答驾驶 VQA。BEV 头同时做三维检测、语义占据和 BEV 地图分割。Planning Expert 吃共享 VLM 特征,用 flow matching 生成未来自车轨迹。
- 两个规划器:
planner-sft覆盖直接规划和带推理规划。planner-rl在 NAVSIM PDMS、WOD-E2E RFS 和位移项上做了奖励优化。卡片写planner-rl要用推理规划模式。 - 一个目录:根目录 VLM 约 9.1 GB,
planner-sft/和planner-rl/各约 2.1 GB,perception/约 0.5 GB。 - 厂商引用的驾驶 VQA:卡片列 LingoQA 77.8(评委是 Qwen-Plus;官方 LingoJudge 协议 79.4)、Ego3D RMSE 7.78、WaymoQA all 74.5。当作第一方数字,我们没有复跑。
- 卡片上的推理路径:Transformers
QwenDriveForPlanning、vLLMvllm serve、SGLang、Docker Model Runner。推理代码从 GitHub 仓库pip install -e .。
限制:这是驾驶栈,不是通用电脑操作智能体。卡片上闭环 AlpaSim at-fault 分数,RL 是 0.37,Alpamayo-1.5 是 0.45。要挂规划器得用 Qwen-Drive 包装,不能拿随便一个 VLM pipeline。97 likes 是热度信号,不是评测。
规格
| 项 | 值 | 来源 |
|---|---|---|
| 基座 VLM | Qwen3.5-4B | HF 卡片 |
| 协议 | Apache-2.0 | 同上 |
| likes / 近一个月下载 | 97 / 1,579 | HF API,2026-09-09 |
| GitHub star | 313 | QwenLM/Qwen-Drive-1.0,2026-09-09 |
| 软件价格 | $0 权重 | Apache-2.0 |
适用场景
- 驾驶实验室,想用一份权重同时做 VQA、BEV 感知和开环轨迹。
- 研究员,要在公开 WOD-E2E / NAVSIM 数字上对比,不想每个数据集单独训一个专家。
- LocalLLaMA 读者,在热榜看到 HF 链接,要的是 4B 驾驶 SKU,不是通用闲聊 VLM。
若要的是桌面截图,从 DeepSeek-V4-Flash-Vision-Exp 开始,不要用这一页。
快速开始
- 打开 Qwen/Qwen-Drive-1.0-4B。
git clone https://github.com/QwenLM/Qwen-Drive-1.0 qwen-drive && cd qwen-drive && pip install -e . --no-build-isolation。hf download Qwen/Qwen-Drive-1.0-4B --local-dir Qwen-Drive-1.0-4B。- 推理规划用
QwenDriveForPlanning并指定planner="Qwen-Drive-1.0-4B/planner-rl";只要 VQA 就不要挂规划器。
第一方资源:Qwen-Drive-1.0 模型卡。
常见问题
4B 是整套栈吗?
VLM 是 4B 的 Qwen3.5。规划器和感知头是旁边的额外目录。HF safetensors 根快照大约 5B 参数。
能当普通聊天 VLM 用吗?
能。卡片写只加载根目录、不挂规划器,就可以回答自由形式的驾驶问题。
有托管 API 吗?
2026-09-09 卡片上没有 Inference Provider 部署。承诺 $0 托管席位前请再确认。
替代方案
- Qwen-VL:更早的通用 Qwen 视觉快照,没有驾驶规划器。
- DeepSeek-V4-Flash-Vision-Exp:MIT 的 Flash 视觉实验,面向截图加文本智能体。
- Qwen3.8-27B:更稠的 Apache-2.0 对话模型,没有 BEV 头。
使用技巧
planner-rl只用推理规划模式。planner-sft覆盖直接和推理两种。- 不要把 Alpamayo 闭环分数抄到这一页。
- 引用 NAVSIM 之前,先跑 GitHub 仓库里的
scripts/demo.py。
总结
Qwen-Drive-1.0-4B 是 r/LocalLLaMA 指向的 Apache-2.0 驾驶 VLM:不动的 Qwen3.5-4B、一根 BEV 探针、两个规划专家。从 Hugging Face 卡片 开始。若要通用截图智能体,去 DeepSeek-V4-Flash-Vision-Exp。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。