Qwen-Drive-1.0-4B は Alibaba の自動運転向け視覚言語基盤モデルです。Hugging Face カード はライセンス Apache-2.0、パイプライン image-text-to-text、Qwen3.5-4B VLM は触らず、BEV 知覚ヘッドと Planning Expert を横に付けると書く。2026-09-09 の Hugging Face は 97 likes、直近月のダウンロード 1,579。createdAt は 2026-08-27。コードリポジトリ QwenLM/Qwen-Drive-1.0 は同日 313 stars。r/LocalLLaMA のホットにカードがあった。技術報告:arXiv:2609.00111。
古い汎用 LVLM スナップショットなら Qwen-VL。スクリーンショットとテキストエージェントの視覚モデルなら DeepSeek-V4-Flash-Vision-Exp。運転ヘッドのない密なローカル対話モデルなら Qwen3.8-27B。
主な機能
- VLM はそのまま、ヘッドは外付け:カードはネイティブマルチモーダルの Qwen3.5-4B が運転 VQA に答えると書く。BEV ヘッドは 3D 検出、意味的占有、BEV 地図分割を同時に行う。Planning Expert は共有 VLM 特徴を条件に、flow matching で将来の自車軌道を出す。
- 2 つのプランナ:
planner-sftは直接計画と推論計画の両方。planner-rlは NAVSIM PDMS、WOD-E2E RFS、変位項で報酬最適化。カードはplanner-rlを推論計画モードで走れと書く。 - 1 ディレクトリ:ルートの VLM 約 9.1 GB、
planner-sft/とplanner-rl/が各約 2.1 GB、perception/約 0.5 GB。 - ベンダー引用の運転 VQA:カードは LingoQA 77.8(判定は Qwen-Plus、公式 LingoJudge 手順では 79.4)、Ego3D RMSE 7.78、WaymoQA all 74.5。第一当事者の数字として扱い、再計測していない。
- カード上の推論経路:Transformers の
QwenDriveForPlanning、vLLMvllm serve、SGLang、Docker Model Runner。推論コードは GitHub リポジトリからpip install -e .。
制限:運転スタックであり、汎用コンピュータ操作エージェントではない。カードの閉ループ AlpaSim at-fault は RL が 0.37、Alpamayo-1.5 が 0.45。プランナを付けるには Qwen-Drive パッケージが要り、適当な VLM パイプラインでは足りない。97 likes は熱の信号であり、監査ではない。
仕様
| 項目 | 値 | 出典 |
|---|---|---|
| ベース VLM | Qwen3.5-4B | HF カード |
| ライセンス | Apache-2.0 | 同上 |
| likes / 直近月 DL | 97 / 1,579 | HF API、2026-09-09 |
| GitHub stars | 313 | QwenLM/Qwen-Drive-1.0、2026-09-09 |
| ソフトウェア価格 | $0 重み | Apache-2.0 |
使用シナリオ
- 運転ラボで、VQA、BEV 知覚、開ループ軌道を 1 チェックポイントにしたいチーム。
- 公開 WOD-E2E / NAVSIM 数字を、データセットごとに別専門家を訓練せず比べたい研究者。
- LocalLLaMA 読者で、ホットの HF リンクを見て 4B 運転 SKU が欲しく、汎用チャット VLM ではない人。
デスクトップのスクリーンショットが必要なら、このページではなく DeepSeek-V4-Flash-Vision-Exp から始める。
はじめに
- Qwen/Qwen-Drive-1.0-4B を開く。
git clone https://github.com/QwenLM/Qwen-Drive-1.0 qwen-drive && cd qwen-drive && pip install -e . --no-build-isolation。hf download Qwen/Qwen-Drive-1.0-4B --local-dir Qwen-Drive-1.0-4B。- 推論計画は
QwenDriveForPlanningにplanner="Qwen-Drive-1.0-4B/planner-rl"。VQA だけならプランナを付けない。
第一当事者リソース:Qwen-Drive-1.0 モデルカード。
よくある質問
4B がスタック全体ですか?
VLM は 4B の Qwen3.5。プランナと知覚ヘッドは横の追加フォルダ。HF safetensors のルートスナップショットは約 5B パラメータ。
普通のチャット VLM として出せますか?
出せます。カードはルートだけを読み、プランナなしで自由形式の運転質問に答えると書く。
ホスト API はありますか?
2026-09-09 のカードに Inference Provider 配備はなかった。$0 ホスト席を約束する前に再確認する。
代替案
- Qwen-VL:古い汎用 Qwen 視覚スナップショット。運転プランナはない。
- DeepSeek-V4-Flash-Vision-Exp:スクリーンショットとテキストエージェント向け MIT Flash 視覚実験。
- Qwen3.8-27B:より密な Apache-2.0 対話。BEV ヘッドはない。
ヒント
planner-rlは推論計画モードだけ。planner-sftは直接と推論の両方。- Alpamayo の閉ループ点をこのページに写さない。
- NAVSIM を引用する前に GitHub の
scripts/demo.pyを走らせる。
まとめ
Qwen-Drive-1.0-4B は r/LocalLLaMA が指していた Apache-2.0 運転 VLM です。触らない Qwen3.5-4B、BEV プローブ、2 つの計画エキスパート。Hugging Face カード から始める。汎用スクリーンショットエージェントなら DeepSeek-V4-Flash-Vision-Exp へ。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。