Qwen-Drive-1.0-4B logo

Qwen-Drive-1.0-4B

開く

Qwen-Drive-1.0-4B は 3D 知覚、VQA、運動計画をまとめる Alibaba の Apache-2.0 運転 VLM。

共有:
代替ツールを見る

Qwen-Drive-1.0-4B は Alibaba の自動運転向け視覚言語基盤モデルです。Hugging Face カード はライセンス Apache-2.0、パイプライン image-text-to-text、Qwen3.5-4B VLM は触らず、BEV 知覚ヘッドと Planning Expert を横に付けると書く。2026-09-09 の Hugging Face は 97 likes、直近月のダウンロード 1,579createdAt は 2026-08-27。コードリポジトリ QwenLM/Qwen-Drive-1.0 は同日 313 stars。r/LocalLLaMA のホットにカードがあった。技術報告:arXiv:2609.00111

古い汎用 LVLM スナップショットなら Qwen-VL。スクリーンショットとテキストエージェントの視覚モデルなら DeepSeek-V4-Flash-Vision-Exp。運転ヘッドのない密なローカル対話モデルなら Qwen3.8-27B

主な機能

  • VLM はそのまま、ヘッドは外付け:カードはネイティブマルチモーダルの Qwen3.5-4B が運転 VQA に答えると書く。BEV ヘッドは 3D 検出、意味的占有、BEV 地図分割を同時に行う。Planning Expert は共有 VLM 特徴を条件に、flow matching で将来の自車軌道を出す。
  • 2 つのプランナplanner-sft は直接計画と推論計画の両方。planner-rl は NAVSIM PDMS、WOD-E2E RFS、変位項で報酬最適化。カードは planner-rl を推論計画モードで走れと書く。
  • 1 ディレクトリ:ルートの VLM 約 9.1 GBplanner-sft/planner-rl/ が各約 2.1 GBperception/0.5 GB
  • ベンダー引用の運転 VQA:カードは LingoQA 77.8(判定は Qwen-Plus、公式 LingoJudge 手順では 79.4)、Ego3D RMSE 7.78、WaymoQA all 74.5。第一当事者の数字として扱い、再計測していない。
  • カード上の推論経路:Transformers の QwenDriveForPlanning、vLLM vllm serve、SGLang、Docker Model Runner。推論コードは GitHub リポジトリから pip install -e .

制限:運転スタックであり、汎用コンピュータ操作エージェントではない。カードの閉ループ AlpaSim at-fault は RL が 0.37、Alpamayo-1.5 が 0.45。プランナを付けるには Qwen-Drive パッケージが要り、適当な VLM パイプラインでは足りない。97 likes は熱の信号であり、監査ではない。

仕様

項目 出典
ベース VLM Qwen3.5-4B HF カード
ライセンス Apache-2.0 同上
likes / 直近月 DL 97 / 1,579 HF API、2026-09-09
GitHub stars 313 QwenLM/Qwen-Drive-1.0、2026-09-09
ソフトウェア価格 $0 重み Apache-2.0

使用シナリオ

  • 運転ラボで、VQA、BEV 知覚、開ループ軌道を 1 チェックポイントにしたいチーム。
  • 公開 WOD-E2E / NAVSIM 数字を、データセットごとに別専門家を訓練せず比べたい研究者。
  • LocalLLaMA 読者で、ホットの HF リンクを見て 4B 運転 SKU が欲しく、汎用チャット VLM ではない人。

デスクトップのスクリーンショットが必要なら、このページではなく DeepSeek-V4-Flash-Vision-Exp から始める。

はじめに

  1. Qwen/Qwen-Drive-1.0-4B を開く。
  2. git clone https://github.com/QwenLM/Qwen-Drive-1.0 qwen-drive && cd qwen-drive && pip install -e . --no-build-isolation
  3. hf download Qwen/Qwen-Drive-1.0-4B --local-dir Qwen-Drive-1.0-4B
  4. 推論計画は QwenDriveForPlanningplanner="Qwen-Drive-1.0-4B/planner-rl"。VQA だけならプランナを付けない。

第一当事者リソース:Qwen-Drive-1.0 モデルカード

よくある質問

4B がスタック全体ですか?

VLM は 4B の Qwen3.5。プランナと知覚ヘッドは横の追加フォルダ。HF safetensors のルートスナップショットは約 5B パラメータ。

普通のチャット VLM として出せますか?

出せます。カードはルートだけを読み、プランナなしで自由形式の運転質問に答えると書く。

ホスト API はありますか?

2026-09-09 のカードに Inference Provider 配備はなかった。$0 ホスト席を約束する前に再確認する。

代替案

  • Qwen-VL:古い汎用 Qwen 視覚スナップショット。運転プランナはない。
  • DeepSeek-V4-Flash-Vision-Exp:スクリーンショットとテキストエージェント向け MIT Flash 視覚実験。
  • Qwen3.8-27B:より密な Apache-2.0 対話。BEV ヘッドはない。

ヒント

  1. planner-rl は推論計画モードだけ。planner-sft は直接と推論の両方。
  2. Alpamayo の閉ループ点をこのページに写さない。
  3. NAVSIM を引用する前に GitHub の scripts/demo.py を走らせる。

まとめ

Qwen-Drive-1.0-4B は r/LocalLLaMA が指していた Apache-2.0 運転 VLM です。触らない Qwen3.5-4B、BEV プローブ、2 つの計画エキスパート。Hugging Face カード から始める。汎用スクリーンショットエージェントなら DeepSeek-V4-Flash-Vision-Exp へ。

コメント

まだコメントがありません。最初のコメントを投稿してください!