DeepSeek-V4-Flash-Vision-Exp logo

DeepSeek-V4-Flash-Vision-Exp

開く

DeepSeek-V4-Flash-Vision-Exp は V4 初のマルチモーダル実験。Flash に視覚モジュールを足した MIT 重みで、約 305B パラメータ。

共有:
代替ツールを見る

DeepSeek-V4-Flash-Vision-Exp は DeepSeek の V4 ファミリーで最初の実験的マルチモーダルモデルです。Hugging Face カード は、DeepSeek V4 Flash アーキテクチャに視覚モジュールを足し、継続学習で同じエージェントスタックが画像を読めるようにしたと書きます。ライセンスは MIT。リポジトリ作成は 2026-08-31。2026-09-08 のカードは約 800 likes、先月ダウンロード 251,611。r/LocalLLaMA ではゲーム世界のスクリーンショット用途が出ていました。Hugging Face のモデルサイズは 305B params(BF16 / FP8 シャード)です。

テキストだけの Flash なら DeepSeek V4 Flash、より小さな密のマルチモーダルなら Qwen3.8-27B、オンデバイス 2B なら MiniCPM5-2B です。

モデル仕様

仕様 DeepSeek-V4-Flash-Vision-Exp
役割 実験的 V4 視覚 + テキストエージェント
ベース DeepSeek-V4-Flash + 視覚モジュール
HF サイズ 305B params(カード、2026-09-08)
ライセンス MIT
パイプライン image-text-to-text
カード日付 2026-08-31

制約: 名前が Exp で終わります。視覚 VRAM と追加エンコーダを測るまで、テキスト専用フリートの Flash-0731 差し替えにはしないでください。serving 例は 4 GPU の GB300 級ノードであり、ノート PC ではありません。

主な機能

  • カード上のマルチモーダルエージェント: ApexBench Pass@1 36.5(Flash-0731 は画像を無視して 26.2)。Agents' Last Exam 27.3 vs 25.2。Chartography 64.3。ZeroBench Pass@5 35.0。ベンダー数字。
  • テキストエージェントは近い帯: Terminal Bench 2.1 83.9 vs Flash 82.7。Toolathlon-Verified 75.9 vs 70.3。Cybergym はわずかに悪化(75.3 vs 76.7)。
  • 同一チェックポイントの DSpark: SGLang --speculative-algorithm DSPARK。別ドラフトパスは不要。
  • プロンプト符号化: OpenAI 風 JSON 画像ブロック、または <image>path</image> TXT。例では同じトークン ID。
  • vLLM レシピ: イメージ vllm/vllm-openai:deepseekv4-flash-vision、ツールパーサ deepseek_v4、FP8 KV キャッシュ。

使用シナリオ

  • 既に Flash を回しているエージェントハーネスで、同じセッションにスクリーンショットやチャート、UI dump を入れたい場合。
  • MIT 重みでローカルマルチモーダル研究をしたい場合。閉じた視覚 API ではない。
  • ゲームやワールド生成など、r/LocalLLaMA の Flash-Vision-Exp スレに近い実験。

料金

MIT の重みは無料。ホスト型チャットは DeepSeek サイト。このカードは視覚トークン単価を印刷していません。Flash のテキスト価格を視覚にコピーしないでください。

項目 価格 出典 2026-09-08
重み $0 Hugging Face MIT
セルフホスト 自分の GPU カード例: 4 ウェイテンソル並列
deepseek.com チャット 製品ページを確認 視覚料金表ではない

はじめに

  1. huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp を開く。
  2. vLLM recipe または SGLang cookbook に従い --speculative-algorithm DSPARK を付ける。
  3. 画像はリポジトリの encoding/ で符号化する。適当な VL chat テンプレートを使わない。
  4. テキストだけなら DeepSeek V4 Flash を確認。

第一ソース: DeepSeek-V4-Flash-Vision-Exp モデルカード

よくある質問

V4 Flash と同じですか?

違います。Flash-0731 はテキスト。Vision-Exp は視覚モジュールと継続学習です。テキストエージェント点は同じ帯、マルチモーダル点がこの SKU の理由です。

民生 GPU 1 枚で動きますか?

公開の vLLM 例は 4 GPU ノードと FP8 KV キャッシュです。24GB カードではなくクラスタ前提です。

MIT ですか?

はい。カードのバッジと License 節が MIT です。

代替案

ヒント

  1. MIT、800 likes、251,611 月次 DL、305B は 2026-09-08 確認のカードから。
  2. DSpark は同一チェックポイントに残す。別ドラフトリポジトリを作らない。
  3. ApexBench が目的なら、画像を捨てて Flash-0731 を評価しない。

まとめ

DeepSeek-V4-Flash-Vision-Exp は、Flash 級テキストエージェントを保ったままスクリーンショットを足す MIT の V4 実験です。Hugging Face カード から始め、DeepSeek V4 Flash がテキスト経路を既に覆っているか判断してください。

コメント

まだコメントがありません。最初のコメントを投稿してください!