DeepSeek-V4-Flash-Vision-Exp は DeepSeek の V4 ファミリーで最初の実験的マルチモーダルモデルです。Hugging Face カード は、DeepSeek V4 Flash アーキテクチャに視覚モジュールを足し、継続学習で同じエージェントスタックが画像を読めるようにしたと書きます。ライセンスは MIT。リポジトリ作成は 2026-08-31。2026-09-08 のカードは約 800 likes、先月ダウンロード 251,611。r/LocalLLaMA ではゲーム世界のスクリーンショット用途が出ていました。Hugging Face のモデルサイズは 305B params(BF16 / FP8 シャード)です。
テキストだけの Flash なら DeepSeek V4 Flash、より小さな密のマルチモーダルなら Qwen3.8-27B、オンデバイス 2B なら MiniCPM5-2B です。
モデル仕様
| 仕様 | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| 役割 | 実験的 V4 視覚 + テキストエージェント |
| ベース | DeepSeek-V4-Flash + 視覚モジュール |
| HF サイズ | 305B params(カード、2026-09-08) |
| ライセンス | MIT |
| パイプライン | image-text-to-text |
| カード日付 | 2026-08-31 |
制約: 名前が Exp で終わります。視覚 VRAM と追加エンコーダを測るまで、テキスト専用フリートの Flash-0731 差し替えにはしないでください。serving 例は 4 GPU の GB300 級ノードであり、ノート PC ではありません。
主な機能
- カード上のマルチモーダルエージェント: ApexBench Pass@1 36.5(Flash-0731 は画像を無視して 26.2)。Agents' Last Exam 27.3 vs 25.2。Chartography 64.3。ZeroBench Pass@5 35.0。ベンダー数字。
- テキストエージェントは近い帯: Terminal Bench 2.1 83.9 vs Flash 82.7。Toolathlon-Verified 75.9 vs 70.3。Cybergym はわずかに悪化(75.3 vs 76.7)。
- 同一チェックポイントの DSpark: SGLang
--speculative-algorithm DSPARK。別ドラフトパスは不要。 - プロンプト符号化: OpenAI 風 JSON 画像ブロック、または
<image>path</image>TXT。例では同じトークン ID。 - vLLM レシピ: イメージ
vllm/vllm-openai:deepseekv4-flash-vision、ツールパーサdeepseek_v4、FP8 KV キャッシュ。
使用シナリオ
- 既に Flash を回しているエージェントハーネスで、同じセッションにスクリーンショットやチャート、UI dump を入れたい場合。
- MIT 重みでローカルマルチモーダル研究をしたい場合。閉じた視覚 API ではない。
- ゲームやワールド生成など、r/LocalLLaMA の Flash-Vision-Exp スレに近い実験。
料金
MIT の重みは無料。ホスト型チャットは DeepSeek サイト。このカードは視覚トークン単価を印刷していません。Flash のテキスト価格を視覚にコピーしないでください。
| 項目 | 価格 | 出典 2026-09-08 |
|---|---|---|
| 重み | $0 | Hugging Face MIT |
| セルフホスト | 自分の GPU | カード例: 4 ウェイテンソル並列 |
| deepseek.com チャット | 製品ページを確認 | 視覚料金表ではない |
はじめに
- huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp を開く。
- vLLM recipe または SGLang cookbook に従い
--speculative-algorithm DSPARKを付ける。 - 画像はリポジトリの
encoding/で符号化する。適当な VL chat テンプレートを使わない。 - テキストだけなら DeepSeek V4 Flash を確認。
第一ソース: DeepSeek-V4-Flash-Vision-Exp モデルカード。
よくある質問
V4 Flash と同じですか?
違います。Flash-0731 はテキスト。Vision-Exp は視覚モジュールと継続学習です。テキストエージェント点は同じ帯、マルチモーダル点がこの SKU の理由です。
民生 GPU 1 枚で動きますか?
公開の vLLM 例は 4 GPU ノードと FP8 KV キャッシュです。24GB カードではなくクラスタ前提です。
MIT ですか?
はい。カードのバッジと License 節が MIT です。
代替案
- DeepSeek V4 Flash: テキスト専用 Flash エージェント SKU。
- Qwen3.8-27B: より小さな密のマルチモーダル。
- MiniCPM5-2B: オンデバイス 2B。305B ではない。
ヒント
- MIT、800 likes、251,611 月次 DL、305B は 2026-09-08 確認のカードから。
- DSpark は同一チェックポイントに残す。別ドラフトリポジトリを作らない。
- ApexBench が目的なら、画像を捨てて Flash-0731 を評価しない。
まとめ
DeepSeek-V4-Flash-Vision-Exp は、Flash 級テキストエージェントを保ったままスクリーンショットを足す MIT の V4 実験です。Hugging Face カード から始め、DeepSeek V4 Flash がテキスト経路を既に覆っているか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。