DeepSeek V4 Flash 0731 は、DeepSeek の小型エージェントモデルの正式リリース版です。2026年7月31日に公開され、同日にMITライセンスのオープンウェイトが提供されました。4月のプレビュー版と同じ284B総計/13BアクティブのMoEアーキテクチャを維持しつつ、エージェント性能に特化して再ポストトレーニングされ、DSpark投機デコードモジュールを搭載。ネイティブなResponses APIとCodexサポートも追加されました。DeepSeekが公開したベンチマークでは、正式版Flashははるかに大型のV4-Proプレビューを上回り、フロンティア級エージェントコーディング分野でタスクあたりコストが最も優れたモデルの一つとなっています。
2026-08-17 に api-docs.deepseek.com を再確認: deepseek-v4-flash は 100 万トークン入力 $0.14 / 出力 $0.28 / キャッシュ $0.028。コンテキスト 100 万、最大出力 38.4 万。
主な機能
- エージェント向け再ポストトレーニング:アーキテクチャはプレビュー版と同一ですが、ポストトレーニングはツール使用と多段階タスクに重点を置き、すべてのツール呼び出しラウンドで完全な推論履歴をコンテキスト内に保持します。
- DSpark投機デコード:内蔵ドラフトモジュールで推論を高速化。vLLMでは
--speculative-configフラグ1つ、SGLangではDSPARKで有効化できます。 - 3段階の推論強度:
low、high、maxで熟考レベルを制御。maxは完全な問題分解とエッジケーステストを実行。非思考モードもサポート。 - Codex対応API:OpenAI Responses APIをネイティブサポートし、Codexに明示的に対応。Anthropic互換の
/anthropicエンドポイントも提供。 - 大規模コンテキスト:100万トークンのコンテキストと最大384Kトークンの出力で、長いエージェントセッションを1つのウィンドウに収めます。
モデル仕様
| 仕様 | DeepSeek V4 Flash 0731 |
|---|---|
| パラメータ | 284B総計/13Bアクティブ(DSparkモジュール込みで304B) |
| コンテキスト/最大出力 | 100万トークン/384Kトークン |
| 推論強度 | low、high、max + 非思考モード |
| ライセンス | MIT(オープンウェイト) |
| ウェイト | Hugging Face: deepseek-ai/DeepSeek-V4-Flash-0731 |
料金
| 項目 | 100万トークンあたり |
|---|---|
| 入力 | $0.14 |
| 出力 | $0.28 |
| キャッシュ済み入力 | $0.0028(キャッシュヒットで98%割引) |
ピーク時間帯の2倍割増料金(北京時間09:00-12:00、14:00-18:00)は発表されましたが、リリース時点では未適用です。
ベンチマーク
- Terminal Bench 2.1:82.7。プレビュー版を20ポイント以上上回る。
- エージェントベンチマーク:アクティブパラメータが約12分の1でありながら、DeepSeekが公開するすべてのエージェントベンチマークでDeepSeek-V4-Proプレビューを上回る。
- エコシステム:antirezのDwarfStar 4(ds4)ネイティブC推論エンジンがこのモデルを中心に構築されました。
ユースケース
- コスト重視のエージェントパイプライン:100万トークンあたり$0.14/$0.28でフロンティアに近いエージェント性能。
- Codex互換ワークフロー:OpenAI形状のAPIを利用中のチームは、モデル名を変えるだけでスタックを維持できます。
- ローカルエージェント展開:MITウェイトをvLLM、SGLang、llama.cpp級のエンジンで一般的なハードウェア上で実行可能。
- 高同時接続サービス:APIで最大2,500の同時リクエストに対応。
優位性
- 価格性能比の王者:13Bアクティブパラメータで、49Bアクティブのフラッグシップをエージェントベンチマークで上回る。
- オープンで実用的:MITウェイト、DSpark、巨大なコンテキストを備え、ドルあたり最強のオープンエージェントモデル。
- エコシステムとの適合:ネイティブなCodex対応とAnthropic互換エンドポイントで統合の摩擦を解消。
ヒント
- DSparkを有効化:投機デコードは最大の速度向上機能です。お使いのサービングスタックで文書化されたフラグを使用してください。
- maxモードでは出力上限を上げる:
max推論レベルは384Kの出力上限を活かします。 - 98%キャッシュ割引を活用:長い共通プレフィックスはキャッシュヒットでほぼ無料になり、エージェントプロンプトの構成方法が変わります。
まとめ
DeepSeek V4 Flash 0731は、この夏を代表する小型エージェントモデルです。オープンウェイト、100万トークンコンテキスト、そしてフロンティアに近いエージェントコーディングを大規模に実現するコストプロファイルを兼ね備えています。予算内でエージェントを構築するチームにとって、最強の出発点です。
代替案
- DeepSeek V4 Pro 0813:コストが二の次で最大能力を求める場合の1.6Tフラッグシップ。
- GLM-5.3:やや高コストの新しいオープンウェイトコーディングリーダー。
- Kimi K3:同等のエージェントスコアを持つオープンウェイト2.8Tモデル。
使用シナリオ
- DeepSeek V4 Flash が自分のワークフローをカバーするか先に確認したい場合。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。