DeepSeek V4 Flash logo

DeepSeek V4 Flash

開く

DeepSeek公式の小型エージェントモデル。284B総計/13BアクティブのMoE、100万トークンコンテキスト、MITオープンウェイト、DSpark投機デコード、100万トークンあたり$0.14/$0.28の料金。

共有:

DeepSeek V4 Flash 0731 は、DeepSeek の小型エージェントモデルの正式リリース版です。2026年7月31日に公開され、同日にMITライセンスのオープンウェイトが提供されました。4月のプレビュー版と同じ284B総計/13BアクティブのMoEアーキテクチャを維持しつつ、エージェント性能に特化して再ポストトレーニングされ、DSpark投機デコードモジュールを搭載。ネイティブなResponses APIとCodexサポートも追加されました。DeepSeekが公開したベンチマークでは、正式版Flashははるかに大型のV4-Proプレビューを上回り、フロンティア級エージェントコーディング分野でタスクあたりコストが最も優れたモデルの一つとなっています。

主な機能

  • エージェント向け再ポストトレーニング:アーキテクチャはプレビュー版と同一ですが、ポストトレーニングはツール使用と多段階タスクに重点を置き、すべてのツール呼び出しラウンドで完全な推論履歴をコンテキスト内に保持します。
  • DSpark投機デコード:内蔵ドラフトモジュールで推論を高速化。vLLMでは--speculative-configフラグ1つ、SGLangではDSPARKで有効化できます。
  • 3段階の推論強度lowhighmaxで熟考レベルを制御。maxは完全な問題分解とエッジケーステストを実行。非思考モードもサポート。
  • Codex対応API:OpenAI Responses APIをネイティブサポートし、Codexに明示的に対応。Anthropic互換の/anthropicエンドポイントも提供。
  • 大規模コンテキスト:100万トークンのコンテキストと最大384Kトークンの出力で、長いエージェントセッションを1つのウィンドウに収めます。

モデル仕様

仕様 DeepSeek V4 Flash 0731
パラメータ 284B総計/13Bアクティブ(DSparkモジュール込みで304B)
コンテキスト/最大出力 100万トークン/384Kトークン
推論強度 low、high、max + 非思考モード
ライセンス MIT(オープンウェイト)
ウェイト Hugging Face: deepseek-ai/DeepSeek-V4-Flash-0731

料金

項目 100万トークンあたり
入力 $0.14
出力 $0.28
キャッシュ済み入力 $0.0028(キャッシュヒットで98%割引)

ピーク時間帯の2倍割増料金(北京時間09:00-12:00、14:00-18:00)は発表されましたが、リリース時点では未適用です。

ベンチマーク

  • Terminal Bench 2.1:82.7。プレビュー版を20ポイント以上上回る。
  • エージェントベンチマーク:アクティブパラメータが約12分の1でありながら、DeepSeekが公開するすべてのエージェントベンチマークでDeepSeek-V4-Proプレビューを上回る。
  • エコシステム:antirezのDwarfStar 4(ds4)ネイティブC推論エンジンがこのモデルを中心に構築されました。

ユースケース

  • コスト重視のエージェントパイプライン:100万トークンあたり$0.14/$0.28でフロンティアに近いエージェント性能。
  • Codex互換ワークフロー:OpenAI形状のAPIを利用中のチームは、モデル名を変えるだけでスタックを維持できます。
  • ローカルエージェント展開:MITウェイトをvLLM、SGLang、llama.cpp級のエンジンで一般的なハードウェア上で実行可能。
  • 高同時接続サービス:APIで最大2,500の同時リクエストに対応。

優位性

  1. 価格性能比の王者:13Bアクティブパラメータで、49Bアクティブのフラッグシップをエージェントベンチマークで上回る。
  2. オープンで実用的:MITウェイト、DSpark、巨大なコンテキストを備え、ドルあたり最強のオープンエージェントモデル。
  3. エコシステムとの適合:ネイティブなCodex対応とAnthropic互換エンドポイントで統合の摩擦を解消。

ヒント

  1. DSparkを有効化:投機デコードは最大の速度向上機能です。お使いのサービングスタックで文書化されたフラグを使用してください。
  2. maxモードでは出力上限を上げるmax推論レベルは384Kの出力上限を活かします。
  3. 98%キャッシュ割引を活用:長い共通プレフィックスはキャッシュヒットでほぼ無料になり、エージェントプロンプトの構成方法が変わります。

まとめ

DeepSeek V4 Flash 0731は、この夏を代表する小型エージェントモデルです。オープンウェイト、100万トークンコンテキスト、そしてフロンティアに近いエージェントコーディングを大規模に実現するコストプロファイルを兼ね備えています。予算内でエージェントを構築するチームにとって、最強の出発点です。

代替案

  • DeepSeek V4 Pro 0813:コストが二の次で最大能力を求める場合の1.6Tフラッグシップ。
  • GLM-5.3:やや高コストの新しいオープンウェイトコーディングリーダー。
  • Kimi K3:同等のエージェントスコアを持つオープンウェイト2.8Tモデル。

コメント

まだコメントがありません。最初のコメントを投稿してください!