DeepSeek-V4.1-Flash logo

DeepSeek-V4.1-Flash

開く

DeepSeek-V4.1-Flash は MIT の 552B マルチモーダル MoE で、プリフィル 8B・デコード 16B 活性化、1M コンテキスト、KV キャッシュは V4-Flash の約 1/4。

共有:
代替ツールを見る

DeepSeek-V4.1-Flash は DeepSeek が 2026-09-10 に出したマルチモーダル MoE です。Hugging Face のカードMIT、バックボーン 552B、プリフィル活性化 8B・デコード活性化 16B、コンテキスト 1M。同日の likes は約 307。X の「おすすめ」には Tianyi CuiDeepSeek Harness v0.1.5 投稿があり、このモデルがそのハーネス向けに訓練されたと書いてあります。同じ日の r/LocalLLaMA hot はカード(約 211 票)と WeChat 経由の紹介を載せました。

284B/13B の前世代なら DeepSeek V4 Flash、採点に使ったエージェントループなら DeepSeek Harness、Mac のローカルサーバだけなら mlx-serve を見てください。

主な機能

  • Causal Encoder-Decoder:40 層 Transformer を 20 層の因果エンコーダと 20 層のデコーダに分ける。カードはデコーダのグローバル KV をエンコーダから投影すると書き、プリフィルは 8B 活性化のままです。
  • CSA2 と FP4 メイン KV:Compressed Sparse Attention 2。層は Full / Reindex / Reuse。FP4 メイン KV と合わせてグローバル KV はトークンあたり 890 バイト、V4-Flash の約 1/4。
  • 画像とテキストをネイティブに:DeepSeek-ViT と 2 層 MLP プロジェクタ。45T のマルチモーダルトークンでゼロから学習し、34T 時点でコンテキストを 1M に伸ばしています。
  • 推論の強さを整数でreasoning_effort は 1 から 100。下記の Instruct スコアは 100 です。
  • DSpark と Engram:投機的デコードと、トークン検索の 196B Engram 条件付きメモリ。MoE は共有 1、ルーテッド 384、活性ルーテッド 6。

制限:2026-09-10 のカードに API 単価はありません。V4-Flash の $0.14/$0.28 をここに写さないでください。307 likes は当日の熱量であり監査ではありません。公式のエージェントスコアは最大努力、temperature=1.0top_p=0.95 です。

モデル仕様

項目 DeepSeek-V4.1-Flash(カード、2026-09-10)
バックボーン / 活性化 552B / プリフィル 8B、デコード 16B
コンテキスト 1M トークン
サンプリング temperature 1.0、topp 0.95 または 1.0、maxtokens は 256K 以上
ライセンス MIT
重み deepseek-ai/DeepSeek-V4.1-Flash

料金

部分 価格 2026-09-10 の第一者ページ
重み $0 Hugging Face 上の MIT。
API カード未掲載 引用する前に deepseek.comchat.deepseek.com を確認。

公式エージェントスコア(最大努力)

カード掲載。第三者ラボではありません。

  • Terminal Bench 2.1:90.6(V4-Flash は 82.7)
  • DeepSWE v1.1:74.2
  • AutomationBench:54.8
  • Agent's Last Exam:31.8

はじめに

  1. モデルカード と同梱の encoding/ README を読む。このリリースに Jinja チャットテンプレートはありません。
  2. vLLM:vllm serve deepseek-ai/DeepSeek-V4.1-Flash。SGLang:python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V4.1-Flash
  3. 本番のプロンプト符号化はカードが deepseek-recipe を指します。
  4. 投稿に出たハーネスが欲しいなら DeepSeek Harness を開く。

第一者資料:同じリポジトリの 技術レポート PDF

よくある質問

V4-Flash の更新ですか、別モデルですか?

別アーキテクチャです。V4-Flash は 284B/13B。V4.1-Flash は 552B、活性化 8B/16B、KV はより小さいです。

ノート PC で動きますか?

カードは vLLM、SGLang、Docker を挙げます。552B MoE はノートの既定ではありません。量子化か API を使い、VRAM は自分で測ってください。

V4-Pro の後継ですか?

カードはスコア比較だけです。V4-Pro 撤退とは書いていません。r/LocalLLaMA の「ソフト退役」は DeepSeek が書くまでコミュニティの話です。

代替案

  • DeepSeek V4 Flash:API 価格が公開済みの 284B/13B MIT エージェントモデル。
  • DeepSeek Harness:このチェックポイントの訓練と採点に使ったランタイム。
  • mlx-serve:552B をホストしないときの Apple Silicon ローカル。

ヒント

  1. MIT、552B、8B/16B、トークンあたり 890 バイト、1M コンテキストは 2026-09-10 のカードから引用する。
  2. API のドルは DeepSeek が出すまで空欄。
  3. reasoning_effort は 1–100 の整数。V4-Flash の low/high/max は使わない。

まとめ

DeepSeek-V4.1-Flash は 2026 年 9 月 10 日の MIT マルチモーダル Flash です。KV は小さく、視覚はネイティブ、公式エージェントスコアは V4-Flash より上。Hugging Face のカード から始めてください。公開済み単価の前世代が必要なら DeepSeek V4 Flash に残ってください。

コメント

まだコメントがありません。最初のコメントを投稿してください!