DeepSeek-V4.1-Flash は DeepSeek が 2026-09-10 に出したマルチモーダル MoE です。Hugging Face のカード は MIT、バックボーン 552B、プリフィル活性化 8B・デコード活性化 16B、コンテキスト 1M。同日の likes は約 307。X の「おすすめ」には Tianyi Cui の DeepSeek Harness v0.1.5 投稿があり、このモデルがそのハーネス向けに訓練されたと書いてあります。同じ日の r/LocalLLaMA hot はカード(約 211 票)と WeChat 経由の紹介を載せました。
284B/13B の前世代なら DeepSeek V4 Flash、採点に使ったエージェントループなら DeepSeek Harness、Mac のローカルサーバだけなら mlx-serve を見てください。
主な機能
- Causal Encoder-Decoder:40 層 Transformer を 20 層の因果エンコーダと 20 層のデコーダに分ける。カードはデコーダのグローバル KV をエンコーダから投影すると書き、プリフィルは 8B 活性化のままです。
- CSA2 と FP4 メイン KV:Compressed Sparse Attention 2。層は Full / Reindex / Reuse。FP4 メイン KV と合わせてグローバル KV はトークンあたり 890 バイト、V4-Flash の約 1/4。
- 画像とテキストをネイティブに:DeepSeek-ViT と 2 層 MLP プロジェクタ。45T のマルチモーダルトークンでゼロから学習し、34T 時点でコンテキストを 1M に伸ばしています。
- 推論の強さを整数で:
reasoning_effortは 1 から 100。下記の Instruct スコアは 100 です。 - DSpark と Engram:投機的デコードと、トークン検索の 196B Engram 条件付きメモリ。MoE は共有 1、ルーテッド 384、活性ルーテッド 6。
制限:2026-09-10 のカードに API 単価はありません。V4-Flash の $0.14/$0.28 をここに写さないでください。307 likes は当日の熱量であり監査ではありません。公式のエージェントスコアは最大努力、temperature=1.0、top_p=0.95 です。
モデル仕様
| 項目 | DeepSeek-V4.1-Flash(カード、2026-09-10) |
|---|---|
| バックボーン / 活性化 | 552B / プリフィル 8B、デコード 16B |
| コンテキスト | 1M トークン |
| サンプリング | temperature 1.0、topp 0.95 または 1.0、maxtokens は 256K 以上 |
| ライセンス | MIT |
| 重み | deepseek-ai/DeepSeek-V4.1-Flash |
料金
| 部分 | 価格 | 2026-09-10 の第一者ページ |
|---|---|---|
| 重み | $0 | Hugging Face 上の MIT。 |
| API | カード未掲載 | 引用する前に deepseek.com か chat.deepseek.com を確認。 |
公式エージェントスコア(最大努力)
カード掲載。第三者ラボではありません。
- Terminal Bench 2.1:90.6(V4-Flash は 82.7)
- DeepSWE v1.1:74.2
- AutomationBench:54.8
- Agent's Last Exam:31.8
はじめに
- モデルカード と同梱の
encoding/README を読む。このリリースに Jinja チャットテンプレートはありません。 - vLLM:
vllm serve deepseek-ai/DeepSeek-V4.1-Flash。SGLang:python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V4.1-Flash。 - 本番のプロンプト符号化はカードが deepseek-recipe を指します。
- 投稿に出たハーネスが欲しいなら DeepSeek Harness を開く。
第一者資料:同じリポジトリの 技術レポート PDF。
よくある質問
V4-Flash の更新ですか、別モデルですか?
別アーキテクチャです。V4-Flash は 284B/13B。V4.1-Flash は 552B、活性化 8B/16B、KV はより小さいです。
ノート PC で動きますか?
カードは vLLM、SGLang、Docker を挙げます。552B MoE はノートの既定ではありません。量子化か API を使い、VRAM は自分で測ってください。
V4-Pro の後継ですか?
カードはスコア比較だけです。V4-Pro 撤退とは書いていません。r/LocalLLaMA の「ソフト退役」は DeepSeek が書くまでコミュニティの話です。
代替案
- DeepSeek V4 Flash:API 価格が公開済みの 284B/13B MIT エージェントモデル。
- DeepSeek Harness:このチェックポイントの訓練と採点に使ったランタイム。
- mlx-serve:552B をホストしないときの Apple Silicon ローカル。
ヒント
- MIT、552B、8B/16B、トークンあたり 890 バイト、1M コンテキストは 2026-09-10 のカードから引用する。
- API のドルは DeepSeek が出すまで空欄。
reasoning_effortは 1–100 の整数。V4-Flash の low/high/max は使わない。
まとめ
DeepSeek-V4.1-Flash は 2026 年 9 月 10 日の MIT マルチモーダル Flash です。KV は小さく、視覚はネイティブ、公式エージェントスコアは V4-Flash より上。Hugging Face のカード から始めてください。公開済み単価の前世代が必要なら DeepSeek V4 Flash に残ってください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。