DFlash 2
DFlash 2 は Inco AI が 2026 年 8 月 18 日に出した DFlash の更新で、推測デコード用のブロック拡散ドラフトモデルです。単独のチャットモデルではありません。小さなドラフタが 1 パスでブロック全体を提案し、ターゲットモデルがまとめて検証します。貪欲デコードはターゲットと完全一致。サンプリングはターゲット分布を保ちます。一次情報は inco.ai/blog/dflash2。重みは huggingface.co/collections/incoai/dflash-2 と z-lab ミラー。Qwen3.8-27B ドラフタのカードは Apache 2.0。パラメータは Qwen3.8-27B 用が約 20 億、Muse Glimmer 用が約 30 億です。
r/LocalLLaMA は当日これをニュースとして扱いました。Qwen3.8-27B と Muse Glimmer の 2 本、それに vLLM と llama.cpp の実測報告。このページの出所です。
主な機能
- 1 パスでブロック全体を起草: ブロック内の各位置を並列に予測します。トークン単位の自己回帰ドラフトではありません。
- パス選択器: 各位置の上位 16 候補を残し、隣接ペアを採点してブロックを一貫させます。Inco は Qwen3-4B GSM8K 設定で選択器を約 +200 万パラメータ、サイクル遅延 +0.6% と報告しています。
- 局所畳み込み: 2 タップ動的畳み込みで末尾減衰を抑え、15 層バックボーンを不要にします。Inco はこの部分を約 +3% パラメータ、サイクル遅延 +0.7% と報告しています。
- ロスレス検証: 残るトークンはターゲットのトークンです。
- 公開当日のエンジン: ブログは SGLang、vLLM の PR、llama.cpp の PR、oMLX ビルドを挙げています。本番固定の前に PR 番号を再確認してください。
再確認した仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 役割 | ドラフト専用 | Qwen3.8-27B-DFlash2 カード |
| Qwen3.8-27B ドラフタ | 約 20 億、Apache 2.0 | 同上 |
| Muse Glimmer ドラフタ | 約 30 億 | Muse-Glimmer-30B-DFlash2 |
| 平均受理長(Qwen3.8-27B) | MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 | Inco 表、ブロックサイズ 8 |
| バッチ 1 の AR 比スループット(Qwen3.8-27B) | GSM8K、MATH-500、HumanEval、MBPP、MT-Bench で 2.67x〜3.43x | 同上、H200 1 枚、SGLang |
| ソフト価格 | $0 | Apache 2.0 重み |
速度比はベンダーが H200 1 枚で測ったものです。こちらでは再実行していません。
使う場面
- 手元の Qwen3.8-27B: 答えは変えず、検証 1 回あたりのトークンを増やしたい。
- Muse Glimmer のサーブ: Meta 同梱の初代 DFlash ドラフタを置き換える。
- エージェントの長いループ: ツール呼び出しがデコード時間を食う。DFlash 2 が狙うのはその請求であり、チャット UI ではありません。
制約: エンジンに DFLASH / draft-dflash 経路が無いと重みは使えません。ブログの vLLM は PR 52816、llama.cpp は PR 27342 で、どちらも動いています。
料金
重みは無料です。払うのは GPU とターゲットモデルです。ブログに Inco の SaaS 席はありません。安価なデコードを買いたいなら DeepSeek V4 Flash の API を見てください。DFlash 2 に月額を捏造しないでください。
はじめに
- DFlash 2: Keep Drafting Parallel を読む。
Qwen/Qwen3.8-27Bとincoai/Qwen3.8-27B-DFlash2を取る。- SGLang を
--speculative-algorithm DFLASHと--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2で起動する。 - H200 の表を信じる前に、自分のプロンプトで受理長を測る。
よくある質問
DFlash 2 単体で話せますか?
いいえ。カードはスタンドアロン言語モデルではないと書いています。
Qwen3.8-27B の答えは変わりますか?
貪欲デコードは完全一致。サンプリングは Inco の説明では分布を保ちます。
DSpark と同じですか?
違います。DSpark は別のコミュニティドラフタです。Inco の Qwen3.8-27B 表では DFlash 2 の受理長が MTP と DSpark を上回ります。
代替
- Qwen3.8-27B の MTP: 追加ドラフタなし。Inco 表では受理長は低い。
- Muse Glimmer 公式 DFlash: Meta の初代。DFlash 2 がその更新。
- DeepSeek V4 Flash: 27B を自分で回したくないならトークンを買う。
コツ
- 公開表に合わせるならブロックサイズ 8(ドラフト 7 トークン)から。
- インストールスクリプトを書く前に vLLM / llama.cpp の PR 番号を再確認する。
- 「DFlash 系列が 2026 年 8 月時点で 350 万ダウンロード」を DFlash 2 単体の数字として書かない。
まとめ
すでに Qwen3.8-27B か Muse Glimmer を回しているなら、DFlash 2 は LocalLLaMA がその日待っていたドラフタです。ターゲットとドラフタをセットで入れ、自分で測ってください。欲しいのがチャットモデルなら Qwen のページを開いてください。
使用シナリオ
- DFlash 2 が自分のワークフローをカバーするか先に確認したい場合。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
ChatGPT の Codex 枠が足りない?Codex 内で DeepSeek や Grok に切り替える
Codex Router なら、いつもの Codex 作業環境で DeepSeek や Grok などを使える。仕組み、利用枠、ネットワーク条件をやさしく説明する。
Codex でどんなモデルも使える:magpie があれば Codex Router はいらない
無料でオープンソースのメニューバーアプリ magpie は、ローカルにゲートウェイを立てて OpenRouter や DeepSeek、さらに ChatGPT・Claude・Cursor・Grok・Copilot のサブスクリプションまで、Codex 本来のモデル選択画面にそのまま並べる。Codex Router は不要になる。

Obsidian CLI + Codex:VaultをAgentの知識エンジンに変える
Obsidian CLIを使うと、Codex、Claude Code、Gemini CLIなどのAgentがローカルVaultを検索可能、監査可能、リンク対応の形で操作できます。実際のコミュニティ事例と再現可能な手順で解説します。