DFlash 2
DFlash 2 は Inco AI が 2026 年 8 月 18 日に出した DFlash の更新で、推測デコード用のブロック拡散ドラフトモデルです。単独のチャットモデルではありません。小さなドラフタが 1 パスでブロック全体を提案し、ターゲットモデルがまとめて検証します。貪欲デコードはターゲットと完全一致。サンプリングはターゲット分布を保ちます。一次情報は inco.ai/blog/dflash2。重みは huggingface.co/collections/incoai/dflash-2 と z-lab ミラー。Qwen3.8-27B ドラフタのカードは Apache 2.0。パラメータは Qwen3.8-27B 用が約 20 億、Muse Glimmer 用が約 30 億です。
r/LocalLLaMA は当日これをニュースとして扱いました。Qwen3.8-27B と Muse Glimmer の 2 本、それに vLLM と llama.cpp の実測報告。このページの出所です。
主な機能
- 1 パスでブロック全体を起草: ブロック内の各位置を並列に予測します。トークン単位の自己回帰ドラフトではありません。
- パス選択器: 各位置の上位 16 候補を残し、隣接ペアを採点してブロックを一貫させます。Inco は Qwen3-4B GSM8K 設定で選択器を約 +200 万パラメータ、サイクル遅延 +0.6% と報告しています。
- 局所畳み込み: 2 タップ動的畳み込みで末尾減衰を抑え、15 層バックボーンを不要にします。Inco はこの部分を約 +3% パラメータ、サイクル遅延 +0.7% と報告しています。
- ロスレス検証: 残るトークンはターゲットのトークンです。
- 公開当日のエンジン: ブログは SGLang、vLLM の PR、llama.cpp の PR、oMLX ビルドを挙げています。本番固定の前に PR 番号を再確認してください。
再確認した仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 役割 | ドラフト専用 | Qwen3.8-27B-DFlash2 カード |
| Qwen3.8-27B ドラフタ | 約 20 億、Apache 2.0 | 同上 |
| Muse Glimmer ドラフタ | 約 30 億 | Muse-Glimmer-30B-DFlash2 |
| 平均受理長(Qwen3.8-27B) | MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 | Inco 表、ブロックサイズ 8 |
| バッチ 1 の AR 比スループット(Qwen3.8-27B) | GSM8K、MATH-500、HumanEval、MBPP、MT-Bench で 2.67x〜3.43x | 同上、H200 1 枚、SGLang |
| ソフト価格 | $0 | Apache 2.0 重み |
速度比はベンダーが H200 1 枚で測ったものです。こちらでは再実行していません。
使う場面
- 手元の Qwen3.8-27B: 答えは変えず、検証 1 回あたりのトークンを増やしたい。
- Muse Glimmer のサーブ: Meta 同梱の初代 DFlash ドラフタを置き換える。
- エージェントの長いループ: ツール呼び出しがデコード時間を食う。DFlash 2 が狙うのはその請求であり、チャット UI ではありません。
制約: エンジンに DFLASH / draft-dflash 経路が無いと重みは使えません。ブログの vLLM は PR 52816、llama.cpp は PR 27342 で、どちらも動いています。
料金
重みは無料です。払うのは GPU とターゲットモデルです。ブログに Inco の SaaS 席はありません。安価なデコードを買いたいなら DeepSeek V4 Flash の API を見てください。DFlash 2 に月額を捏造しないでください。
はじめに
- DFlash 2: Keep Drafting Parallel を読む。
Qwen/Qwen3.8-27Bとincoai/Qwen3.8-27B-DFlash2を取る。- SGLang を
--speculative-algorithm DFLASHと--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2で起動する。 - H200 の表を信じる前に、自分のプロンプトで受理長を測る。
よくある質問
DFlash 2 単体で話せますか?
いいえ。カードはスタンドアロン言語モデルではないと書いています。
Qwen3.8-27B の答えは変わりますか?
貪欲デコードは完全一致。サンプリングは Inco の説明では分布を保ちます。
DSpark と同じですか?
違います。DSpark は別のコミュニティドラフタです。Inco の Qwen3.8-27B 表では DFlash 2 の受理長が MTP と DSpark を上回ります。
代替
- Qwen3.8-27B の MTP: 追加ドラフタなし。Inco 表では受理長は低い。
- Muse Glimmer 公式 DFlash: Meta の初代。DFlash 2 がその更新。
- DeepSeek V4 Flash: 27B を自分で回したくないならトークンを買う。
コツ
- 公開表に合わせるならブロックサイズ 8(ドラフト 7 トークン)から。
- インストールスクリプトを書く前に vLLM / llama.cpp の PR 番号を再確認する。
- 「DFlash 系列が 2026 年 8 月時点で 350 万ダウンロード」を DFlash 2 単体の数字として書かない。
まとめ
すでに Qwen3.8-27B か Muse Glimmer を回しているなら、DFlash 2 は LocalLLaMA がその日待っていたドラフタです。ターゲットとドラフタをセットで入れ、自分で測ってください。欲しいのがチャットモデルなら Qwen のページを開いてください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Qwen3.8-27B
qwen.ai
Alibaba のオープンウェイト 27B デンスモデル。Qwen3.8-Max のコンパニオンとして Apache 2.0 で公開。画像・テキストのマルチモーダル入力に対応し、ローカル運用と小規模バッチ推論向け。
LFM 2.5-2.6B
www.liquid.ai
Liquid AI がオンデバイスのエージェントワークロード向けに訓練したオープンウェイト 2.6B デンスモデル。128K コンテキストとネイティブなツール呼び出しに対応。
MythoMax 13B
huggingface.co/Gryphe/MythoMax-L2-13b
以前の MythoMax 13B スナップショット。再確認:leftover Llama 2 ファインチューンカード。2026年のフロンティア既定ではない。
関連インサイト
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。