DFlash 2 logo

DFlash 2

開く

Inco AI の Apache 2.0 ブロック拡散ドラフトモデル。推測デコード用。2026-08-18 に Qwen3.8-27B と Muse Glimmer 向けを公開。

共有:

DFlash 2

DFlash 2 は Inco AI が 2026 年 8 月 18 日に出した DFlash の更新で、推測デコード用のブロック拡散ドラフトモデルです。単独のチャットモデルではありません。小さなドラフタが 1 パスでブロック全体を提案し、ターゲットモデルがまとめて検証します。貪欲デコードはターゲットと完全一致。サンプリングはターゲット分布を保ちます。一次情報は inco.ai/blog/dflash2。重みは huggingface.co/collections/incoai/dflash-2z-lab ミラー。Qwen3.8-27B ドラフタのカードは Apache 2.0。パラメータは Qwen3.8-27B 用が約 20 億、Muse Glimmer 用が約 30 億です。

r/LocalLLaMA は当日これをニュースとして扱いました。Qwen3.8-27B と Muse Glimmer の 2 本、それに vLLM と llama.cpp の実測報告。このページの出所です。

主な機能

  • 1 パスでブロック全体を起草: ブロック内の各位置を並列に予測します。トークン単位の自己回帰ドラフトではありません。
  • パス選択器: 各位置の上位 16 候補を残し、隣接ペアを採点してブロックを一貫させます。Inco は Qwen3-4B GSM8K 設定で選択器を約 +200 万パラメータ、サイクル遅延 +0.6% と報告しています。
  • 局所畳み込み: 2 タップ動的畳み込みで末尾減衰を抑え、15 層バックボーンを不要にします。Inco はこの部分を約 +3% パラメータ、サイクル遅延 +0.7% と報告しています。
  • ロスレス検証: 残るトークンはターゲットのトークンです。
  • 公開当日のエンジン: ブログは SGLang、vLLM の PR、llama.cpp の PR、oMLX ビルドを挙げています。本番固定の前に PR 番号を再確認してください。

再確認した仕様

項目 出典
役割 ドラフト専用 Qwen3.8-27B-DFlash2 カード
Qwen3.8-27B ドラフタ 約 20 億、Apache 2.0 同上
Muse Glimmer ドラフタ 約 30 億 Muse-Glimmer-30B-DFlash2
平均受理長(Qwen3.8-27B) MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 Inco 表、ブロックサイズ 8
バッチ 1 の AR 比スループット(Qwen3.8-27B) GSM8K、MATH-500、HumanEval、MBPP、MT-Bench で 2.67x〜3.43x 同上、H200 1 枚、SGLang
ソフト価格 $0 Apache 2.0 重み

速度比はベンダーが H200 1 枚で測ったものです。こちらでは再実行していません。

使う場面

  • 手元の Qwen3.8-27B: 答えは変えず、検証 1 回あたりのトークンを増やしたい。
  • Muse Glimmer のサーブ: Meta 同梱の初代 DFlash ドラフタを置き換える。
  • エージェントの長いループ: ツール呼び出しがデコード時間を食う。DFlash 2 が狙うのはその請求であり、チャット UI ではありません。

制約: エンジンに DFLASH / draft-dflash 経路が無いと重みは使えません。ブログの vLLM は PR 52816、llama.cpp は PR 27342 で、どちらも動いています。

料金

重みは無料です。払うのは GPU とターゲットモデルです。ブログに Inco の SaaS 席はありません。安価なデコードを買いたいなら DeepSeek V4 Flash の API を見てください。DFlash 2 に月額を捏造しないでください。

はじめに

  1. DFlash 2: Keep Drafting Parallel を読む。
  2. Qwen/Qwen3.8-27Bincoai/Qwen3.8-27B-DFlash2 を取る。
  3. SGLang を --speculative-algorithm DFLASH--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 で起動する。
  4. H200 の表を信じる前に、自分のプロンプトで受理長を測る。

よくある質問

DFlash 2 単体で話せますか?

いいえ。カードはスタンドアロン言語モデルではないと書いています。

Qwen3.8-27B の答えは変わりますか?

貪欲デコードは完全一致。サンプリングは Inco の説明では分布を保ちます。

DSpark と同じですか?

違います。DSpark は別のコミュニティドラフタです。Inco の Qwen3.8-27B 表では DFlash 2 の受理長が MTP と DSpark を上回ります。

代替

  • Qwen3.8-27B の MTP: 追加ドラフタなし。Inco 表では受理長は低い。
  • Muse Glimmer 公式 DFlash: Meta の初代。DFlash 2 がその更新。
  • DeepSeek V4 Flash: 27B を自分で回したくないならトークンを買う。

コツ

  1. 公開表に合わせるならブロックサイズ 8(ドラフト 7 トークン)から。
  2. インストールスクリプトを書く前に vLLM / llama.cpp の PR 番号を再確認する。
  3. 「DFlash 系列が 2026 年 8 月時点で 350 万ダウンロード」を DFlash 2 単体の数字として書かない。

まとめ

すでに Qwen3.8-27B か Muse Glimmer を回しているなら、DFlash 2 は LocalLLaMA がその日待っていたドラフタです。ターゲットとドラフタをセットで入れ、自分で測ってください。欲しいのがチャットモデルなら Qwen のページを開いてください。

コメント

まだコメントがありません。最初のコメントを投稿してください!