DFlash 2 logo

DFlash 2

打开

Inco AI 的 Apache 2.0 块扩散推测解码草稿模型。2026-08-18 发布,覆盖 Qwen3.8-27B 与 Muse Glimmer。

分享:

DFlash 2

DFlash 2 是 Inco AI 在 2026 年 8 月 18 日发布的 DFlash 升级版:用块扩散草稿模型做推测解码。它不是独立聊天模型。小草稿模型一次前向猜一整块 token,目标模型再整块校验。贪心解码与目标模型完全一致;采样则保持目标分布。官方说明:inco.ai/blog/dflash2。权重在 huggingface.co/collections/incoai/dflash-2,另有 z-lab 镜像。Qwen3.8-27B 草稿卡上的协议是 Apache 2.0。Qwen3.8-27B 草稿大约 20 亿参数,Muse Glimmer 草稿大约 30 亿

r/LocalLLaMA 当天就把 DFlash 2 当成新闻:Qwen3.8-27B 和 Muse Glimmer 两套权重,还有人拿 vLLM、llama.cpp 实测。本页来自这条热帖。

核心功能

  • 一次前向起草整块:块内每个位置并行预测,不再一个 token 一个 token 草稿。
  • 路径选择器:每个位置保留 top 16 候选,给相邻对打分,让整块连贯。Inco 在 Qwen3-4B GSM8K 设定下报告选择器大约 +200 万参数、周期延迟 +0.6%
  • 局部卷积:两拍动态卷积压后缀衰减,不必上 15 层骨干。Inco 报告这部分大约 +3% 参数、周期延迟 +0.7%
  • 无损校验:留下的 token 就是目标模型的 token。
  • 当天能跑的引擎:博客写了 SGLang、vLLM PR、llama.cpp PR,以及 oMLX 构建。上生产前请再核对 PR 号。

复核过的规格

项目 数值 来源
角色 仅草稿模型 Qwen3.8-27B-DFlash2 模型卡
Qwen3.8-27B 草稿 约 20 亿,Apache 2.0 同上
Muse Glimmer 草稿 约 30 亿 Muse-Glimmer-30B-DFlash2
平均接受长度(Qwen3.8-27B) MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 Inco 表,块大小 8
单请求吞吐相对自回归(Qwen3.8-27B) GSM8K、MATH-500、HumanEval、MBPP、MT-Bench 上 2.67x–3.43x 同上,1×H200,SGLang
软件价格 $0 Apache 2.0 权重

加速比是厂商在一张 H200 上测的。我们没有复现。

适用场景

  • 本地跑 Qwen3.8-27B:不想改答案,只想每次校验多吐几个 token。
  • 伺候 Muse Glimmer:替换 Meta 随模型带的第一代 DFlash 草稿。
  • Agent 长循环:工具调用把解码时间烧穿。DFlash 2 冲的是这张账单,不是聊天框。

限制:引擎若还没有 DFLASH / draft-dflash 路径,权重放着没用。博客里的 vLLM 是 PR 52816,llama.cpp 是 PR 27342,都还在动。

定价

权重免费。你付的是 GPU 和目标模型。博客没有列出 Inco SaaS 席位。若只想买便宜解码,去看 DeepSeek V4 Flash 的 API 价,不要给 DFlash 2 编一个月费。

快速开始

  1. DFlash 2: Keep Drafting Parallel
  2. 下载 Qwen/Qwen3.8-27Bincoai/Qwen3.8-27B-DFlash2
  3. 用 SGLang 启动,加上 --speculative-algorithm DFLASH--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2
  4. 先在自己的提示词上测接受长度,再信 H200 那张表。

常见问题

能单独拿 DFlash 2 聊天吗?

不能。模型卡写明它不是独立语言模型。

会改 Qwen3.8-27B 的答案吗?

贪心解码完全一致。采样按 Inco 的说法保持目标分布。

和 DSpark 是一回事吗?

不是。DSpark 是另一套社区草稿。Inco 的 Qwen3.8-27B 表上,DFlash 2 的接受长度高于 MTP 和 DSpark。

替代方案

  • Qwen3.8-27B 自带 MTP:不用额外草稿,Inco 表上接受长度更低。
  • Muse Glimmer 官方 DFlash:Meta 的第一代草稿;DFlash 2 是升级。
  • DeepSeek V4 Flash:不想本地伺候 27B,直接买 token。

使用技巧

  1. 先用块大小 8(每次 7 个草稿 token),才能和公开表对齐。
  2. 写安装脚本前再核对 vLLM / llama.cpp 的 PR 号。
  3. 不要把「DFlash 系列截至 2026 年 8 月下载超过 350 万」写成 DFlash 2 自己的指标。

总结

如果你已经在伺候 Qwen3.8-27B 或 Muse Glimmer,DFlash 2 就是 LocalLLaMA 那天在等的草稿。目标和草稿一起装,自己测。若你要的是聊天模型,去开 Qwen 那页。

评论

还没有评论。成为第一个评论的人!