DFlash 2
DFlash 2 是 Inco AI 在 2026 年 8 月 18 日发布的 DFlash 升级版:用块扩散草稿模型做推测解码。它不是独立聊天模型。小草稿模型一次前向猜一整块 token,目标模型再整块校验。贪心解码与目标模型完全一致;采样则保持目标分布。官方说明:inco.ai/blog/dflash2。权重在 huggingface.co/collections/incoai/dflash-2,另有 z-lab 镜像。Qwen3.8-27B 草稿卡上的协议是 Apache 2.0。Qwen3.8-27B 草稿大约 20 亿参数,Muse Glimmer 草稿大约 30 亿。
r/LocalLLaMA 当天就把 DFlash 2 当成新闻:Qwen3.8-27B 和 Muse Glimmer 两套权重,还有人拿 vLLM、llama.cpp 实测。本页来自这条热帖。
核心功能
- 一次前向起草整块:块内每个位置并行预测,不再一个 token 一个 token 草稿。
- 路径选择器:每个位置保留 top 16 候选,给相邻对打分,让整块连贯。Inco 在 Qwen3-4B GSM8K 设定下报告选择器大约 +200 万参数、周期延迟 +0.6%。
- 局部卷积:两拍动态卷积压后缀衰减,不必上 15 层骨干。Inco 报告这部分大约 +3% 参数、周期延迟 +0.7%。
- 无损校验:留下的 token 就是目标模型的 token。
- 当天能跑的引擎:博客写了 SGLang、vLLM PR、llama.cpp PR,以及 oMLX 构建。上生产前请可对照 PR 号。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 角色 | 仅草稿模型 | Qwen3.8-27B-DFlash2 模型卡 |
| Qwen3.8-27B 草稿 | 约 20 亿,Apache 2.0 | 同上 |
| Muse Glimmer 草稿 | 约 30 亿 | Muse-Glimmer-30B-DFlash2 |
| 平均接受长度(Qwen3.8-27B) | MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 | Inco 表,块大小 8 |
| 单请求吞吐相对自回归(Qwen3.8-27B) | GSM8K、MATH-500、HumanEval、MBPP、MT-Bench 上 2.67x–3.43x | 同上,1×H200,SGLang |
| 软件价格 | $0 | Apache 2.0 权重 |
加速比是厂商在一张 H200 上测的。我们没有复现。
适用场景
- 本地跑 Qwen3.8-27B:不想改答案,只想每次校验多吐几个 token。
- 伺候 Muse Glimmer:替换 Meta 随模型带的第一代 DFlash 草稿。
- Agent 长循环:工具调用把解码时间烧穿。DFlash 2 冲的是这张账单,不是聊天框。
限制:引擎若还没有 DFLASH / draft-dflash 路径,权重放着没用。博客里的 vLLM 是 PR 52816,llama.cpp 是 PR 27342,都还在动。
定价
权重免费。你付的是 GPU 和目标模型。博客没有列出 Inco SaaS 席位。若只想买便宜解码,去看 DeepSeek V4 Flash 的 API 价,不要给 DFlash 2 编一个月费。
快速开始
- 读 DFlash 2: Keep Drafting Parallel。
- 下载
Qwen/Qwen3.8-27B和incoai/Qwen3.8-27B-DFlash2。 - 用 SGLang 启动,加上
--speculative-algorithm DFLASH和--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2。 - 先在自己的提示词上测接受长度,再信 H200 那张表。
常见问题
能单独拿 DFlash 2 聊天吗?
不能。模型卡写明它不是独立语言模型。
会改 Qwen3.8-27B 的答案吗?
贪心解码完全一致。采样按 Inco 的说法保持目标分布。
和 DSpark 是一回事吗?
不是。DSpark 是另一套社区草稿。Inco 的 Qwen3.8-27B 表上,DFlash 2 的接受长度高于 MTP 和 DSpark。
替代方案
- Qwen3.8-27B 自带 MTP:不用额外草稿,Inco 表上接受长度更低。
- Muse Glimmer 官方 DFlash:Meta 的第一代草稿;DFlash 2 是升级。
- DeepSeek V4 Flash:不想本地伺候 27B,直接买 token。
使用技巧
- 先用块大小 8(每次 7 个草稿 token),才能和公开表对齐。
- 写安装脚本前可对照 vLLM / llama.cpp 的 PR 号。
- 不要把「DFlash 系列截至 2026 年 8 月下载超过 350 万」写成 DFlash 2 自己的指标。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。