DFlash 2
DFlash 2 是 Inco AI 在 2026 年 8 月 18 日发布的 DFlash 升级版:用块扩散草稿模型做推测解码。它不是独立聊天模型。小草稿模型一次前向猜一整块 token,目标模型再整块校验。贪心解码与目标模型完全一致;采样则保持目标分布。官方说明:inco.ai/blog/dflash2。权重在 huggingface.co/collections/incoai/dflash-2,另有 z-lab 镜像。Qwen3.8-27B 草稿卡上的协议是 Apache 2.0。Qwen3.8-27B 草稿大约 20 亿参数,Muse Glimmer 草稿大约 30 亿。
r/LocalLLaMA 当天就把 DFlash 2 当成新闻:Qwen3.8-27B 和 Muse Glimmer 两套权重,还有人拿 vLLM、llama.cpp 实测。本页来自这条热帖。
核心功能
- 一次前向起草整块:块内每个位置并行预测,不再一个 token 一个 token 草稿。
- 路径选择器:每个位置保留 top 16 候选,给相邻对打分,让整块连贯。Inco 在 Qwen3-4B GSM8K 设定下报告选择器大约 +200 万参数、周期延迟 +0.6%。
- 局部卷积:两拍动态卷积压后缀衰减,不必上 15 层骨干。Inco 报告这部分大约 +3% 参数、周期延迟 +0.7%。
- 无损校验:留下的 token 就是目标模型的 token。
- 当天能跑的引擎:博客写了 SGLang、vLLM PR、llama.cpp PR,以及 oMLX 构建。上生产前请再核对 PR 号。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 角色 | 仅草稿模型 | Qwen3.8-27B-DFlash2 模型卡 |
| Qwen3.8-27B 草稿 | 约 20 亿,Apache 2.0 | 同上 |
| Muse Glimmer 草稿 | 约 30 亿 | Muse-Glimmer-30B-DFlash2 |
| 平均接受长度(Qwen3.8-27B) | MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 | Inco 表,块大小 8 |
| 单请求吞吐相对自回归(Qwen3.8-27B) | GSM8K、MATH-500、HumanEval、MBPP、MT-Bench 上 2.67x–3.43x | 同上,1×H200,SGLang |
| 软件价格 | $0 | Apache 2.0 权重 |
加速比是厂商在一张 H200 上测的。我们没有复现。
适用场景
- 本地跑 Qwen3.8-27B:不想改答案,只想每次校验多吐几个 token。
- 伺候 Muse Glimmer:替换 Meta 随模型带的第一代 DFlash 草稿。
- Agent 长循环:工具调用把解码时间烧穿。DFlash 2 冲的是这张账单,不是聊天框。
限制:引擎若还没有 DFLASH / draft-dflash 路径,权重放着没用。博客里的 vLLM 是 PR 52816,llama.cpp 是 PR 27342,都还在动。
定价
权重免费。你付的是 GPU 和目标模型。博客没有列出 Inco SaaS 席位。若只想买便宜解码,去看 DeepSeek V4 Flash 的 API 价,不要给 DFlash 2 编一个月费。
快速开始
- 读 DFlash 2: Keep Drafting Parallel。
- 下载
Qwen/Qwen3.8-27B和incoai/Qwen3.8-27B-DFlash2。 - 用 SGLang 启动,加上
--speculative-algorithm DFLASH和--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2。 - 先在自己的提示词上测接受长度,再信 H200 那张表。
常见问题
能单独拿 DFlash 2 聊天吗?
不能。模型卡写明它不是独立语言模型。
会改 Qwen3.8-27B 的答案吗?
贪心解码完全一致。采样按 Inco 的说法保持目标分布。
和 DSpark 是一回事吗?
不是。DSpark 是另一套社区草稿。Inco 的 Qwen3.8-27B 表上,DFlash 2 的接受长度高于 MTP 和 DSpark。
替代方案
- Qwen3.8-27B 自带 MTP:不用额外草稿,Inco 表上接受长度更低。
- Muse Glimmer 官方 DFlash:Meta 的第一代草稿;DFlash 2 是升级。
- DeepSeek V4 Flash:不想本地伺候 27B,直接买 token。
使用技巧
- 先用块大小 8(每次 7 个草稿 token),才能和公开表对齐。
- 写安装脚本前再核对 vLLM / llama.cpp 的 PR 号。
- 不要把「DFlash 系列截至 2026 年 8 月下载超过 350 万」写成 DFlash 2 自己的指标。
总结
如果你已经在伺候 Qwen3.8-27B 或 Muse Glimmer,DFlash 2 就是 LocalLLaMA 那天在等的草稿。目标和草稿一起装,自己测。若你要的是聊天模型,去开 Qwen 那页。
评论
还没有评论。成为第一个评论的人!
相关工具
Ling-3.0-flash
huggingface.co/inclusionAI/Ling-3.0-flash
inclusionAI 的 MIT 混合线性 MoE:总参 124B,激活 5.1B。2026-08-21 在 Hugging Face 复核。
Qwen3.8-27B
qwen.ai
阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。
LFM 2.5-2.6B
www.liquid.ai
Liquid AI 专为端侧智能体负载训练的 2.6B 开源权重稠密模型,支持 128K 上下文与原生工具调用。
相关洞察
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。