DFlash 2
DFlash 2 是 Inco AI 在 2026 年 8 月 18 日发布的 DFlash 升级版:用块扩散草稿模型做推测解码。它不是独立聊天模型。小草稿模型一次前向猜一整块 token,目标模型再整块校验。贪心解码与目标模型完全一致;采样则保持目标分布。官方说明:inco.ai/blog/dflash2。权重在 huggingface.co/collections/incoai/dflash-2,另有 z-lab 镜像。Qwen3.8-27B 草稿卡上的协议是 Apache 2.0。Qwen3.8-27B 草稿大约 20 亿参数,Muse Glimmer 草稿大约 30 亿。
r/LocalLLaMA 当天就把 DFlash 2 当成新闻:Qwen3.8-27B 和 Muse Glimmer 两套权重,还有人拿 vLLM、llama.cpp 实测。本页来自这条热帖。
核心功能
- 一次前向起草整块:块内每个位置并行预测,不再一个 token 一个 token 草稿。
- 路径选择器:每个位置保留 top 16 候选,给相邻对打分,让整块连贯。Inco 在 Qwen3-4B GSM8K 设定下报告选择器大约 +200 万参数、周期延迟 +0.6%。
- 局部卷积:两拍动态卷积压后缀衰减,不必上 15 层骨干。Inco 报告这部分大约 +3% 参数、周期延迟 +0.7%。
- 无损校验:留下的 token 就是目标模型的 token。
- 当天能跑的引擎:博客写了 SGLang、vLLM PR、llama.cpp PR,以及 oMLX 构建。上生产前请再核对 PR 号。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 角色 | 仅草稿模型 | Qwen3.8-27B-DFlash2 模型卡 |
| Qwen3.8-27B 草稿 | 约 20 亿,Apache 2.0 | 同上 |
| Muse Glimmer 草稿 | 约 30 亿 | Muse-Glimmer-30B-DFlash2 |
| 平均接受长度(Qwen3.8-27B) | MTP 4.28 / DSpark 3.62 / DFlash 2 4.80 | Inco 表,块大小 8 |
| 单请求吞吐相对自回归(Qwen3.8-27B) | GSM8K、MATH-500、HumanEval、MBPP、MT-Bench 上 2.67x–3.43x | 同上,1×H200,SGLang |
| 软件价格 | $0 | Apache 2.0 权重 |
加速比是厂商在一张 H200 上测的。我们没有复现。
适用场景
- 本地跑 Qwen3.8-27B:不想改答案,只想每次校验多吐几个 token。
- 伺候 Muse Glimmer:替换 Meta 随模型带的第一代 DFlash 草稿。
- Agent 长循环:工具调用把解码时间烧穿。DFlash 2 冲的是这张账单,不是聊天框。
限制:引擎若还没有 DFLASH / draft-dflash 路径,权重放着没用。博客里的 vLLM 是 PR 52816,llama.cpp 是 PR 27342,都还在动。
定价
权重免费。你付的是 GPU 和目标模型。博客没有列出 Inco SaaS 席位。若只想买便宜解码,去看 DeepSeek V4 Flash 的 API 价,不要给 DFlash 2 编一个月费。
快速开始
- 读 DFlash 2: Keep Drafting Parallel。
- 下载
Qwen/Qwen3.8-27B和incoai/Qwen3.8-27B-DFlash2。 - 用 SGLang 启动,加上
--speculative-algorithm DFLASH和--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2。 - 先在自己的提示词上测接受长度,再信 H200 那张表。
常见问题
能单独拿 DFlash 2 聊天吗?
不能。模型卡写明它不是独立语言模型。
会改 Qwen3.8-27B 的答案吗?
贪心解码完全一致。采样按 Inco 的说法保持目标分布。
和 DSpark 是一回事吗?
不是。DSpark 是另一套社区草稿。Inco 的 Qwen3.8-27B 表上,DFlash 2 的接受长度高于 MTP 和 DSpark。
替代方案
- Qwen3.8-27B 自带 MTP:不用额外草稿,Inco 表上接受长度更低。
- Muse Glimmer 官方 DFlash:Meta 的第一代草稿;DFlash 2 是升级。
- DeepSeek V4 Flash:不想本地伺候 27B,直接买 token。
使用技巧
- 先用块大小 8(每次 7 个草稿 token),才能和公开表对齐。
- 写安装脚本前再核对 vLLM / llama.cpp 的 PR 号。
- 不要把「DFlash 系列截至 2026 年 8 月下载超过 350 万」写成 DFlash 2 自己的指标。
总结
如果你已经在伺候 Qwen3.8-27B 或 Muse Glimmer,DFlash 2 就是 LocalLLaMA 那天在等的草稿。目标和草稿一起装,自己测。若你要的是聊天模型,去开 Qwen 那页。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3.8-27B
qwen.ai
阿里巴巴开源的 27B 稠密模型,Qwen3.8-Max 的配套稠密版本,Apache 2.0 协议,支持图文多模态输入,面向本地部署与小批量推理。
LFM 2.5-2.6B
www.liquid.ai
Liquid AI 专为端侧智能体负载训练的 2.6B 开源权重稠密模型,支持 128K 上下文与原生工具调用。
MythoMax 13B
huggingface.co/Gryphe/MythoMax-L2-13b
上一代 MythoMax 13B 快照。复核:leftover Llama 2 微调卡,不是 2026 前沿默认。旧的最高性能 / 最受欢迎王冠不当普查。
相关洞察
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。