DeepSeek V4 Flash 0731 是 DeepSeek 小型智能体模型的正式版,于 2026 年 7 月 31 日发布,当天即以 MIT 协议开放权重。它延续了 4 月预览版的 284B 总参 / 13B 激活 MoE 架构,但针对智能体性能重新做了后训练,附带 DSpark 投机解码模块,并新增原生 Responses API 与 Codex 支持。在 DeepSeek 公布的评测中,正式版 Flash 已经跑赢了体量更大的 V4-Pro 预览版,成为前沿智能体编程领域单位任务成本最优的模型之一。
核心功能
- 为智能体重新后训练:架构与预览版相同,但后训练重点放在工具调用与多步任务上,并在每一轮工具调用中把完整推理历史保留在上下文里。
- DSpark 投机解码:内置草稿模块加速推理;vLLM 上加一个
--speculative-config参数即可启用,SGLang 上配置DSPARK。 - 三档推理强度:
low、high、max控制思考深度,max会进行完整的问题拆解与边界情况测试;也支持非思考模式。 - Codex 就绪 API:原生支持 OpenAI Responses API 并明确适配 Codex,另提供 Anthropic 兼容的
/anthropic端点。 - 超大上下文:1M token 上下文、最高 384K 输出 token,长智能体会话可以装进一个窗口。
模型规格
| 规格 | DeepSeek V4 Flash 0731 |
|---|---|
| 参数 | 284B 总参 / 13B 激活(含 DSpark 模块共 304B) |
| 上下文 / 最大输出 | 1M token / 384K token |
| 推理强度 | low、high、max + 非思考模式 |
| 协议 | MIT(开源权重) |
| 权重 | Hugging Face:deepseek-ai/DeepSeek-V4-Flash-0731 |
定价
| 项目 | 每 1M token 价格 |
|---|---|
| 输入 | $0.14 |
| 输出 | $0.28 |
| 缓存输入 | $0.0028(缓存命中享 98% 折扣) |
发布时已宣布将引入 2 倍高峰时段加价(北京时间 09:00-12:00、14:00-18:00),但发布时尚未生效。
评测亮点
- Terminal Bench 2.1:82.7 分,比预览版高出 20 多分。
- 智能体评测:在 DeepSeek 公布的每一项智能体基准上都超过 DeepSeek-V4-Pro 预览版,尽管激活参数量约为其十二分之一。
- 生态:antirez 的 DwarfStar 4(ds4)原生 C 推理引擎正是围绕这个模型打造的。
适用场景
- 成本敏感的智能体流水线:每 1M token $0.14/$0.28,获得接近前沿的智能体表现。
- Codex 兼容工作流:已经在用 OpenAI 形状 API 的团队只需改模型名即可切换,技术栈不动。
- 本地智能体部署:MIT 权重可用 vLLM、SGLang 或 llama.cpp 级别的引擎跑在普通硬件上。
- 高并发服务:API 最高支持 2,500 个并发请求。
优势
- 性价比之王:13B 激活参数,在智能体基准上击败了 49B 激活的旗舰。
- 开放且实用:MIT 权重加 DSpark 与超大上下文,是单位成本最强的开源智能体模型。
- 生态契合:原生 Codex 适配与 Anthropic 兼容端点,几乎消除了集成摩擦。
使用技巧
- 启用 DSpark:投机解码是头号提速特性,在你的服务栈上按文档加对应参数即可。
- 为 max 档提高输出上限:
max推理级别能充分利用 384K 的输出上限。 - 吃满 98% 缓存折扣:长共享前缀命中缓存几乎不花钱,这会改变你组织智能体提示词的方式。
总结
DeepSeek V4 Flash 0731 是这个夏天最具代表性的小型智能体模型:开源权重、1M 上下文,以及让接近前沿的智能体编程可以大规模负担得起的成本结构。如果你的团队要在预算内构建智能体,它是最强的起点。
替代方案
- DeepSeek V4 Pro 0813:成本次要、追求极限能力时的 1.6T 旗舰。
- GLM-5.3:价格略高的新晋开源权重编程领头羊。
- Kimi K3:开源权重 2.8T 模型,智能体得分相当。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。
ChatGPT 额度不够用?在 Codex 里切换 DeepSeek 和 Grok
Codex Router 让你继续使用熟悉的 Codex 工作台,同时把任务交给 DeepSeek、Grok 等外部模型。看懂它怎样工作、额度怎么算,以及“不用翻墙”的前提。
7 款 AI 编程 CLI 怎么选:任务分工、成本记录与独立审查
对比 Claude Code、Codex CLI、OpenCode、Pi、omp、DeepSeek Harness 和 Grok Build,提供同题测试表、成本算法与代码审查流程。