DeepSeek V4 Flash 0731 是 DeepSeek 小型智能体模型的正式版,于 2026 年 7 月 31 日发布,当天即以 MIT 协议开放权重。它延续了 4 月预览版的 284B 总参 / 13B 激活 MoE 架构,但针对智能体性能重新做了后训练,附带 DSpark 投机解码模块,并新增原生 Responses API 与 Codex 支持。在 DeepSeek 公布的评测中,正式版 Flash 已经跑赢了体量更大的 V4-Pro 预览版,成为前沿智能体编程领域单位任务成本最优的模型之一。
核心功能
- 为智能体重新后训练:架构与预览版相同,但后训练重点放在工具调用与多步任务上,并在每一轮工具调用中把完整推理历史保留在上下文里。
- DSpark 投机解码:内置草稿模块加速推理;vLLM 上加一个
--speculative-config参数即可启用,SGLang 上配置DSPARK。 - 三档推理强度:
low、high、max控制思考深度,max会进行完整的问题拆解与边界情况测试;也支持非思考模式。 - Codex 就绪 API:原生支持 OpenAI Responses API 并明确适配 Codex,另提供 Anthropic 兼容的
/anthropic端点。 - 超大上下文:1M token 上下文、最高 384K 输出 token,长智能体会话可以装进一个窗口。
模型规格
| 规格 | DeepSeek V4 Flash 0731 |
|---|---|
| 参数 | 284B 总参 / 13B 激活(含 DSpark 模块共 304B) |
| 上下文 / 最大输出 | 1M token / 384K token |
| 推理强度 | low、high、max + 非思考模式 |
| 协议 | MIT(开源权重) |
| 权重 | Hugging Face:deepseek-ai/DeepSeek-V4-Flash-0731 |
定价
| 项目 | 每 1M token 价格 |
|---|---|
| 输入 | $0.14 |
| 输出 | $0.28 |
| 缓存输入 | $0.0028(缓存命中享 98% 折扣) |
发布时已宣布将引入 2 倍高峰时段加价(北京时间 09:00-12:00、14:00-18:00),但发布时尚未生效。
评测亮点
- Terminal Bench 2.1:82.7 分,比预览版高出 20 多分。
- 智能体评测:在 DeepSeek 公布的每一项智能体基准上都超过 DeepSeek-V4-Pro 预览版,尽管激活参数量约为其十二分之一。
- 生态:antirez 的 DwarfStar 4(ds4)原生 C 推理引擎正是围绕这个模型打造的。
适用场景
- 成本敏感的智能体流水线:每 1M token $0.14/$0.28,获得接近前沿的智能体表现。
- Codex 兼容工作流:已经在用 OpenAI 形状 API 的团队只需改模型名即可切换,技术栈不动。
- 本地智能体部署:MIT 权重可用 vLLM、SGLang 或 llama.cpp 级别的引擎跑在普通硬件上。
- 高并发服务:API 最高支持 2,500 个并发请求。
优势
- 性价比之王:13B 激活参数,在智能体基准上击败了 49B 激活的旗舰。
- 开放且实用:MIT 权重加 DSpark 与超大上下文,是单位成本最强的开源智能体模型。
- 生态契合:原生 Codex 适配与 Anthropic 兼容端点,几乎消除了集成摩擦。
使用技巧
- 启用 DSpark:投机解码是头号提速特性,在你的服务栈上按文档加对应参数即可。
- 为 max 档提高输出上限:
max推理级别能充分利用 384K 的输出上限。 - 吃满 98% 缓存折扣:长共享前缀命中缓存几乎不花钱,这会改变你组织智能体提示词的方式。
总结
DeepSeek V4 Flash 0731 是这个夏天最具代表性的小型智能体模型:开源权重、1M 上下文,以及让接近前沿的智能体编程可以大规模负担得起的成本结构。如果你的团队要在预算内构建智能体,它是最强的起点。
替代方案
- DeepSeek V4 Pro 0813:成本次要、追求极限能力时的 1.6T 旗舰。
- GLM-5.3:价格略高的新晋开源权重编程领头羊。
- Kimi K3:开源权重 2.8T 模型,智能体得分相当。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。