DeepSeek V4 Flash 0731 是 DeepSeek 小型智能体模型的正式版,于 2026 年 7 月 31 日发布,当天即以 MIT 协议开放权重。它延续了 4 月预览版的 284B 总参 / 13B 激活 MoE 架构,但针对智能体性能重新做了后训练,附带 DSpark 投机解码模块,并新增原生 Responses API 与 Codex 支持。在 DeepSeek 公布的评测中,正式版 Flash 已经跑赢了体量更大的 V4-Pro 预览版,成为前沿智能体编程领域单位任务成本最优的模型之一。
核心功能
- 为智能体重新后训练:架构与预览版相同,但后训练重点放在工具调用与多步任务上,并在每一轮工具调用中把完整推理历史保留在上下文里。
- DSpark 投机解码:内置草稿模块加速推理;vLLM 上加一个
--speculative-config参数即可启用,SGLang 上配置DSPARK。 - 三档推理强度:
low、high、max控制思考深度,max会进行完整的问题拆解与边界情况测试;也支持非思考模式。 - Codex 就绪 API:原生支持 OpenAI Responses API 并明确适配 Codex,另提供 Anthropic 兼容的
/anthropic端点。 - 超大上下文:1M token 上下文、最高 384K 输出 token,长智能体会话可以装进一个窗口。
模型规格
| 规格 | DeepSeek V4 Flash 0731 |
|---|---|
| 参数 | 284B 总参 / 13B 激活(含 DSpark 模块共 304B) |
| 上下文 / 最大输出 | 1M token / 384K token |
| 推理强度 | low、high、max + 非思考模式 |
| 协议 | MIT(开源权重) |
| 权重 | Hugging Face:deepseek-ai/DeepSeek-V4-Flash-0731 |
定价
| 项目 | 每 1M token 价格 |
|---|---|
| 输入 | $0.14 |
| 输出 | $0.28 |
| 缓存输入 | $0.0028(缓存命中享 98% 折扣) |
发布时已宣布将引入 2 倍高峰时段加价(北京时间 09:00-12:00、14:00-18:00),但发布时尚未生效。
评测亮点
- Terminal Bench 2.1:82.7 分,比预览版高出 20 多分。
- 智能体评测:在 DeepSeek 公布的每一项智能体基准上都超过 DeepSeek-V4-Pro 预览版,尽管激活参数量约为其十二分之一。
- 生态:antirez 的 DwarfStar 4(ds4)原生 C 推理引擎正是围绕这个模型打造的。
适用场景
- 成本敏感的智能体流水线:每 1M token $0.14/$0.28,获得接近前沿的智能体表现。
- Codex 兼容工作流:已经在用 OpenAI 形状 API 的团队只需改模型名即可切换,技术栈不动。
- 本地智能体部署:MIT 权重可用 vLLM、SGLang 或 llama.cpp 级别的引擎跑在普通硬件上。
- 高并发服务:API 最高支持 2,500 个并发请求。
优势
- 性价比之王:13B 激活参数,在智能体基准上击败了 49B 激活的旗舰。
- 开放且实用:MIT 权重加 DSpark 与超大上下文,是单位成本最强的开源智能体模型。
- 生态契合:原生 Codex 适配与 Anthropic 兼容端点,几乎消除了集成摩擦。
使用技巧
- 启用 DSpark:投机解码是头号提速特性,在你的服务栈上按文档加对应参数即可。
- 为 max 档提高输出上限:
max推理级别能充分利用 384K 的输出上限。 - 吃满 98% 缓存折扣:长共享前缀命中缓存几乎不花钱,这会改变你组织智能体提示词的方式。
总结
DeepSeek V4 Flash 0731 是这个夏天最具代表性的小型智能体模型:开源权重、1M 上下文,以及让接近前沿的智能体编程可以大规模负担得起的成本结构。如果你的团队要在预算内构建智能体,它是最强的起点。
替代方案
- DeepSeek V4 Pro 0813:成本次要、追求极限能力时的 1.6T 旗舰。
- GLM-5.3:价格略高的新晋开源权重编程领头羊。
- Kimi K3:开源权重 2.8T 模型,智能体得分相当。
评论
还没有评论。成为第一个评论的人!
相关工具
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
DeepSeek V4
www.deepseek.com
DeepSeek V4 代表着 DeepSeek 旗舰 AI 模型的下一代产品,在 V3 成功的基础上,预计将在推理能力、多模态理解和智能体交互方面实现重大突破。
GLM-4.7
www.bigmodel.cn
智谱 AI 推出的开源多语言多模态对话模型,具有先进的思考能力、卓越的编码性能和增强的 UI 生成能力。
相关洞察
6 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。