DeepSeek V4 Flash logo

DeepSeek V4 Flash

打开

DeepSeek 官方小型智能体模型:284B 总参 / 13B 激活 MoE 架构、1M token 上下文、MIT 开源权重、DSpark 投机解码,每 1M token 仅 $0.14/$0.28。

分享:

DeepSeek V4 Flash 0731 是 DeepSeek 小型智能体模型的正式版,于 2026 年 7 月 31 日发布,当天即以 MIT 协议开放权重。它延续了 4 月预览版的 284B 总参 / 13B 激活 MoE 架构,但针对智能体性能重新做了后训练,附带 DSpark 投机解码模块,并新增原生 Responses API 与 Codex 支持。在 DeepSeek 公布的评测中,正式版 Flash 已经跑赢了体量更大的 V4-Pro 预览版,成为前沿智能体编程领域单位任务成本最优的模型之一。

核心功能

  • 为智能体重新后训练:架构与预览版相同,但后训练重点放在工具调用与多步任务上,并在每一轮工具调用中把完整推理历史保留在上下文里。
  • DSpark 投机解码:内置草稿模块加速推理;vLLM 上加一个 --speculative-config 参数即可启用,SGLang 上配置 DSPARK
  • 三档推理强度lowhighmax 控制思考深度,max 会进行完整的问题拆解与边界情况测试;也支持非思考模式。
  • Codex 就绪 API:原生支持 OpenAI Responses API 并明确适配 Codex,另提供 Anthropic 兼容的 /anthropic 端点。
  • 超大上下文:1M token 上下文、最高 384K 输出 token,长智能体会话可以装进一个窗口。

模型规格

规格 DeepSeek V4 Flash 0731
参数 284B 总参 / 13B 激活(含 DSpark 模块共 304B)
上下文 / 最大输出 1M token / 384K token
推理强度 low、high、max + 非思考模式
协议 MIT(开源权重)
权重 Hugging Face:deepseek-ai/DeepSeek-V4-Flash-0731

定价

项目 每 1M token 价格
输入 $0.14
输出 $0.28
缓存输入 $0.0028(缓存命中享 98% 折扣)

发布时已宣布将引入 2 倍高峰时段加价(北京时间 09:00-12:00、14:00-18:00),但发布时尚未生效。

评测亮点

  • Terminal Bench 2.1:82.7 分,比预览版高出 20 多分。
  • 智能体评测:在 DeepSeek 公布的每一项智能体基准上都超过 DeepSeek-V4-Pro 预览版,尽管激活参数量约为其十二分之一。
  • 生态:antirez 的 DwarfStar 4(ds4)原生 C 推理引擎正是围绕这个模型打造的。

适用场景

  • 成本敏感的智能体流水线:每 1M token $0.14/$0.28,获得接近前沿的智能体表现。
  • Codex 兼容工作流:已经在用 OpenAI 形状 API 的团队只需改模型名即可切换,技术栈不动。
  • 本地智能体部署:MIT 权重可用 vLLM、SGLang 或 llama.cpp 级别的引擎跑在普通硬件上。
  • 高并发服务:API 最高支持 2,500 个并发请求。

优势

  1. 性价比之王:13B 激活参数,在智能体基准上击败了 49B 激活的旗舰。
  2. 开放且实用:MIT 权重加 DSpark 与超大上下文,是单位成本最强的开源智能体模型。
  3. 生态契合:原生 Codex 适配与 Anthropic 兼容端点,几乎消除了集成摩擦。

使用技巧

  1. 启用 DSpark:投机解码是头号提速特性,在你的服务栈上按文档加对应参数即可。
  2. 为 max 档提高输出上限max 推理级别能充分利用 384K 的输出上限。
  3. 吃满 98% 缓存折扣:长共享前缀命中缓存几乎不花钱,这会改变你组织智能体提示词的方式。

总结

DeepSeek V4 Flash 0731 是这个夏天最具代表性的小型智能体模型:开源权重、1M 上下文,以及让接近前沿的智能体编程可以大规模负担得起的成本结构。如果你的团队要在预算内构建智能体,它是最强的起点。

替代方案

  • DeepSeek V4 Pro 0813:成本次要、追求极限能力时的 1.6T 旗舰。
  • GLM-5.3:价格略高的新晋开源权重编程领头羊。
  • Kimi K3:开源权重 2.8T 模型,智能体得分相当。

评论

还没有评论。成为第一个评论的人!