DeepSeek V4 Pro 0813 logo

DeepSeek V4 Pro 0813

打开

DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。

分享:

DeepSeek-V4-Pro-0813 是 DeepSeek 旗舰模型的正式 GA 版本,于 2026 年 8 月 12 日发布。这是一个拥有 1.6 万亿总参数(激活 490 亿)的混合专家(MoE)Transformer,通过 DeepSeek API 上一次低调、带构建号标记的发布转正,同一天 0813 构建悄然接替了 4 月的预览版。权重已以 MIT 协议上架 Hugging Face。

模型规格

规格 DeepSeek V4 Pro 0813
架构 DeepSeekMoE(混合专家)
总参数 1.6T
激活参数 49B
上下文长度 1,000,000 token(最大输出 384K)
预训练数据 33T token
精度 FP4(路由专家)+ FP8 混合
模态 仅文本
推理模式 Non-Think / Think High / Think Max(可按请求切换)
协议 MIT(开源权重)

核心特点

  • 全球领先的编码能力:LiveCodeBench 93.5%(全球第一),Codeforces 评分 3206,约相当于人类前 23 名的水平。
  • 高效的 1M 上下文:混合注意力(CSA + HCA)在 1M 上下文下,单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV 缓存仅为 10%。
  • 架构创新:流形约束超连接(mHC)、Muon 优化器与多 token 预测(MTP)。
  • 统一推理模式:Non-Think、Think High、Think Max 三档可在同一个 API 模型内按请求选择。
  • 广泛的 API 兼容性:支持 OpenAI ChatCompletions、Anthropic Messages 与 Responses API。

基准亮点

  • SWE-bench Verified:80.6%(较 V3.2 提升 12.8 个百分点)
  • LiveCodeBench:93.5%(全球第一)
  • Codeforces:3206 Elo
  • GPQA Diamond:90.1%
  • MMLU-Pro:87.5%
  • Terminal-Bench 2.1:87.9(4 月预览版为 72.1)
  • HMMT 2026 Feb:95.2%
  • LMArena:1456 Elo(2026 年 6 月)

定价

档位 缓存命中(输入) 缓存未命中(输入) 输出
deepseek-v4-pro $0.003625 $0.435 $0.87

按混合费率约每百万 token $0.65 计算,DeepSeek V4 Pro 比 Claude Fable 5(每百万 token $10/$50)便宜约 46 倍,而在九项可对比的智能体基准上平均仅落后约 5.3%。DeepSeek 已发布公告,称价格将在不久的将来上调。

注意事项

0813 构建发布时没有博客文章或任何宣传造势,定价页面上的模型名称只是悄然换成了 -0813 构建标记。0813 专属基准的独立复现仍在进行中,截至 8 月 13 日,Hugging Face 上托管的仍是 4 月预览版权重。

总结

DeepSeek V4 Pro 0813 以 MIT 协议、1.6T MoE 的形态,用封闭模型零头的价格提供了前沿级的编码与智能体性能。对看重性价比、开源权重与长上下文智能体工作的开发者而言,它仍是市面上最具吸引力的模型之一。

评论

还没有评论。成为第一个评论的人!