DeepSeek-V4.1-Flash logo

DeepSeek-V4.1-Flash

打开

DeepSeek-V4.1-Flash 是 MIT 的 552B 多模态 MoE,预填充 8B、解码 16B 激活,1M 上下文,KV 缓存约为 V4-Flash 的四分之一。

分享:
查看替代方案

DeepSeek-V4.1-Flash 是 DeepSeek 在 2026-09-10 发布的多模态 MoE。Hugging Face 模型卡MIT,骨干 552B,预填充激活 8B、解码激活 16B,上下文 1M。当天模型卡约 307 likes。X「为你推荐」出现了 Tianyi Cui 关于 DeepSeek Harness v0.1.5 的说明,称该模型按不同 Harness 配置做过专项训练。同一天 r/LocalLLaMA 热榜贴了模型卡(约 211 赞)以及微信公众号转述。

对照 DeepSeek V4 Flash 若你要 284B/13B 的上一档,对照 DeepSeek Harness 若你要它被打分的智能体循环,对照 mlx-serve 若你只要 Mac 本地服务。

核心功能

  • Causal Encoder-Decoder:40 层 Transformer,前 20 层因果编码器、后 20 层解码器。模型卡写明解码器全局 KV 由编码器投影,所以预填充只需 8B 激活。
  • CSA2 加 FP4 主 KV:Compressed Sparse Attention 2,层模式为 Full / Reindex / Reuse。配合 FP4 主 KV 缓存,全局 KV 为每 token 890 字节,约为 V4-Flash 的四分之一。
  • 原生图文:DeepSeek-ViT 加两层 MLP 投影,从零训练于 45T 多模态 token。在 34T token 处把上下文扩到 1M。
  • 可调推理强度:整数 reasoning_effort,1 到 100。下文 instruct 分数均用 100。
  • DSpark 与 Engram:投机解码,外加 196B Engram 条件记忆(按 token 查找)。MoE:1 个共享专家、384 个路由专家,每 token 激活 6 个路由专家。

限制:2026-09-10 模型卡没有公布 API 单价。不要把 V4-Flash 的 $0.14/$0.28 抄过来。307 likes 只是当日热度,不是审计。官方智能体分数使用最大努力、temperature=1.0top_p=0.95

模型规格

项目 DeepSeek-V4.1-Flash(模型卡,2026-09-10)
骨干 / 激活 552B / 预填充 8B、解码 16B
上下文 1M token
采样 temperature 1.0,topp 0.95 或 1.0,maxtokens 至少 256K
协议 MIT
权重 deepseek-ai/DeepSeek-V4.1-Flash

定价

部分 价格 2026-09-10 第一方页面
权重 $0 Hugging Face 上 MIT。
API 模型卡未列 报价前到 deepseek.comchat.deepseek.com 核对。

官方智能体分数(最大努力)

来自模型卡,不是第三方实验室:

  • Terminal Bench 2.1:90.6(V4-Flash 为 82.7)
  • DeepSWE v1.1:74.2
  • AutomationBench:54.8
  • Agent's Last Exam:31.8

快速开始

  1. 模型卡 和仓库里的 encoding/ README。此版本没有 Jinja 聊天模板。
  2. vLLM:vllm serve deepseek-ai/DeepSeek-V4.1-Flash;或 SGLang:python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V4.1-Flash
  3. 生产环境提示编码,模型卡指向 deepseek-recipe
  4. 若要用推文里的 Harness,打开 DeepSeek Harness

第一方资料:同一仓库的 技术报告 PDF

常见问题

这是 V4-Flash 的升级还是新模型?

新架构。V4-Flash 是 284B/13B。V4.1-Flash 是 552B,激活 8B/16B,KV 更小。

笔记本跑得动吗?

模型卡列了 vLLM、SGLang 和 Docker。552B MoE 默认不是笔记本。等量化或走 API,显存自己量。

它取代 V4-Pro 了吗?

模型卡只比分数,没写 V4-Pro 下线。r/LocalLLaMA 另有「软下线」讨论,在 DeepSeek 自己写之前当社区传言。

替代方案

  • DeepSeek V4 Flash:284B/13B 的 MIT 智能体模型,API 价格已公布。
  • DeepSeek Harness:这个检查点训练和打分用的智能体运行时。
  • mlx-serve:不托管 552B 时的 Apple Silicon 本地服务。

使用技巧

  1. 引用 MIT、552B、8B/16B、每 token 890 字节和 1M 上下文时,以 2026-09-10 的模型卡为准。
  2. API 单价在 DeepSeek 公布前留空。
  3. reasoning_effort 用 1–100 的整数,不要沿用 V4-Flash 的 low/high/max。

总结

DeepSeek-V4.1-Flash 是 2026 年 9 月 10 日的 MIT 多模态 Flash:KV 更小、原生视觉、官方智能体分数高于 V4-Flash。从 Hugging Face 模型卡 开始。若你要上一档已公布单价的 API,继续用 DeepSeek V4 Flash

评论

还没有评论。成为第一个评论的人!