DeepSeek-V4.1-Flash 是 DeepSeek 在 2026-09-10 发布的多模态 MoE。Hugging Face 模型卡 为 MIT,骨干 552B,预填充激活 8B、解码激活 16B,上下文 1M。当天模型卡约 307 likes。X「为你推荐」出现了 Tianyi Cui 关于 DeepSeek Harness v0.1.5 的说明,称该模型按不同 Harness 配置做过专项训练。同一天 r/LocalLLaMA 热榜贴了模型卡(约 211 赞)以及微信公众号转述。
对照 DeepSeek V4 Flash 若你要 284B/13B 的上一档,对照 DeepSeek Harness 若你要它被打分的智能体循环,对照 mlx-serve 若你只要 Mac 本地服务。
核心功能
- Causal Encoder-Decoder:40 层 Transformer,前 20 层因果编码器、后 20 层解码器。模型卡写明解码器全局 KV 由编码器投影,所以预填充只需 8B 激活。
- CSA2 加 FP4 主 KV:Compressed Sparse Attention 2,层模式为 Full / Reindex / Reuse。配合 FP4 主 KV 缓存,全局 KV 为每 token 890 字节,约为 V4-Flash 的四分之一。
- 原生图文:DeepSeek-ViT 加两层 MLP 投影,从零训练于 45T 多模态 token。在 34T token 处把上下文扩到 1M。
- 可调推理强度:整数
reasoning_effort,1 到 100。下文 instruct 分数均用 100。 - DSpark 与 Engram:投机解码,外加 196B Engram 条件记忆(按 token 查找)。MoE:1 个共享专家、384 个路由专家,每 token 激活 6 个路由专家。
限制:2026-09-10 模型卡没有公布 API 单价。不要把 V4-Flash 的 $0.14/$0.28 抄过来。307 likes 只是当日热度,不是审计。官方智能体分数使用最大努力、temperature=1.0、top_p=0.95。
模型规格
| 项目 | DeepSeek-V4.1-Flash(模型卡,2026-09-10) |
|---|---|
| 骨干 / 激活 | 552B / 预填充 8B、解码 16B |
| 上下文 | 1M token |
| 采样 | temperature 1.0,topp 0.95 或 1.0,maxtokens 至少 256K |
| 协议 | MIT |
| 权重 | deepseek-ai/DeepSeek-V4.1-Flash |
定价
| 部分 | 价格 | 2026-09-10 第一方页面 |
|---|---|---|
| 权重 | $0 | Hugging Face 上 MIT。 |
| API | 模型卡未列 | 报价前到 deepseek.com 或 chat.deepseek.com 核对。 |
官方智能体分数(最大努力)
来自模型卡,不是第三方实验室:
- Terminal Bench 2.1:90.6(V4-Flash 为 82.7)
- DeepSWE v1.1:74.2
- AutomationBench:54.8
- Agent's Last Exam:31.8
快速开始
- 读 模型卡 和仓库里的
encoding/README。此版本没有 Jinja 聊天模板。 - vLLM:
vllm serve deepseek-ai/DeepSeek-V4.1-Flash;或 SGLang:python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V4.1-Flash。 - 生产环境提示编码,模型卡指向 deepseek-recipe。
- 若要用推文里的 Harness,打开 DeepSeek Harness。
第一方资料:同一仓库的 技术报告 PDF。
常见问题
这是 V4-Flash 的升级还是新模型?
新架构。V4-Flash 是 284B/13B。V4.1-Flash 是 552B,激活 8B/16B,KV 更小。
笔记本跑得动吗?
模型卡列了 vLLM、SGLang 和 Docker。552B MoE 默认不是笔记本。等量化或走 API,显存自己量。
它取代 V4-Pro 了吗?
模型卡只比分数,没写 V4-Pro 下线。r/LocalLLaMA 另有「软下线」讨论,在 DeepSeek 自己写之前当社区传言。
替代方案
- DeepSeek V4 Flash:284B/13B 的 MIT 智能体模型,API 价格已公布。
- DeepSeek Harness:这个检查点训练和打分用的智能体运行时。
- mlx-serve:不托管 552B 时的 Apple Silicon 本地服务。
使用技巧
- 引用 MIT、552B、8B/16B、每 token 890 字节和 1M 上下文时,以 2026-09-10 的模型卡为准。
- API 单价在 DeepSeek 公布前留空。
reasoning_effort用 1–100 的整数,不要沿用 V4-Flash 的 low/high/max。
总结
DeepSeek-V4.1-Flash 是 2026 年 9 月 10 日的 MIT 多模态 Flash:KV 更小、原生视觉、官方智能体分数高于 V4-Flash。从 Hugging Face 模型卡 开始。若你要上一档已公布单价的 API,继续用 DeepSeek V4 Flash。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。