DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 V4 家族里的第一个实验性多模态模型。Hugging Face 卡片 写明:在 DeepSeek V4 Flash 架构上加入视觉模块并继续训练,让同一套智能体栈能读图。协议 MIT。仓库创建于 2026-08-31。2026-09-08 卡片显示约 800 likes、上月下载 251,611。r/LocalLLaMA 有人用它做游戏世界截图。Hugging Face 标注模型大小为 305B params(BF16 / FP8 分片)。
若只要文本 Flash,看 DeepSeek V4 Flash;若要更小的稠密多模态本地模型,看 Qwen3.8-27B;若要端侧 2B,看 MiniCPM5-2B。
模型规格
| 规格 | DeepSeek-V4-Flash-Vision-Exp |
|---|---|
| 角色 | 实验性 V4 视觉 + 文本智能体 |
| 底座 | DeepSeek-V4-Flash + 视觉模块 |
| HF 大小 | 305B params(卡片,2026-09-08) |
| 协议 | MIT |
| 流水线 | image-text-to-text |
| 卡片日期 | 2026-08-31 |
限制:名字带 Exp。在纯文本车队里,在你量过视觉显存和额外编码器之前,不要当 Flash-0731 的即插即用替换。官方 serving 例子是 4 卡 GB300 级节点,不是笔记本。
核心功能
- 卡片上的多模态智能体分数:ApexBench Pass@1 36.5,对照 Flash-0731 26.2(文本模型忽略图像)。Agents' Last Exam 27.3 对 25.2。Chartography 64.3。ZeroBench Pass@5 35.0。厂商数字。
- 文本智能体仍接近:Terminal Bench 2.1 83.9 对 Flash 82.7。Toolathlon-Verified 75.9 对 70.3。Cybergym 略差(75.3 对 76.7)。
- 同一 checkpoint 里的 DSpark:SGLang
--speculative-algorithm DSPARK,不必另给草稿路径。 - 提示编码:OpenAI 风格 JSON 图像块,或紧凑的
<image>path</image>TXT。示例里两种编码得到相同 token ID。 - vLLM 配方:镜像
vllm/vllm-openai:deepseekv4-flash-vision,工具解析器deepseek_v4,FP8 KV cache。
适用场景
- 已经在跑 Flash 的智能体 harness,现在要在同一会话里吃截图、图表或 UI dump。
- 要 MIT 权重做本地多模态研究,而不是封闭视觉 API。
- 游戏和世界生成实验,类似 r/LocalLLaMA 上的 Flash-Vision-Exp 帖。
定价
MIT 权重免费。托管聊天在 DeepSeek 官网;这张卡片没有打印视觉 token 单价。不要把 Flash 文本价格抄到视觉上。
| 部分 | 价格 | 来源 2026-09-08 |
|---|---|---|
| 权重 | $0 | Hugging Face MIT |
| 自托管 | 你的 GPU | 卡片例子:4 路张量并行 |
| deepseek.com 聊天 | 以产品页为准 | 不是视觉价目表 |
快速开始
- 打开 huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp。
- 跟 vLLM recipe 或 SGLang cookbook,加上
--speculative-algorithm DSPARK。 - 用仓库
encoding/助手编码图像,不要随便套一个 VL chat template。 - 若任务纯文本,确认 DeepSeek V4 Flash。
第一手资源:DeepSeek-V4-Flash-Vision-Exp 模型卡。
常见问题
和 V4 Flash 一样吗?
不一样。Flash-0731 是文本。Vision-Exp 加了视觉模块并继续训练。文本智能体分数仍在同一档;多模态分数才是这个 SKU 存在的理由。
能在一张消费级 GPU 上跑吗?
公开的 vLLM 例子是 4 卡节点加 FP8 KV cache。按集群硬件规划,不是 24GB 卡。
是 MIT 吗?
是。卡片徽章和 License 一节写 MIT。
替代方案
- DeepSeek V4 Flash:纯文本 Flash 智能体 SKU。
- Qwen3.8-27B:更小的稠密多模态本地模型。
- MiniCPM5-2B:端侧 2B,不是 305B。
使用技巧
- 引用 MIT、800 HF likes、251,611 月下载、305B 大小,均来自 2026-09-08 复核的卡片。
- DSpark 留在同一 checkpoint,不要编一个单独的草稿仓库。
- 若目标是 ApexBench,不要用「丢掉图像」的方式评估 Flash-0731。
总结
DeepSeek-V4-Flash-Vision-Exp 是 MIT 的 V4 实验:保住 Flash 级文本智能体,并加上截图。从 Hugging Face 卡片 开始,再决定 DeepSeek V4 Flash 是否已经覆盖纯文本路径。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。