DeepSeek-V4-Flash-Vision-Exp logo

DeepSeek-V4-Flash-Vision-Exp

打开

DeepSeek-V4-Flash-Vision-Exp 是 V4 家族首个多模态实验:Flash 架构加视觉模块,MIT 权重,约 305B 参数。

分享:
查看替代方案

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 在 V4 家族里的第一个实验性多模态模型。Hugging Face 卡片 写明:在 DeepSeek V4 Flash 架构上加入视觉模块并继续训练,让同一套智能体栈能读图。协议 MIT。仓库创建于 2026-08-31。2026-09-08 卡片显示约 800 likes、上月下载 251,611。r/LocalLLaMA 有人用它做游戏世界截图。Hugging Face 标注模型大小为 305B params(BF16 / FP8 分片)。

若只要文本 Flash,看 DeepSeek V4 Flash;若要更小的稠密多模态本地模型,看 Qwen3.8-27B;若要端侧 2B,看 MiniCPM5-2B

模型规格

规格 DeepSeek-V4-Flash-Vision-Exp
角色 实验性 V4 视觉 + 文本智能体
底座 DeepSeek-V4-Flash + 视觉模块
HF 大小 305B params(卡片,2026-09-08)
协议 MIT
流水线 image-text-to-text
卡片日期 2026-08-31

限制:名字带 Exp。在纯文本车队里,在你量过视觉显存和额外编码器之前,不要当 Flash-0731 的即插即用替换。官方 serving 例子是 4 卡 GB300 级节点,不是笔记本。

核心功能

  • 卡片上的多模态智能体分数:ApexBench Pass@1 36.5,对照 Flash-0731 26.2(文本模型忽略图像)。Agents' Last Exam 27.325.2。Chartography 64.3。ZeroBench Pass@5 35.0。厂商数字。
  • 文本智能体仍接近:Terminal Bench 2.1 83.9 对 Flash 82.7。Toolathlon-Verified 75.970.3。Cybergym 略差(75.376.7)。
  • 同一 checkpoint 里的 DSpark:SGLang --speculative-algorithm DSPARK,不必另给草稿路径。
  • 提示编码:OpenAI 风格 JSON 图像块,或紧凑的 <image>path</image> TXT。示例里两种编码得到相同 token ID。
  • vLLM 配方:镜像 vllm/vllm-openai:deepseekv4-flash-vision,工具解析器 deepseek_v4,FP8 KV cache。

适用场景

  • 已经在跑 Flash 的智能体 harness,现在要在同一会话里吃截图、图表或 UI dump。
  • 要 MIT 权重做本地多模态研究,而不是封闭视觉 API。
  • 游戏和世界生成实验,类似 r/LocalLLaMA 上的 Flash-Vision-Exp 帖。

定价

MIT 权重免费。托管聊天在 DeepSeek 官网;这张卡片没有打印视觉 token 单价。不要把 Flash 文本价格抄到视觉上。

部分 价格 来源 2026-09-08
权重 $0 Hugging Face MIT
自托管 你的 GPU 卡片例子:4 路张量并行
deepseek.com 聊天 以产品页为准 不是视觉价目表

快速开始

  1. 打开 huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
  2. vLLM recipe 或 SGLang cookbook,加上 --speculative-algorithm DSPARK
  3. 用仓库 encoding/ 助手编码图像,不要随便套一个 VL chat template。
  4. 若任务纯文本,确认 DeepSeek V4 Flash

第一手资源:DeepSeek-V4-Flash-Vision-Exp 模型卡

常见问题

和 V4 Flash 一样吗?

不一样。Flash-0731 是文本。Vision-Exp 加了视觉模块并继续训练。文本智能体分数仍在同一档;多模态分数才是这个 SKU 存在的理由。

能在一张消费级 GPU 上跑吗?

公开的 vLLM 例子是 4 卡节点加 FP8 KV cache。按集群硬件规划,不是 24GB 卡。

是 MIT 吗?

是。卡片徽章和 License 一节写 MIT。

替代方案

使用技巧

  1. 引用 MIT、800 HF likes、251,611 月下载、305B 大小,均来自 2026-09-08 复核的卡片。
  2. DSpark 留在同一 checkpoint,不要编一个单独的草稿仓库。
  3. 若目标是 ApexBench,不要用「丢掉图像」的方式评估 Flash-0731。

总结

DeepSeek-V4-Flash-Vision-Exp 是 MIT 的 V4 实验:保住 Flash 级文本智能体,并加上截图。从 Hugging Face 卡片 开始,再决定 DeepSeek V4 Flash 是否已经覆盖纯文本路径。

评论

还没有评论。成为第一个评论的人!