Ling-3.0-flash-VL 是 inclusionAI 在 Ling-3.0-flash 栈上的原生多模态规格。Hugging Face 卡片 协议 MIT。卡片写总参 124B、每 token 激活 5.5B,支持图像和视频输入,上下文最高 1M token。2026-09-09 Hugging Face 显示 31 likes、近 30 天 42 次下载。createdAt 为 2026-09-04。r/LocalLLaMA 把卡片放在热门列表。
这不是 Ling-3.0-flash。Flash 是文本混合推理规格(卡片:激活 5.1B)。Flash-VL 加了 ViT 编码器、两层 MLP projector 和 VideoRoPE。
若只要文本,看 Ling-3.0-flash。若要阿里稀疏开源 MoE,看 Qwen3.8-Flash-Next。若要截图加文本的 Flash VLM,看 DeepSeek-V4-Flash-Vision-Exp。
核心功能
- 视觉进闭环:卡片按理解 / 推理 / 行动写:图表和文档、用视觉证据做多步工作,再到界面操作。
- 混合骨干:42 层按 5:1 交替 KDA 与 gated MLA。稀疏 MoE 保持 124B 容量、5.5B 激活。
- VideoRoPE:空间加时间编码,卡片声称用于事件定位、长视频问答和片段剪辑。
- 默认开思考:可用
"chat_template_kwargs": {"enable_thinking": false}按请求关掉。卡片采样:temperature=0.6(评测说明也写过 1.0),top_p=0.95,top_k=20。 - 部署:SGLang 镜像
lmsysorg/sglang:dev-Ling-3.0-flash-VL,在 4 张 141GB 级 GPU 上给出 256K YaRN 配方。vLLM 路径是inclusionAI/vllm-ling-v3fork,不是库存 wheel。
限制:需要 Ling-3.0 VL 运行时。Artificial Analysis Intelligence Index v4.1.1 的 42 分(flash 为 38)是厂商引用。我们没有复跑。31 likes 是热度,不是审计。
规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 总参 / 激活 | 124B / 5.5B | HF 卡片 |
| 协议 | MIT | 同一卡片 |
| 上下文(卡片) | 最高 1M;SGLang 配方 256K YaRN | 同一卡片 |
| likes / 近 30 天下载 | 31 / 42 | HF API,2026-09-09 |
| AA Index v4.1.1(卡片) | 42 | 同一卡片 |
| 软件价格 | $0 权重 | MIT |
适用场景
- 已经在用 Ling-3.0-flash 的团队,要同一 MoE 家族上的图像和视频。
- 长上下文多模态工作,想要 256K 级配方、不想换厂商。
- r/LocalLLaMA 读者,看到 HF 链接后需要 VL 规格,而不是 tiny 或文本 flash。
若要 7.9B / 激活 1.3B 的本地文本模型,用 Ling-3.0-tiny。
快速开始
- 打开 inclusionAI/Ling-3.0-flash-VL。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash-VL。- 按卡片用
--tp 4 --context-length 262144和 YaRN 覆盖启动。80GB 卡上卡片写--tp 8。 - 在 OpenAI 兼容聊天体里发送
image_url或video_url。
第一方资源:Ling-3.0-flash-VL 的 SGLang cookbook。
常见问题
是 Apache-2.0 吗?
不是。卡片是 MIT。
激活参数和 Ling-3.0-flash 一样吗?
不一样。Flash 卡片写 5.1B 激活。Flash-VL 卡片写 5.5B 激活。
库存 vLLM 能加载吗?
不能当随机 wheel 用。卡片指向 inclusionAI/vllm-ling-v3。
替代方案
- Ling-3.0-flash:文本混合推理规格。
- Qwen3.8-Flash-Next:阿里稀疏开源 MoE。
- DeepSeek-V4-Flash-Vision-Exp:MIT Flash 视觉实验。
使用技巧
- 用 VL 的 Docker 标签,不要用文本 flash 镜像。
- 只要短描述、不要智能体轨迹时,再关
enable_thinking。 - 不要把 flash 的 SWE 数字抄到本页。
Ling-3.0-flash-VL 是 r/LocalLLaMA 在 2026 年 9 月挂出的 MIT 多模态权重。从 Hugging Face 卡片起步,再判断文本 flash 是否已经够用。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。