Ling-3.0-flash-VL logo

Ling-3.0-flash-VL

打开

Ling-3.0-flash-VL 是 inclusionAI 的 MIT 多模态 MoE:总参 124B,激活 5.5B,支持图像和视频。

分享:
查看替代方案

Ling-3.0-flash-VL 是 inclusionAI 在 Ling-3.0-flash 栈上的原生多模态规格。Hugging Face 卡片 协议 MIT。卡片写总参 124B、每 token 激活 5.5B,支持图像和视频输入,上下文最高 1M token。2026-09-09 Hugging Face 显示 31 likes、近 30 天 42 次下载。createdAt 为 2026-09-04。r/LocalLLaMA 把卡片放在热门列表。

这不是 Ling-3.0-flash。Flash 是文本混合推理规格(卡片:激活 5.1B)。Flash-VL 加了 ViT 编码器、两层 MLP projector 和 VideoRoPE。

若只要文本,看 Ling-3.0-flash。若要阿里稀疏开源 MoE,看 Qwen3.8-Flash-Next。若要截图加文本的 Flash VLM,看 DeepSeek-V4-Flash-Vision-Exp

核心功能

  • 视觉进闭环:卡片按理解 / 推理 / 行动写:图表和文档、用视觉证据做多步工作,再到界面操作。
  • 混合骨干:42 层按 5:1 交替 KDA 与 gated MLA。稀疏 MoE 保持 124B 容量、5.5B 激活。
  • VideoRoPE:空间加时间编码,卡片声称用于事件定位、长视频问答和片段剪辑。
  • 默认开思考:可用 "chat_template_kwargs": {"enable_thinking": false} 按请求关掉。卡片采样:temperature=0.6(评测说明也写过 1.0),top_p=0.95top_k=20
  • 部署:SGLang 镜像 lmsysorg/sglang:dev-Ling-3.0-flash-VL,在 4 张 141GB 级 GPU 上给出 256K YaRN 配方。vLLM 路径是 inclusionAI/vllm-ling-v3 fork,不是库存 wheel。

限制:需要 Ling-3.0 VL 运行时。Artificial Analysis Intelligence Index v4.1.1 的 42 分(flash 为 38)是厂商引用。我们没有复跑。31 likes 是热度,不是审计。

规格

项目 数值 来源
总参 / 激活 124B / 5.5B HF 卡片
协议 MIT 同一卡片
上下文(卡片) 最高 1M;SGLang 配方 256K YaRN 同一卡片
likes / 近 30 天下载 31 / 42 HF API,2026-09-09
AA Index v4.1.1(卡片) 42 同一卡片
软件价格 $0 权重 MIT

适用场景

  • 已经在用 Ling-3.0-flash 的团队,要同一 MoE 家族上的图像和视频。
  • 长上下文多模态工作,想要 256K 级配方、不想换厂商。
  • r/LocalLLaMA 读者,看到 HF 链接后需要 VL 规格,而不是 tiny 或文本 flash。

若要 7.9B / 激活 1.3B 的本地文本模型,用 Ling-3.0-tiny

快速开始

  1. 打开 inclusionAI/Ling-3.0-flash-VL
  2. docker pull lmsysorg/sglang:dev-Ling-3.0-flash-VL
  3. 按卡片用 --tp 4 --context-length 262144 和 YaRN 覆盖启动。80GB 卡上卡片写 --tp 8
  4. 在 OpenAI 兼容聊天体里发送 image_urlvideo_url

第一方资源:Ling-3.0-flash-VL 的 SGLang cookbook

常见问题

是 Apache-2.0 吗?

不是。卡片是 MIT

激活参数和 Ling-3.0-flash 一样吗?

不一样。Flash 卡片写 5.1B 激活。Flash-VL 卡片写 5.5B 激活。

库存 vLLM 能加载吗?

不能当随机 wheel 用。卡片指向 inclusionAI/vllm-ling-v3

替代方案

使用技巧

  1. 用 VL 的 Docker 标签,不要用文本 flash 镜像。
  2. 只要短描述、不要智能体轨迹时,再关 enable_thinking
  3. 不要把 flash 的 SWE 数字抄到本页。

Ling-3.0-flash-VL 是 r/LocalLLaMA 在 2026 年 9 月挂出的 MIT 多模态权重。从 Hugging Face 卡片起步,再判断文本 flash 是否已经够用。

评论

还没有评论。成为第一个评论的人!