Ling-3.0-flash logo

Ling-3.0-flash

打开

inclusionAI 的 MIT 混合线性 MoE:总参 124B,激活 5.1B。2026-08-21 在 Hugging Face 复核。

分享:

Ling-3.0-flash

Ling-3.0-flash 是 inclusionAI 的下一代原生混合推理模型。2026-08-21 在 huggingface.co/inclusionAI/Ling-3.0-flash 复核。卡片协议 MIT。卡片写明总参 124B、激活 5.1B(约等于上一代 1T 级 Ring-2.6-1T 的 12.4% / 8.1%)。当天 Hugging Face 显示 355 likes、近 30 天 16,219 次下载。createdAt 为 2026-08-02。

r/LocalLLaMA 把 Ling-3.0 当新闻,是因为 AntLing 放出了六份基座检查点(tiny / flash,各有 pretrained、mid-trained、WSM-merged)。本页是生产用的 flash instruct SKU,不是每一份检查点。

若要稠密 Apache 2.0 的 27B,看 Qwen3.8-27B。若要 7.9B / 激活 1.3B 的兄弟型号,看 Hugging Face 上的 Ling-3.0-tiny(站内暂无独立词条)。

核心功能

  • 混合线性 MoE:Kimi Delta Attention(KDA)与 gated MLA 按 5:1 堆叠,1/64 稀疏 MoE。卡片表:35 层 KDA + 7 层 gated MLA,512 个路由专家、激活 8 个、共享 1 个,hidden size 2560,词表 157,184。
  • 上下文课表:8K 到 32K 到 256K。SGLang cookbook 用 --context-length 262144
  • 默认开思考:可用 "chat_template_kwargs": {"enable_thinking": false} 按请求关掉。flash 卡片推荐采样:temperature=0.6top_p=0.95top_k=20
  • 卡片点名的智能体框架:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。这是厂商文案,不是我们的评测。
  • 推理:SGLang 镜像 lmsysorg/sglang:dev-Ling-3.0-flash,以及 github.com/inclusionAI/vllm-ling-v3ling_3_0 分支。卡片还写了 OpenRouter 的 inclusionai/ling-3.0-flash:free,上线前请再核对 slug。

限制:需要 Ling-3.0 运行时,不能随便拿一个 vLLM 轮子。卡片上的 SWE-Bench 是厂商用 OpenHands 测的。我们没有复跑。

复核过的规格

项目 数值 来源
总参 / 激活 124B / 5.1B HF 卡片
协议 MIT 同上
Likes / 近 30 天下载 355 / 16,219 HF API,2026-08-21
SWE-Bench Pro(卡片) 56.6 卡片评测
AIME 2026(卡片) 93.2 同上
软件价格 权重 $0 MIT

这些分数写在卡片上,按厂商数字对待。

适用场景

  • 智能体写代码循环,激活 5.1B 比同等上下文的稠密 27B 更省。
  • 已经在用 SGLang、能拉 lmsysorg/sglang:dev-Ling-3.0-flash 的人。
  • LocalLLaMA 读者看到六份基座检查点,想找 flash instruct 线。

只有笔记本的话,先看兄弟卡片上的 Ling-3.0-tiny(DGX Spark / M4 Pro 数字在那边),不要上这个 124B。

快速开始

  1. 打开 inclusionAI/Ling-3.0-flash
  2. SGLang cookbook
  3. docker pull lmsysorg/sglang:dev-Ling-3.0-flash。卡片写 141GB 级 GPU 用 --tp 4,80GB 卡用 --tp 8
  4. 引用 SWE-Bench Pro 之前,用自己的提示测一遍。

常见问题

是稠密模型吗?

不是。稀疏 MoE,每 token 激活 5.1B。

tiny 和 flash 差在哪?

tiny 是 7.9B / 激活 1.3B,见 inclusionAI/Ling-3.0-tiny。flash 是 124B 生产 SKU。

能用官方 vLLM 吗?

卡片安装的是 inclusionAI/vllm-ling-v3ling_3_0 分支。不要编造主线版本号。

替代方案

  • Qwen3.8-27B:稠密 Apache 2.0,本地部署更简单。
  • DFlash 2:给 Qwen3.8-27B 用的草稿模型,不是聊天模型。
  • Muse Spark 1.2:Meta 编码旗舰,走 API,不是 MIT 权重。

使用技巧

  1. 没有理由就不要关思考。
  2. 承诺 $0 托管席位前,再核对 OpenRouter 的 :free
  3. 不要把 Ring-2.6-1T 的数字抄到本页。

总结

Ling-3.0-flash 是 LocalLLaMA 指向的那条 MIT flash SKU:总参 124B、激活 5.1B、256K 级上下文、卡片上有 SGLang 镜像。从 Hugging Face 卡片 开始。GPU 装不下就去 tiny 卡片。

评论

还没有评论。成为第一个评论的人!