Ling-3.0-flash
Ling-3.0-flash 是 inclusionAI 的下一代原生混合推理模型。2026-08-21 在 huggingface.co/inclusionAI/Ling-3.0-flash 复核。卡片协议 MIT。卡片写明总参 124B、激活 5.1B(约等于上一代 1T 级 Ring-2.6-1T 的 12.4% / 8.1%)。当天 Hugging Face 显示 355 likes、近 30 天 16,219 次下载。createdAt 为 2026-08-02。
r/LocalLLaMA 把 Ling-3.0 当新闻,是因为 AntLing 放出了六份基座检查点(tiny / flash,各有 pretrained、mid-trained、WSM-merged)。本页是生产用的 flash instruct SKU,不是每一份检查点。
若要稠密 Apache 2.0 的 27B,看 Qwen3.8-27B。若要 7.9B / 激活 1.3B 的兄弟型号,看 Ling-3.0-tiny。
核心功能
- 混合线性 MoE:Kimi Delta Attention(KDA)与 gated MLA 按 5:1 堆叠,1/64 稀疏 MoE。卡片表:35 层 KDA + 7 层 gated MLA,512 个路由专家、激活 8 个、共享 1 个,hidden size 2560,词表 157,184。
- 上下文课表:8K 到 32K 到 256K。SGLang cookbook 用
--context-length 262144。 - 默认开思考:可用
"chat_template_kwargs": {"enable_thinking": false}按请求关掉。flash 卡片推荐采样:temperature=0.6、top_p=0.95、top_k=20。 - 卡片点名的智能体框架:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。这是厂商文案,不是我们的评测。
- 推理:SGLang 镜像
lmsysorg/sglang:dev-Ling-3.0-flash,以及 github.com/inclusionAI/vllm-ling-v3 的ling_3_0分支。卡片还写了 OpenRouter 的inclusionai/ling-3.0-flash:free,上线前请可对照 slug。
限制:需要 Ling-3.0 运行时,不能随便拿一个 vLLM 轮子。卡片上的 SWE-Bench 是厂商用 OpenHands 测的。我们没有复跑。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 总参 / 激活 | 124B / 5.1B | HF 卡片 |
| 协议 | MIT | 同上 |
| Likes / 近 30 天下载 | 355 / 16,219 | HF API,2026-08-21 |
| SWE-Bench Pro(卡片) | 56.6 | 卡片评测 |
| AIME 2026(卡片) | 93.2 | 同上 |
| 软件价格 | 权重 $0 | MIT |
这些分数写在卡片上,按厂商数字对待。
适用场景
- 智能体写代码循环,激活 5.1B 比同等上下文的稠密 27B 更省。
- 已经在用 SGLang、能拉
lmsysorg/sglang:dev-Ling-3.0-flash的人。 - LocalLLaMA 读者看到六份基座检查点,想找 flash instruct 线。
只有笔记本的话,先看兄弟卡片上的 Ling-3.0-tiny(DGX Spark / M4 Pro 数字在那边),不要上这个 124B。
快速开始
- 打开 inclusionAI/Ling-3.0-flash。
- 跟 SGLang cookbook。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash。卡片写 141GB 级 GPU 用--tp 4,80GB 卡用--tp 8。- 引用 SWE-Bench Pro 之前,用自己的提示测一遍。
常见问题
是稠密模型吗?
不是。稀疏 MoE,每 token 激活 5.1B。
tiny 和 flash 差在哪?
tiny 是 7.9B / 激活 1.3B,见 Ling-3.0-tiny。flash 是 124B 生产 SKU。
能用官方 vLLM 吗?
替代方案
- Qwen3.8-27B:稠密 Apache 2.0,本地部署更简单。
- DFlash 2:给 Qwen3.8-27B 用的草稿模型,不是聊天模型。
- Muse Spark 1.2:Meta 编码旗舰,走 API,不是 MIT 权重。
使用技巧
- 没有理由就不要关思考。
- 承诺 $0 托管席位前,可对照 OpenRouter 的
:free。 - 不要把 Ring-2.6-1T 的数字抄到本页。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。