Ling-3.0-tiny 是 inclusionAI 的轻量混合推理 MoE。2026-09-08 在 huggingface.co/inclusionAI/Ling-3.0-tiny 复核。卡片协议 MIT。卡片写明总参 7.9B、每 token 激活 1.3B。当天 Hugging Face 显示 431 likes、近 30 天 27,485 次下载。createdAt 为 2026-08-10。r/LocalLLaMA 同一帖里拿它和 Spark-X2.5-4B、Nanbeige4.2-3B 比小模型。
若要 124B / 激活 5.1B 的生产 SKU,看 Ling-3.0-flash。若要稠密 Apache 2.0 的 4B,看 Spark-X2.5-4B。若要更大的稠密本地模型,看 Qwen3.8-27B。
核心功能
- 高效混合线性 MoE:Kimi Delta Attention(KDA)与 MLA 按 3:1 堆叠(每 4 层 3 个 KDA 再 1 个 MLA)。稀疏 MoE FFN 有 128 个路由专家。每 token 激活 8 个路由专家加 1 个共享专家。
- 原生混合推理:默认开思考。可用
"chat_template_kwargs": {"enable_thinking": false}按请求关掉。tiny 卡片推荐采样:temperature=1.0、top_p=0.95、top_k=20。 - 卡片上的端侧数字:在 NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini 上验证过。FP8 下卡片写 DGX Spark 约 100-105 tok/s、M4 Pro 约 86-90 tok/s,8K 上下文峰值约 8.34 GiB。当作厂商测量。
- 推理:SGLang 镜像
lmsysorg/sglang:dev-Ling-3.0-tiny,卡片上的 vLLM 安装路径,以及经 ollama/ollama#17643 的实验性 Ollama MLX 路径。卡片还写了 OpenRouter 的inclusionai/ling-3.0-tiny:free,上线前请核 slug。 - 上下文:SGLang cookbook 用
--context-length 262144加 YaRN。
限制:需要 Ling-3.0 运行时,不能随便拿一个 vLLM 轮子。Ollama 支持是 PR,不是官方发行。卡片分数(Artificial Analysis Intelligence Index v4.1.1 25、Agentic Index 16)是厂商引用。我们没有复跑。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 总参 / 激活 | 7.9B / 1.3B | HF 卡片 |
| 协议 | MIT | 同上 |
| likes / 近 30 天下载 | 431 / 27,485 | HF API,2026-09-08 |
| 软件价格 | 权重 $0 | MIT |
适用场景
- 笔记本和 DGX Spark 用户,装不下 Ling-3.0-flash。
- 智能体循环,要思考加
ling3工具解析器,又不想上 124B 检查点。 - LocalLLaMA 读者,看过 tiny / flash 矩阵,想要 1.3B 激活的 instruct 线。
如果你有 4 张 141GB 级 GPU,从 flash 起步,不要从这页起步。
快速开始
- 打开 inclusionAI/Ling-3.0-tiny。
- 跟 SGLang cookbook。
docker pull lmsysorg/sglang:dev-Ling-3.0-tiny,按卡片用--tp 1启动。- 用自己的提示词测,再引用 AA 指数。
第一方资源:Ling-3.0-tiny 模型卡。
常见问题
是稠密模型吗?
不是。稀疏 MoE。每 token 激活 1.3B。
tiny 和 flash 差在哪?
tiny 是 7.9B / 激活 1.3B。Ling-3.0-flash 是 124B / 激活 5.1B。
能用官方 Ollama 吗?
不能用官方二进制。卡片从 PR 17643 编译,且仅限 Apple Silicon 上的 MLX。
替代方案
- Ling-3.0-flash:124B 生产 SKU。
- Spark-X2.5-4B:稠密 Apache 2.0 4B,原生 1M 上下文。
- Qwen3.8-27B:更稠的 Apache 2.0,本地部署更简单。
使用技巧
- 没有理由就别关思考。tiny 推荐温度是 1.0,不是 flash 的 0.6。
- 承诺 $0 托管席位前,先核 OpenRouter
:free。 - 不要把 flash 的 SWE-Bench 数字抄到这页。
总结
Ling-3.0-tiny 是 LocalLLaMA 指向的 MIT tiny SKU:总参 7.9B、激活 1.3B、256K 级上下文,卡片上有 SGLang 镜像。从 Hugging Face 卡片 开始。GPU 装得下 flash 就去 Ling-3.0-flash。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。