Ling-3.0-tiny logo

Ling-3.0-tiny

打开

Ling-3.0-tiny 是 inclusionAI 的 MIT 混合线性 MoE:总参 7.9B,激活 1.3B,面向本地智能体。

分享:
查看替代方案

Ling-3.0-tiny 是 inclusionAI 的轻量混合推理 MoE。2026-09-08 在 huggingface.co/inclusionAI/Ling-3.0-tiny 复核。卡片协议 MIT。卡片写明总参 7.9B、每 token 激活 1.3B。当天 Hugging Face 显示 431 likes、近 30 天 27,485 次下载。createdAt 为 2026-08-10。r/LocalLLaMA 同一帖里拿它和 Spark-X2.5-4B、Nanbeige4.2-3B 比小模型。

若要 124B / 激活 5.1B 的生产 SKU,看 Ling-3.0-flash。若要稠密 Apache 2.0 的 4B,看 Spark-X2.5-4B。若要更大的稠密本地模型,看 Qwen3.8-27B

核心功能

  • 高效混合线性 MoE:Kimi Delta Attention(KDA)与 MLA 按 3:1 堆叠(每 4 层 3 个 KDA 再 1 个 MLA)。稀疏 MoE FFN 有 128 个路由专家。每 token 激活 8 个路由专家加 1 个共享专家。
  • 原生混合推理:默认开思考。可用 "chat_template_kwargs": {"enable_thinking": false} 按请求关掉。tiny 卡片推荐采样:temperature=1.0top_p=0.95top_k=20
  • 卡片上的端侧数字:在 NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini 上验证过。FP8 下卡片写 DGX Spark 约 100-105 tok/s、M4 Pro 约 86-90 tok/s,8K 上下文峰值约 8.34 GiB。当作厂商测量。
  • 推理:SGLang 镜像 lmsysorg/sglang:dev-Ling-3.0-tiny,卡片上的 vLLM 安装路径,以及经 ollama/ollama#17643 的实验性 Ollama MLX 路径。卡片还写了 OpenRouter 的 inclusionai/ling-3.0-tiny:free,上线前请核 slug。
  • 上下文:SGLang cookbook 用 --context-length 262144 加 YaRN。

限制:需要 Ling-3.0 运行时,不能随便拿一个 vLLM 轮子。Ollama 支持是 PR,不是官方发行。卡片分数(Artificial Analysis Intelligence Index v4.1.1 25、Agentic Index 16)是厂商引用。我们没有复跑。

复核过的规格

项目 数值 来源
总参 / 激活 7.9B / 1.3B HF 卡片
协议 MIT 同上
likes / 近 30 天下载 431 / 27,485 HF API,2026-09-08
软件价格 权重 $0 MIT

适用场景

  • 笔记本和 DGX Spark 用户,装不下 Ling-3.0-flash
  • 智能体循环,要思考加 ling3 工具解析器,又不想上 124B 检查点。
  • LocalLLaMA 读者,看过 tiny / flash 矩阵,想要 1.3B 激活的 instruct 线。

如果你有 4 张 141GB 级 GPU,从 flash 起步,不要从这页起步。

快速开始

  1. 打开 inclusionAI/Ling-3.0-tiny
  2. SGLang cookbook
  3. docker pull lmsysorg/sglang:dev-Ling-3.0-tiny,按卡片用 --tp 1 启动。
  4. 用自己的提示词测,再引用 AA 指数。

第一方资源:Ling-3.0-tiny 模型卡

常见问题

是稠密模型吗?

不是。稀疏 MoE。每 token 激活 1.3B。

tiny 和 flash 差在哪?

tiny 是 7.9B / 激活 1.3B。Ling-3.0-flash 是 124B / 激活 5.1B。

能用官方 Ollama 吗?

不能用官方二进制。卡片从 PR 17643 编译,且仅限 Apple Silicon 上的 MLX。

替代方案

使用技巧

  1. 没有理由就别关思考。tiny 推荐温度是 1.0,不是 flash 的 0.6。
  2. 承诺 $0 托管席位前,先核 OpenRouter :free
  3. 不要把 flash 的 SWE-Bench 数字抄到这页。

总结

Ling-3.0-tiny 是 LocalLLaMA 指向的 MIT tiny SKU:总参 7.9B、激活 1.3B、256K 级上下文,卡片上有 SGLang 镜像。从 Hugging Face 卡片 开始。GPU 装得下 flash 就去 Ling-3.0-flash

评论

还没有评论。成为第一个评论的人!