Ling-3.0-flash
Ling-3.0-flash 是 inclusionAI 的下一代原生混合推理模型。2026-08-21 在 huggingface.co/inclusionAI/Ling-3.0-flash 复核。卡片协议 MIT。卡片写明总参 124B、激活 5.1B(约等于上一代 1T 级 Ring-2.6-1T 的 12.4% / 8.1%)。当天 Hugging Face 显示 355 likes、近 30 天 16,219 次下载。createdAt 为 2026-08-02。
r/LocalLLaMA 把 Ling-3.0 当新闻,是因为 AntLing 放出了六份基座检查点(tiny / flash,各有 pretrained、mid-trained、WSM-merged)。本页是生产用的 flash instruct SKU,不是每一份检查点。
若要稠密 Apache 2.0 的 27B,看 Qwen3.8-27B。若要 7.9B / 激活 1.3B 的兄弟型号,看 Hugging Face 上的 Ling-3.0-tiny(站内暂无独立词条)。
核心功能
- 混合线性 MoE:Kimi Delta Attention(KDA)与 gated MLA 按 5:1 堆叠,1/64 稀疏 MoE。卡片表:35 层 KDA + 7 层 gated MLA,512 个路由专家、激活 8 个、共享 1 个,hidden size 2560,词表 157,184。
- 上下文课表:8K 到 32K 到 256K。SGLang cookbook 用
--context-length 262144。 - 默认开思考:可用
"chat_template_kwargs": {"enable_thinking": false}按请求关掉。flash 卡片推荐采样:temperature=0.6、top_p=0.95、top_k=20。 - 卡片点名的智能体框架:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。这是厂商文案,不是我们的评测。
- 推理:SGLang 镜像
lmsysorg/sglang:dev-Ling-3.0-flash,以及 github.com/inclusionAI/vllm-ling-v3 的ling_3_0分支。卡片还写了 OpenRouter 的inclusionai/ling-3.0-flash:free,上线前请再核对 slug。
限制:需要 Ling-3.0 运行时,不能随便拿一个 vLLM 轮子。卡片上的 SWE-Bench 是厂商用 OpenHands 测的。我们没有复跑。
复核过的规格
| 项目 | 数值 | 来源 |
|---|---|---|
| 总参 / 激活 | 124B / 5.1B | HF 卡片 |
| 协议 | MIT | 同上 |
| Likes / 近 30 天下载 | 355 / 16,219 | HF API,2026-08-21 |
| SWE-Bench Pro(卡片) | 56.6 | 卡片评测 |
| AIME 2026(卡片) | 93.2 | 同上 |
| 软件价格 | 权重 $0 | MIT |
这些分数写在卡片上,按厂商数字对待。
适用场景
- 智能体写代码循环,激活 5.1B 比同等上下文的稠密 27B 更省。
- 已经在用 SGLang、能拉
lmsysorg/sglang:dev-Ling-3.0-flash的人。 - LocalLLaMA 读者看到六份基座检查点,想找 flash instruct 线。
只有笔记本的话,先看兄弟卡片上的 Ling-3.0-tiny(DGX Spark / M4 Pro 数字在那边),不要上这个 124B。
快速开始
- 打开 inclusionAI/Ling-3.0-flash。
- 跟 SGLang cookbook。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash。卡片写 141GB 级 GPU 用--tp 4,80GB 卡用--tp 8。- 引用 SWE-Bench Pro 之前,用自己的提示测一遍。
常见问题
是稠密模型吗?
不是。稀疏 MoE,每 token 激活 5.1B。
tiny 和 flash 差在哪?
tiny 是 7.9B / 激活 1.3B,见 inclusionAI/Ling-3.0-tiny。flash 是 124B 生产 SKU。
能用官方 vLLM 吗?
卡片安装的是 inclusionAI/vllm-ling-v3 的 ling_3_0 分支。不要编造主线版本号。
替代方案
- Qwen3.8-27B:稠密 Apache 2.0,本地部署更简单。
- DFlash 2:给 Qwen3.8-27B 用的草稿模型,不是聊天模型。
- Muse Spark 1.2:Meta 编码旗舰,走 API,不是 MIT 权重。
使用技巧
- 没有理由就不要关思考。
- 承诺 $0 托管席位前,再核对 OpenRouter 的
:free。 - 不要把 Ring-2.6-1T 的数字抄到本页。
总结
Ling-3.0-flash 是 LocalLLaMA 指向的那条 MIT flash SKU:总参 124B、激活 5.1B、256K 级上下文、卡片上有 SGLang 镜像。从 Hugging Face 卡片 开始。GPU 装不下就去 tiny 卡片。
评论
还没有评论。成为第一个评论的人!
相关工具
DFlash 2
inco.ai/blog/dflash2
Inco AI 的 Apache 2.0 块扩散推测解码草稿模型。2026-08-18 发布,覆盖 Qwen3.8-27B 与 Muse Glimmer。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
LFM 2.5-2.6B
www.liquid.ai
Liquid AI 专为端侧智能体负载训练的 2.6B 开源权重稠密模型,支持 128K 上下文与原生工具调用。
相关洞察
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。