Ling-3.0-tiny は inclusionAI の軽量ハイブリッド推論 MoE です。2026-09-08 に huggingface.co/inclusionAI/Ling-3.0-tiny を再確認。カードのライセンスは MIT。総パラメータ 7.9B、トークンあたり活性化 1.3B。同日の Hugging Face は 431 likes、直近 30 日 27,485 ダウンロード。createdAt は 2026-08-10。r/LocalLLaMA では Spark-X2.5-4B と Nanbeige4.2-3B と同じ小モデルスレッドで比較されていました。
124B / 活性化 5.1B の本番 SKU が欲しいなら Ling-3.0-flash。密な Apache 2.0 の 4B なら Spark-X2.5-4B。より大きい密なローカルモデルなら Qwen3.8-27B。
主な機能
- 効率的なハイブリッド線形 MoE:Kimi Delta Attention(KDA)と MLA を 3:1 で積む(4 層ブロックあたり KDA 3 + MLA 1)。スパース MoE FFN はルーティング専門家 128。各トークンはルーティング 8 + 共有 1 を活性化。
- ネイティブハイブリッド推論:思考は既定オン。
"chat_template_kwargs": {"enable_thinking": false}でリクエスト単位でオフ。tiny カードの推奨サンプリングはtemperature=1.0、top_p=0.95、top_k=20。 - カード上のエッジ数字:NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini で検証。FP8 で DGX Spark 約 100-105 tok/s、M4 Pro 約 86-90 tok/s、8K コンテキストのピーク約 8.34 GiB。ベンダー計測として扱う。
- 推論:SGLang イメージ
lmsysorg/sglang:dev-Ling-3.0-tiny、カードの vLLM 手順、ollama/ollama#17643 経由の実験的 Ollama MLX。カードは OpenRouter のinclusionai/ling-3.0-tiny:freeも書く。slug は再確認。 - コンテキスト:SGLang cookbook は
--context-length 262144と YaRN。
制約:Ling-3.0 ランタイムが要る。適当な vLLM ホイールでは足りない。Ollama 対応は PR であり公式リリースではない。カードのスコア(Artificial Analysis Intelligence Index v4.1.1 25、Agentic Index 16)はベンダー引用。当サイトは再実行していない。
再確認した仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 総 / 活性化 | 7.9B / 1.3B | HF カード |
| ライセンス | MIT | 同上 |
| likes / 直近 30 日 DL | 431 / 27,485 | HF API、2026-09-08 |
| ソフトウェア価格 | 重み $0 | MIT |
使用シナリオ
- ノート PC と DGX Spark で Ling-3.0-flash を載せられない人。
- 思考と
ling3ツールパーサが欲しく、124B チェックポイントは要らないエージェントループ。 - LocalLLaMA 読者で tiny / flash 行列を見て 1.3B 活性化の instruct 線が欲しい人。
141GB 級 GPU が 4 枚あるなら flash から始める。このページからではない。
はじめに
- inclusionAI/Ling-3.0-tiny を開く。
- SGLang cookbook に従う。
docker pull lmsysorg/sglang:dev-Ling-3.0-tinyし、カードどおり--tp 1で起動。- 自分のプロンプトで測ってから AA 指数を引用する。
第一ソース:Ling-3.0-tiny モデルカード。
よくある質問
密なモデルですか?
いいえ。スパース MoE。トークンあたり活性化 1.3B。
tiny と flash の違いは?
tiny は 7.9B / 活性化 1.3B。Ling-3.0-flash は 124B / 活性化 5.1B。
公式 Ollama は使えますか?
公式バイナリは不可。カードは PR 17643 からビルドし、Apple Silicon の MLX のみ。
代替案
- Ling-3.0-flash:124B 本番 SKU。
- Spark-X2.5-4B:密な Apache 2.0 4B、ネイティブ 1M コンテキスト。
- Qwen3.8-27B:より密な Apache 2.0、ローカル配備が単純。
ヒント
- 理由がなければ思考を切らない。tiny の推奨温度は 1.0 で、flash の 0.6 ではない。
- $0 ホスト席を約束する前に OpenRouter
:freeを確認。 - flash の SWE-Bench 数字をこのページにコピーしない。
まとめ
Ling-3.0-tiny は LocalLLaMA が指していた MIT tiny SKU です。総 7.9B、活性化 1.3B、256K 級コンテキスト、カードに SGLang イメージ。Hugging Face カード から始める。GPU が flash を載せられるなら Ling-3.0-flash へ。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。