Ling-3.0-tiny logo

Ling-3.0-tiny

開く

Ling-3.0-tiny は inclusionAI の MIT ハイブリッド線形 MoE。総パラメータ 7.9B、活性化 1.3B。

共有:
代替ツールを見る

Ling-3.0-tiny は inclusionAI の軽量ハイブリッド推論 MoE です。2026-09-08 に huggingface.co/inclusionAI/Ling-3.0-tiny を再確認。カードのライセンスは MIT。総パラメータ 7.9B、トークンあたり活性化 1.3B。同日の Hugging Face は 431 likes、直近 30 日 27,485 ダウンロード。createdAt は 2026-08-10。r/LocalLLaMA では Spark-X2.5-4B と Nanbeige4.2-3B と同じ小モデルスレッドで比較されていました。

124B / 活性化 5.1B の本番 SKU が欲しいなら Ling-3.0-flash。密な Apache 2.0 の 4B なら Spark-X2.5-4B。より大きい密なローカルモデルなら Qwen3.8-27B

主な機能

  • 効率的なハイブリッド線形 MoE:Kimi Delta Attention(KDA)と MLA を 3:1 で積む(4 層ブロックあたり KDA 3 + MLA 1)。スパース MoE FFN はルーティング専門家 128。各トークンはルーティング 8 + 共有 1 を活性化。
  • ネイティブハイブリッド推論:思考は既定オン。"chat_template_kwargs": {"enable_thinking": false} でリクエスト単位でオフ。tiny カードの推奨サンプリングは temperature=1.0top_p=0.95top_k=20
  • カード上のエッジ数字:NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini で検証。FP8 で DGX Spark 約 100-105 tok/s、M4 Pro 約 86-90 tok/s、8K コンテキストのピーク約 8.34 GiB。ベンダー計測として扱う。
  • 推論:SGLang イメージ lmsysorg/sglang:dev-Ling-3.0-tiny、カードの vLLM 手順、ollama/ollama#17643 経由の実験的 Ollama MLX。カードは OpenRouter の inclusionai/ling-3.0-tiny:free も書く。slug は再確認。
  • コンテキスト:SGLang cookbook は --context-length 262144 と YaRN。

制約:Ling-3.0 ランタイムが要る。適当な vLLM ホイールでは足りない。Ollama 対応は PR であり公式リリースではない。カードのスコア(Artificial Analysis Intelligence Index v4.1.1 25、Agentic Index 16)はベンダー引用。当サイトは再実行していない。

再確認した仕様

項目 出典
総 / 活性化 7.9B / 1.3B HF カード
ライセンス MIT 同上
likes / 直近 30 日 DL 431 / 27,485 HF API、2026-09-08
ソフトウェア価格 重み $0 MIT

使用シナリオ

  • ノート PC と DGX SparkLing-3.0-flash を載せられない人。
  • 思考と ling3 ツールパーサが欲しく、124B チェックポイントは要らないエージェントループ。
  • LocalLLaMA 読者で tiny / flash 行列を見て 1.3B 活性化の instruct 線が欲しい人。

141GB 級 GPU が 4 枚あるなら flash から始める。このページからではない。

はじめに

  1. inclusionAI/Ling-3.0-tiny を開く。
  2. SGLang cookbook に従う。
  3. docker pull lmsysorg/sglang:dev-Ling-3.0-tiny し、カードどおり --tp 1 で起動。
  4. 自分のプロンプトで測ってから AA 指数を引用する。

第一ソース:Ling-3.0-tiny モデルカード

よくある質問

密なモデルですか?

いいえ。スパース MoE。トークンあたり活性化 1.3B。

tiny と flash の違いは?

tiny は 7.9B / 活性化 1.3B。Ling-3.0-flash は 124B / 活性化 5.1B。

公式 Ollama は使えますか?

公式バイナリは不可。カードは PR 17643 からビルドし、Apple Silicon の MLX のみ。

代替案

ヒント

  1. 理由がなければ思考を切らない。tiny の推奨温度は 1.0 で、flash の 0.6 ではない。
  2. $0 ホスト席を約束する前に OpenRouter :free を確認。
  3. flash の SWE-Bench 数字をこのページにコピーしない。

まとめ

Ling-3.0-tiny は LocalLLaMA が指していた MIT tiny SKU です。総 7.9B、活性化 1.3B、256K 級コンテキスト、カードに SGLang イメージ。Hugging Face カード から始める。GPU が flash を載せられるなら Ling-3.0-flash へ。

コメント

まだコメントがありません。最初のコメントを投稿してください!