Ling-3.0-flash logo

Ling-3.0-flash

開く

inclusionAI の MIT ハイブリッド線形 MoE。総パラメータ 124B、活性化 5.1B。2026-08-21 に Hugging Face で再確認。

共有:

Ling-3.0-flash

Ling-3.0-flash は inclusionAI の次世代ネイティブハイブリッド推論モデルです。2026-08-21 に huggingface.co/inclusionAI/Ling-3.0-flash を再確認。カードのライセンスは MIT。総パラメータ 124B、活性化 5.1B(前世代 1T 級 Ring-2.6-1T の約 12.4% / 8.1%)。同日の Hugging Face は 355 likes、直近 30 日 16,219 ダウンロード。createdAt は 2026-08-02。

r/LocalLLaMA が Ling-3.0 をニュースにしたのは、AntLing が 6 個のベースチェックポイント(tiny / flash、それぞれ pretrained、mid-trained、WSM-merged)を出したからです。このページは本番向け flash instruct SKU であり、全チェックポイントではありません。

密な Apache 2.0 の 27B が欲しいなら Qwen3.8-27B。7.9B / 活性化 1.3B の兄弟は Hugging Face の Ling-3.0-tiny(本カタログに単独ページはまだない)。

主な機能

  • ハイブリッド線形 MoE:Kimi Delta Attention(KDA)と gated MLA を 5:1 で積み、1/64 スパース MoE。カード表は 35 KDA + 7 gated MLA、ルーティング専門家 512、活性化 8、共有 1、hidden size 2560、語彙 157,184。
  • コンテキスト日程:8K → 32K → 256K。SGLang cookbook は --context-length 262144
  • 思考は既定オン"chat_template_kwargs": {"enable_thinking": false} でリクエスト単位でオフ。flash カードの推奨サンプリングは temperature=0.6top_p=0.95top_k=20
  • カードが名指しするエージェント:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。ベンダー文であり、当サイトの評価ではない。
  • 推論:SGLang イメージ lmsysorg/sglang:dev-Ling-3.0-flashgithub.com/inclusionAI/vllm-ling-v3ling_3_0 ブランチ。カードは OpenRouter の inclusionai/ling-3.0-flash:free も書く。slug は再確認。

制約:Ling-3.0 ランタイムが要る。適当な vLLM ホイールでは足りない。カードの SWE-Bench はベンダーが OpenHands で測った数字。当サイトは再実行していない。

再確認した仕様

項目 出典
総 / 活性化 124B / 5.1B HF カード
ライセンス MIT 同上
Likes / 直近 30 日 DL 355 / 16,219 HF API、2026-08-21
SWE-Bench Pro(カード) 56.6 カード評価
AIME 2026(カード) 93.2 同上
ソフト価格 重み $0 MIT

スコアはカード上のベンダー数字として扱う。

使う場面

  • エージェントのコーディングループで、同程度のコンテキストなら活性化 5.1B の方が密 27B より安い。
  • すでに SGLang を使い lmsysorg/sglang:dev-Ling-3.0-flash を引ける人。
  • LocalLLaMA 読者が 6 個のベースを見て flash instruct を探している。

ノート PC だけなら兄弟カードの Ling-3.0-tiny(DGX Spark / M4 Pro の数字はそちら)から。この 124B ではない。

はじめに

  1. inclusionAI/Ling-3.0-flash を開く。
  2. SGLang cookbook に従う。
  3. docker pull lmsysorg/sglang:dev-Ling-3.0-flash。カードは 141GB 級なら --tp 4、80GB なら --tp 8
  4. SWE-Bench Pro を引用する前に自分のプロンプトで測る。

よくある質問

密モデルですか?

いいえ。スパース MoE で、トークンあたり 5.1B 活性化。

tiny と flash は?

tiny は 7.9B / 活性化 1.3B。inclusionAI/Ling-3.0-tiny。flash が 124B の本番 SKU。

素の vLLM で足りますか?

カードは inclusionAI/vllm-ling-v3ling_3_0 ブランチ。本流の版番号を捏造しない。

代替

  • Qwen3.8-27B:密な Apache 2.0。ローカルが単純。
  • DFlash 2:Qwen3.8-27B 用ドラフタ。チャットモデルではない。
  • Muse Spark 1.2:Meta のコーディング旗艦。API。MIT 重みではない。

コツ

  1. 理由がなければ思考を切らない。
  2. $0 ホスト席を約束する前に OpenRouter の :free を再確認。
  3. Ring-2.6-1T の数字をこのページにコピーしない。

まとめ

Ling-3.0-flash は LocalLLaMA が指していた MIT flash SKU です。総 124B、活性化 5.1B、256K 級コンテキスト、カードに SGLang イメージ。Hugging Face カード から始めてください。GPU に載らなければ tiny カードへ。

コメント

まだコメントがありません。最初のコメントを投稿してください!