Ling-3.0-flash
Ling-3.0-flash は inclusionAI の次世代ネイティブハイブリッド推論モデルです。2026-08-21 に huggingface.co/inclusionAI/Ling-3.0-flash を再確認。カードのライセンスは MIT。総パラメータ 124B、活性化 5.1B(前世代 1T 級 Ring-2.6-1T の約 12.4% / 8.1%)。同日の Hugging Face は 355 likes、直近 30 日 16,219 ダウンロード。createdAt は 2026-08-02。
r/LocalLLaMA が Ling-3.0 をニュースにしたのは、AntLing が 6 個のベースチェックポイント(tiny / flash、それぞれ pretrained、mid-trained、WSM-merged)を出したからです。このページは本番向け flash instruct SKU であり、全チェックポイントではありません。
密な Apache 2.0 の 27B が欲しいなら Qwen3.8-27B。7.9B / 活性化 1.3B の兄弟は Ling-3.0-tiny。
主な機能
- ハイブリッド線形 MoE:Kimi Delta Attention(KDA)と gated MLA を 5:1 で積み、1/64 スパース MoE。カード表は 35 KDA + 7 gated MLA、ルーティング専門家 512、活性化 8、共有 1、hidden size 2560、語彙 157,184。
- コンテキスト日程:8K → 32K → 256K。SGLang cookbook は
--context-length 262144。 - 思考は既定オン:
"chat_template_kwargs": {"enable_thinking": false}でリクエスト単位でオフ。flash カードの推奨サンプリングはtemperature=0.6、top_p=0.95、top_k=20。 - カードが名指しするエージェント:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。ベンダー文であり、当サイトの評価ではない。
- 推論:SGLang イメージ
lmsysorg/sglang:dev-Ling-3.0-flashと github.com/inclusionAI/vllm-ling-v3 のling_3_0ブランチ。カードは OpenRouter のinclusionai/ling-3.0-flash:freeも書く。slug は再確認。
制約:Ling-3.0 ランタイムが要る。適当な vLLM ホイールでは足りない。カードの SWE-Bench はベンダーが OpenHands で測った数字。当サイトは再実行していない。
再確認した仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 総 / 活性化 | 124B / 5.1B | HF カード |
| ライセンス | MIT | 同上 |
| Likes / 直近 30 日 DL | 355 / 16,219 | HF API、2026-08-21 |
| SWE-Bench Pro(カード) | 56.6 | カード評価 |
| AIME 2026(カード) | 93.2 | 同上 |
| ソフト価格 | 重み $0 | MIT |
スコアはカード上のベンダー数字として扱う。
使う場面
- エージェントのコーディングループで、同程度のコンテキストなら活性化 5.1B の方が密 27B より安い。
- すでに SGLang を使い
lmsysorg/sglang:dev-Ling-3.0-flashを引ける人。 - LocalLLaMA 読者が 6 個のベースを見て flash instruct を探している。
ノート PC だけなら兄弟カードの Ling-3.0-tiny(DGX Spark / M4 Pro の数字はそちら)から。この 124B ではない。
はじめに
- inclusionAI/Ling-3.0-flash を開く。
- SGLang cookbook に従う。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash。カードは 141GB 級なら--tp 4、80GB なら--tp 8。- SWE-Bench Pro を引用する前に自分のプロンプトで測る。
よくある質問
密モデルですか?
いいえ。スパース MoE で、トークンあたり 5.1B 活性化。
tiny と flash は?
tiny は 7.9B / 活性化 1.3B。Ling-3.0-tiny。flash が 124B の本番 SKU。
素の vLLM で足りますか?
カードは inclusionAI/vllm-ling-v3 の ling_3_0 ブランチ。本流の版番号を捏造しない。
代替
- Qwen3.8-27B:密な Apache 2.0。ローカルが単純。
- DFlash 2:Qwen3.8-27B 用ドラフタ。チャットモデルではない。
- Muse Spark 1.2:Meta のコーディング旗艦。API。MIT 重みではない。
コツ
- 理由がなければ思考を切らない。
- $0 ホスト席を約束する前に OpenRouter の
:freeを再確認。 - Ring-2.6-1T の数字をこのページにコピーしない。
まとめ
Ling-3.0-flash は LocalLLaMA が指していた MIT flash SKU です。総 124B、活性化 5.1B、256K 級コンテキスト、カードに SGLang イメージ。Hugging Face カード から始めてください。GPU に載らなければ tiny カードへ。
使用シナリオ
- Ling-3.0-flash が自分のワークフローをカバーするか先に確認したい場合。
コメント
まだコメントがありません。最初のコメントを投稿してください!