Ling-3.0-flash
Ling-3.0-flash は inclusionAI の次世代ネイティブハイブリッド推論モデルです。2026-08-21 に huggingface.co/inclusionAI/Ling-3.0-flash を再確認。カードのライセンスは MIT。総パラメータ 124B、活性化 5.1B(前世代 1T 級 Ring-2.6-1T の約 12.4% / 8.1%)。同日の Hugging Face は 355 likes、直近 30 日 16,219 ダウンロード。createdAt は 2026-08-02。
r/LocalLLaMA が Ling-3.0 をニュースにしたのは、AntLing が 6 個のベースチェックポイント(tiny / flash、それぞれ pretrained、mid-trained、WSM-merged)を出したからです。このページは本番向け flash instruct SKU であり、全チェックポイントではありません。
密な Apache 2.0 の 27B が欲しいなら Qwen3.8-27B。7.9B / 活性化 1.3B の兄弟は Hugging Face の Ling-3.0-tiny(本カタログに単独ページはまだない)。
主な機能
- ハイブリッド線形 MoE:Kimi Delta Attention(KDA)と gated MLA を 5:1 で積み、1/64 スパース MoE。カード表は 35 KDA + 7 gated MLA、ルーティング専門家 512、活性化 8、共有 1、hidden size 2560、語彙 157,184。
- コンテキスト日程:8K → 32K → 256K。SGLang cookbook は
--context-length 262144。 - 思考は既定オン:
"chat_template_kwargs": {"enable_thinking": false}でリクエスト単位でオフ。flash カードの推奨サンプリングはtemperature=0.6、top_p=0.95、top_k=20。 - カードが名指しするエージェント:Claude Code、Kilo Code、Qwen Code、Hermes Agent、OpenClaw。ベンダー文であり、当サイトの評価ではない。
- 推論:SGLang イメージ
lmsysorg/sglang:dev-Ling-3.0-flashと github.com/inclusionAI/vllm-ling-v3 のling_3_0ブランチ。カードは OpenRouter のinclusionai/ling-3.0-flash:freeも書く。slug は再確認。
制約:Ling-3.0 ランタイムが要る。適当な vLLM ホイールでは足りない。カードの SWE-Bench はベンダーが OpenHands で測った数字。当サイトは再実行していない。
再確認した仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 総 / 活性化 | 124B / 5.1B | HF カード |
| ライセンス | MIT | 同上 |
| Likes / 直近 30 日 DL | 355 / 16,219 | HF API、2026-08-21 |
| SWE-Bench Pro(カード) | 56.6 | カード評価 |
| AIME 2026(カード) | 93.2 | 同上 |
| ソフト価格 | 重み $0 | MIT |
スコアはカード上のベンダー数字として扱う。
使う場面
- エージェントのコーディングループで、同程度のコンテキストなら活性化 5.1B の方が密 27B より安い。
- すでに SGLang を使い
lmsysorg/sglang:dev-Ling-3.0-flashを引ける人。 - LocalLLaMA 読者が 6 個のベースを見て flash instruct を探している。
ノート PC だけなら兄弟カードの Ling-3.0-tiny(DGX Spark / M4 Pro の数字はそちら)から。この 124B ではない。
はじめに
- inclusionAI/Ling-3.0-flash を開く。
- SGLang cookbook に従う。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash。カードは 141GB 級なら--tp 4、80GB なら--tp 8。- SWE-Bench Pro を引用する前に自分のプロンプトで測る。
よくある質問
密モデルですか?
いいえ。スパース MoE で、トークンあたり 5.1B 活性化。
tiny と flash は?
tiny は 7.9B / 活性化 1.3B。inclusionAI/Ling-3.0-tiny。flash が 124B の本番 SKU。
素の vLLM で足りますか?
カードは inclusionAI/vllm-ling-v3 の ling_3_0 ブランチ。本流の版番号を捏造しない。
代替
- Qwen3.8-27B:密な Apache 2.0。ローカルが単純。
- DFlash 2:Qwen3.8-27B 用ドラフタ。チャットモデルではない。
- Muse Spark 1.2:Meta のコーディング旗艦。API。MIT 重みではない。
コツ
- 理由がなければ思考を切らない。
- $0 ホスト席を約束する前に OpenRouter の
:freeを再確認。 - Ring-2.6-1T の数字をこのページにコピーしない。
まとめ
Ling-3.0-flash は LocalLLaMA が指していた MIT flash SKU です。総 124B、活性化 5.1B、256K 級コンテキスト、カードに SGLang イメージ。Hugging Face カード から始めてください。GPU に載らなければ tiny カードへ。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
DFlash 2
inco.ai/blog/dflash2
Inco AI の Apache 2.0 ブロック拡散ドラフトモデル。推測デコード用。2026-08-18 に Qwen3.8-27B と Muse Glimmer 向けを公開。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek のフラッグシップ 1.6T MoE モデル。活性化パラメータ 49B、1M トークンのコンテキスト、MIT ライセンスのオープンウェイトを備え、世界トップのコーディングスコアをクローズドモデルのごく一部の価格で実現。
LFM 2.5-2.6B
www.liquid.ai
Liquid AI がオンデバイスのエージェントワークロード向けに訓練したオープンウェイト 2.6B デンスモデル。128K コンテキストとネイティブなツール呼び出しに対応。
関連インサイト
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。