Ling-3.0-flash-VL は inclusionAI の Ling-3.0-flash スタック上のネイティブマルチモーダル SKU です。Hugging Face カード のライセンスは MIT。総パラメータ 124B、トークンあたり活性化 5.5B、画像と動画入力、コンテキスト最大 1M トークン。2026-09-09 の Hugging Face は 31 likes、直近 30 日 42 ダウンロード。createdAt は 2026-09-04。r/LocalLLaMA はカードをホットリストに載せました。
これは Ling-3.0-flash ではありません。Flash はテキストのハイブリッド推論 SKU(カード:活性化 5.1B)。Flash-VL は ViT エンコーダ、2 層 MLP プロジェクタ、VideoRoPE を足します。
テキストだけなら Ling-3.0-flash。Alibaba の疎なオープン MoE なら Qwen3.8-Flash-Next。スクリーンショットとテキストの Flash VLM なら DeepSeek-V4-Flash-Vision-Exp。
主な機能
- 視覚をループに入れる:カードは理解 / 推論 / 行動で書く。図表と文書、視覚証拠による多段階作業、それから UI 操作。
- ハイブリッドバックボーン:42 層を KDA と gated MLA で 5:1 に交互。疎 MoE が 124B 容量を 5.5B 活性化で保つ。
- VideoRoPE:空間と時間の符号化。カードはイベント定位、長尺動画 QA、クリップ編集を挙げる。
- 思考は既定オン:
"chat_template_kwargs": {"enable_thinking": false}でリクエスト単位オフ。カードのサンプリングはtemperature=0.6(評価注記は 1.0 も)、top_p=0.95、top_k=20。 - サーブ:SGLang イメージ
lmsysorg/sglang:dev-Ling-3.0-flash-VL、4x 141GB 級 GPU で 256K YaRN レシピ。vLLM 経路はinclusionAI/vllm-ling-v3フォークであり、在庫ホイールではない。
制約:Ling-3.0 VL ランタイムが必要。Artificial Analysis Intelligence Index v4.1.1 の 42(flash は 38)はベンダー引用。再実行していない。31 likes は熱量であり監査ではない。
仕様
| 項目 | 値 | 出典 |
|---|---|---|
| 総 / 活性化 | 124B / 5.5B | HF カード |
| ライセンス | MIT | 同カード |
| コンテキスト(カード) | 最大 1M;SGLang レシピ 256K YaRN | 同カード |
| likes / 直近 30 日 DL | 31 / 42 | HF API、2026-09-09 |
| AA Index v4.1.1(カード) | 42 | 同カード |
| ソフトウェア価格 | $0 重み | MIT |
使用シナリオ
- すでに Ling-3.0-flash を使うチームで、同じ MoE 家族に画像と動画が必要な場合。
- 256K 級レシピの長コンテキストマルチモーダルで、ベンダーを変えたくない場合。
- HF リンクを見て VL SKU が必要だった r/LocalLLaMA 読者。tiny やテキスト flash ではない。
7.9B / 活性化 1.3B のローカルテキストモデルなら Ling-3.0-tiny。
はじめに
- inclusionAI/Ling-3.0-flash-VL を開く。
docker pull lmsysorg/sglang:dev-Ling-3.0-flash-VL。- カードどおり
--tp 4 --context-length 262144と YaRN 上書きで起動。80GB カードではカードは--tp 8。 - OpenAI 互換チャット本体に
image_urlまたはvideo_urlを送る。
第一ソース:Ling-3.0-flash-VL の SGLang cookbook。
よくある質問
Apache-2.0 ですか?
違います。カードは MIT です。
活性化パラメータは Ling-3.0-flash と同じですか?
違います。Flash カードは活性化 5.1B。Flash-VL カードは活性化 5.5B。
在庫 vLLM でロードできますか?
ランダムなホイールとしてはできません。カードは inclusionAI/vllm-ling-v3 を指します。
代替案
- Ling-3.0-flash:テキストのハイブリッド推論 SKU。
- Qwen3.8-Flash-Next:Alibaba の疎なオープン MoE。
- DeepSeek-V4-Flash-Vision-Exp:MIT の Flash 視覚実験。
ヒント
- VL の Docker タグを使う。テキスト flash イメージは使わない。
- 短いキャプションだけでエージェント軌跡が不要なときだけ
enable_thinkingをオフ。 - flash の SWE 数字をこの VL ページにコピーしない。
Ling-3.0-flash-VL は r/LocalLLaMA が 2026 年 9 月にリンクした MIT マルチモーダル投入です。Hugging Face カードから始め、テキスト flash ですでに足りるか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。