NVIDIA Nemotron 3.5 Lightning 30B A3B は 2026 年 8 月 1 日にリリースされた、ローカル・単一 GPU 展開向けの高効率オープンウェイトモデルです。総パラメータ 30B のうち、トークンごとに活性化されるのはわずか 3B。Mamba-2 + MoE + Attention のハイブリッドアーキテクチャにより、スループットと会話・コーディング能力のバランスを両立しています。最大 1M トークンのコンテキストと設定可能な推論モードを備え、自前のハードウェアで最先端に近い能力を動かしたい開発者をターゲットにしています。
モデル仕様
| 仕様 | Nemotron 3.5 Lightning 30B A3B |
|---|---|
| 総パラメータ | 30B(活性化 3B) |
| アーキテクチャ | MoE: Mamba-2 + MoE + Attention ハイブリッド |
| 精度 | BF16 全精度リファレンスウェイト |
| コンテキスト長 | 最大 1M トークン(H100 単体では 256K 推奨) |
| 展開 | H100/A100 80GB 単体。Blackwell(GB200、RTX 5090)、Hopper、Ampere 対応 |
| ライセンス | OpenMDW-1.1 |
| 言語 | 英語とコーディング言語、スペイン語、フランス語、ドイツ語、イタリア語、日本語 |
主な特徴
- 活性化わずか 3B:30B 級の能力を小型モデル並みのスループットで提供し、80GB GPU 1 枚で動作。
- 設定可能な推論:チャットテンプレートで思考モードをオン/オフ(
enable_thinking=True/False)。高速応答と深い推論を切り替え可能。 - DSpark 投機的デコード:低並列データセンター展開向けにレイテンシを最適化。
- 長いコンテキスト:最大 1M トークン。検索集約型・エージェント型ワークロード向け。
- カスタマイズ前提:ポストトレーニング(SFT、RL、蒸留)、ドメイン適応、量子化バリアント開発を主用途として設計。
使用シナリオ
- ローカルコーディングアシスタント:データセンター GPU 1 枚で、API に依存せず十分な能力の推論モデルを実行。
- モデルカスタマイズ:全精度ウェイトを微調整・蒸留してドメイン特化モデルを構築。
- 研究・評価:BF16 リファレンスウェイトは高効率 MoE ハイブリッド研究のクリーンなベースライン。
優位性
- 効率性:10 倍のスパース性(総 30B / 活性 3B)により、Hopper と Blackwell の両方で優れた速度-品質比を実現。
- ライセンスの柔軟性:OpenMDW-1.1 ライセンスと公開済みポストトレーニングデータセットにより、オープンな研究と商用カスタマイズが可能。
- NVIDIA エコシステム:NVIDIA NIM、build.nvidia.com、Nemotron ツールチェーンとネイティブ統合。
はじめに
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b でオンライン体験するか、Hugging Face(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)から BF16 ウェイトをダウンロードします。ローカル展開では 80GB GPU に transformers または vLLM でロードし、難しいタスクでは思考モードを有効に、レイテンシ重視なら DSpark を利用します。
代替案
- Muse Glimmer:Meta の 30B デンスなエージェントモデル。24GB のコンシューマー GPU で動作。
- Qwen 3.6 27B:同サイズのデンスな競合モデル。
- DeepSeek V4:より大規模なオープン MoE モデル。効率のトレードオフが異なる。
まとめ
オープン・高効率・単一 GPU 展開が可能で、長いコンテキストと深いカスタマイズを備えた推論モデルをお探しなら、Nemotron 3.5 Lightning 30B A3B は現在最も実用的な選択肢の一つです。ハイブリッド構成と 3B 活性化設計により、オンプレミス展開で最先端に最も近いモデルとなっています。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Kimi K3
www.kimi.com
Moonshot AI のオープンウェイト 2.8T パラメータ多モーダルエージェントモデル。1M トークンのコンテキストを備えた世界初のオープン 3T 級モデルで、コーディングとエージェントのベンチマークでクローズド最先端に迫る。
NVIDIA: Llama 3.1 Nemotron 70B Instruct
build.nvidia.com/nvidia/llama-3_1-nemotron-70b-instruct
NVIDIAのLlama 3.1 Nemotron 70Bは、正確で有用な応答を生成することを目的とした言語モデルです。
Claude Opus 4.5
www.anthropic.com
Anthropicの最も知的なモデルで、最大能力と実用的なパフォーマンスを組み合わせ、ユニークなeffortパラメータ制御と優れた長期コーディング効率を備えています。
関連インサイト
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。