NVIDIA Nemotron 3.5 Lightning 30B A3B は 2026 年 8 月 1 日にリリースされた、ローカル・単一 GPU 展開向けの高効率オープンウェイトモデルです。総パラメータ 30B のうち、トークンごとに活性化されるのはわずか 3B。Mamba-2 + MoE + Attention のハイブリッドアーキテクチャにより、スループットと会話・コーディング能力のバランスを両立しています。最大 1M トークンのコンテキストと設定可能な推論モードを備え、自前のハードウェアで最先端に近い能力を動かしたい開発者をターゲットにしています。
モデル仕様
| 仕様 | Nemotron 3.5 Lightning 30B A3B |
|---|---|
| 総パラメータ | 30B(活性化 3B) |
| アーキテクチャ | MoE: Mamba-2 + MoE + Attention ハイブリッド |
| 精度 | BF16 全精度リファレンスウェイト |
| コンテキスト長 | 最大 1M トークン(H100 単体では 256K 推奨) |
| 展開 | H100/A100 80GB 単体。Blackwell(GB200、RTX 5090)、Hopper、Ampere 対応 |
| ライセンス | OpenMDW-1.1 |
| 言語 | 英語とコーディング言語、スペイン語、フランス語、ドイツ語、イタリア語、日本語 |
主な特徴
- 活性化わずか 3B:30B 級の能力を小型モデル並みのスループットで提供し、80GB GPU 1 枚で動作。
- 設定可能な推論:チャットテンプレートで思考モードをオン/オフ(
enable_thinking=True/False)。高速応答と深い推論を切り替え可能。 - DSpark 投機的デコード:低並列データセンター展開向けにレイテンシを最適化。
- 長いコンテキスト:最大 1M トークン。検索集約型・エージェント型ワークロード向け。
- カスタマイズ前提:ポストトレーニング(SFT、RL、蒸留)、ドメイン適応、量子化バリアント開発を主用途として設計。
使用シナリオ
- ローカルコーディングアシスタント:データセンター GPU 1 枚で、API に依存せず十分な能力の推論モデルを実行。
- モデルカスタマイズ:全精度ウェイトを微調整・蒸留してドメイン特化モデルを構築。
- 研究・評価:BF16 リファレンスウェイトは高効率 MoE ハイブリッド研究のクリーンなベースライン。
優位性
- 効率性:10 倍のスパース性(総 30B / 活性 3B)により、Hopper と Blackwell の両方で優れた速度-品質比を実現。
- ライセンスの柔軟性:OpenMDW-1.1 ライセンスと公開済みポストトレーニングデータセットにより、オープンな研究と商用カスタマイズが可能。
- NVIDIA エコシステム:NVIDIA NIM、build.nvidia.com、Nemotron ツールチェーンとネイティブ統合。
はじめに
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b でオンライン体験するか、Hugging Face(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)から BF16 ウェイトをダウンロードします。ローカル展開では 80GB GPU に transformers または vLLM でロードし、難しいタスクでは思考モードを有効に、レイテンシ重視なら DSpark を利用します。
代替案
- Muse Glimmer:Meta の 30B デンスなエージェントモデル。24GB のコンシューマー GPU で動作。
- Qwen 3.6 27B:同サイズのデンスな競合モデル。
- DeepSeek V4:より大規模なオープン MoE モデル。効率のトレードオフが異なる。
まとめ
オープン・高効率・単一 GPU 展開が可能で、長いコンテキストと深いカスタマイズを備えた推論モデルをお探しなら、Nemotron 3.5 Lightning 30B A3B は現在最も実用的な選択肢の一つです。ハイブリッド構成と 3B 活性化設計により、オンプレミス展開で最先端に最も近いモデルとなっています。
コメント
まだコメントがありません。最初のコメントを投稿してください!