NVIDIA Nemotron 3.5 Lightning 30B A3B 于 2026 年 8 月 1 日发布,是为本地与单卡部署设计的高效开源权重模型。30B 总参数每次推理仅激活 3B,采用 Mamba-2 + MoE + Attention 混合架构,在吞吐与对话、编码能力之间取得平衡。配合最长 1M token 上下文与可配置推理模式,它面向希望在自有硬件上运行接近前沿能力模型的开发者。
模型规格
| 规格 | Nemotron 3.5 Lightning 30B A3B |
|---|---|
| 总参数 | 30B(激活 3B) |
| 架构 | MoE:Mamba-2 + MoE + Attention 混合 |
| 精度 | BF16 全精度参考权重 |
| 上下文长度 | 最长 1M token(单张 H100 建议 256K) |
| 部署 | 单张 H100/A100 80GB;支持 Blackwell(GB200、RTX 5090)、Hopper、Ampere |
| 协议 | OpenMDW-1.1 |
| 语言 | 英语及编码语言、西班牙语、法语、德语、意大利语、日语 |
核心特点
- 仅 3B 激活参数:30B 级能力搭配小模型级吞吐,单张 80GB 显卡即可运行。
- 可配置推理:通过聊天模板开关思考模式(
enable_thinking=True/False),在快速响应与深度推理之间自由切换。 - DSpark 投机解码:针对低并发数据中心部署优化,降低延迟。
- 长上下文:最长 1M token,适合检索密集与智能体任务;单卡实际常用 256K。
- 为定制而生:官方定位为后训练(SFT、RL、蒸馏)、领域适配与量化变体研究的最优起点。
适用场景
- 本地编码助手:单张数据中心显卡即可运行有能力的推理模型,不依赖 API。
- 模型定制:基于全精度权重微调或蒸馏,构建领域专属模型。
- 研究与评估:BF16 参考权重是研究高效 MoE 混合架构的干净基线。
优势对比
- 效率突出:10 倍稀疏度(30B 总参、3B 激活)在 Hopper 与 Blackwell 上都有优异的性能-速度比。
- 协议友好:OpenMDW-1.1 许可并附带后训练数据集,支持开源研究与商用定制。
- NVIDIA 生态:与 NVIDIA NIM、build.nvidia.com 及 Nemotron 工具链原生集成。
快速开始
在 build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b 在线体验,或从 Hugging Face(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)下载 BF16 权重。本地部署时在 80GB 显卡上用 transformers 或 vLLM 加载,困难任务开启思考模式,延迟敏感场景可启用 DSpark。
替代方案
- Muse Glimmer:Meta 的 30B 稠密智能体模型,可在 24GB 消费级显卡上运行。
- Qwen 3.6 27B:同尺寸稠密竞品,基准表现接近。
- DeepSeek V4:规模更大的开源 MoE,效率取舍不同。
总结
需要一款开源、高效、可单卡部署且具备长上下文与深度定制能力的推理模型时,Nemotron 3.5 Lightning 30B A3B 是当前最务实的选择之一。混合架构与 3B 激活设计,让它成为本地私有化部署中最接近前沿水平的选项。
评论
还没有评论。成为第一个评论的人!
相关工具
Laguna S 2.1
poolside.ai
Poolside 开源权重编程模型:118B 总参 / 8B 激活 MoE、100 万 token 上下文、原生交错推理、OpenMDW-1.1 协议,专为智能体编程与长程任务打造。
LongCat 2.0
longcat.chat
美团开源 MoE 大模型:总参数 1.6T / 激活约 48B,1M 上下文,MIT 协议,擅长编码与智能体任务(2026-08-25)。
NVIDIA: Llama 3.1 Nemotron 70B Instruct
build.nvidia.com/nvidia/llama-3_1-nemotron-70b-instruct
上一代 NVIDIA Llama 3.1 Nemotron 70B Instruct 快照。复核:本站活开源路径是 Nemotron 3.5 Lightning。不是 2026 默认。
相关洞察

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。