NVIDIA Nemotron 3.5 Lightning 30B A3B logo

NVIDIA Nemotron 3.5 Lightning 30B A3B

打开

NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。

分享:

NVIDIA Nemotron 3.5 Lightning 30B A3B 于 2026 年 8 月 1 日发布,是为本地与单卡部署设计的高效开源权重模型。30B 总参数每次推理仅激活 3B,采用 Mamba-2 + MoE + Attention 混合架构,在吞吐与对话、编码能力之间取得平衡。配合最长 1M token 上下文与可配置推理模式,它面向希望在自有硬件上运行接近前沿能力模型的开发者。

模型规格

规格 Nemotron 3.5 Lightning 30B A3B
总参数 30B(激活 3B)
架构 MoE:Mamba-2 + MoE + Attention 混合
精度 BF16 全精度参考权重
上下文长度 最长 1M token(单张 H100 建议 256K)
部署 单张 H100/A100 80GB;支持 Blackwell(GB200、RTX 5090)、Hopper、Ampere
协议 OpenMDW-1.1
语言 英语及编码语言、西班牙语、法语、德语、意大利语、日语

核心特点

  • 仅 3B 激活参数:30B 级能力搭配小模型级吞吐,单张 80GB 显卡即可运行。
  • 可配置推理:通过聊天模板开关思考模式(enable_thinking=True/False),在快速响应与深度推理之间自由切换。
  • DSpark 投机解码:针对低并发数据中心部署优化,降低延迟。
  • 长上下文:最长 1M token,适合检索密集与智能体任务;单卡实际常用 256K。
  • 为定制而生:官方定位为后训练(SFT、RL、蒸馏)、领域适配与量化变体研究的最优起点。

适用场景

  • 本地编码助手:单张数据中心显卡即可运行有能力的推理模型,不依赖 API。
  • 模型定制:基于全精度权重微调或蒸馏,构建领域专属模型。
  • 研究与评估:BF16 参考权重是研究高效 MoE 混合架构的干净基线。

优势对比

  1. 效率突出:10 倍稀疏度(30B 总参、3B 激活)在 Hopper 与 Blackwell 上都有优异的性能-速度比。
  2. 协议友好:OpenMDW-1.1 许可并附带后训练数据集,支持开源研究与商用定制。
  3. NVIDIA 生态:与 NVIDIA NIM、build.nvidia.com 及 Nemotron 工具链原生集成。

快速开始

build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b 在线体验,或从 Hugging Face(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)下载 BF16 权重。本地部署时在 80GB 显卡上用 transformers 或 vLLM 加载,困难任务开启思考模式,延迟敏感场景可启用 DSpark。

替代方案

  • Muse Glimmer:Meta 的 30B 稠密智能体模型,可在 24GB 消费级显卡上运行。
  • Qwen 3.6 27B:同尺寸稠密竞品,基准表现接近。
  • DeepSeek V4:规模更大的开源 MoE,效率取舍不同。

总结

需要一款开源、高效、可单卡部署且具备长上下文与深度定制能力的推理模型时,Nemotron 3.5 Lightning 30B A3B 是当前最务实的选择之一。混合架构与 3B 激活设计,让它成为本地私有化部署中最接近前沿水平的选项。

评论

还没有评论。成为第一个评论的人!