NVIDIA Nemotron 3.5 Lightning 30B A3B 于 2026 年 8 月 1 日发布,是为本地与单卡部署设计的高效开源权重模型。30B 总参数每次推理仅激活 3B,采用 Mamba-2 + MoE + Attention 混合架构,在吞吐与对话、编码能力之间取得平衡。配合最长 1M token 上下文与可配置推理模式,它面向希望在自有硬件上运行接近前沿能力模型的开发者。
模型规格
| 规格 | Nemotron 3.5 Lightning 30B A3B |
|---|---|
| 总参数 | 30B(激活 3B) |
| 架构 | MoE:Mamba-2 + MoE + Attention 混合 |
| 精度 | BF16 全精度参考权重 |
| 上下文长度 | 最长 1M token(单张 H100 建议 256K) |
| 部署 | 单张 H100/A100 80GB;支持 Blackwell(GB200、RTX 5090)、Hopper、Ampere |
| 协议 | OpenMDW-1.1 |
| 语言 | 英语及编码语言、西班牙语、法语、德语、意大利语、日语 |
核心特点
- 仅 3B 激活参数:30B 级能力搭配小模型级吞吐,单张 80GB 显卡即可运行。
- 可配置推理:通过聊天模板开关思考模式(
enable_thinking=True/False),在快速响应与深度推理之间自由切换。 - DSpark 投机解码:针对低并发数据中心部署优化,降低延迟。
- 长上下文:最长 1M token,适合检索密集与智能体任务;单卡实际常用 256K。
- 为定制而生:官方定位为后训练(SFT、RL、蒸馏)、领域适配与量化变体研究的最优起点。
适用场景
- 本地编码助手:单张数据中心显卡即可运行有能力的推理模型,不依赖 API。
- 模型定制:基于全精度权重微调或蒸馏,构建领域专属模型。
- 研究与评估:BF16 参考权重是研究高效 MoE 混合架构的干净基线。
优势对比
- 效率突出:10 倍稀疏度(30B 总参、3B 激活)在 Hopper 与 Blackwell 上都有优异的性能-速度比。
- 协议友好:OpenMDW-1.1 许可并附带后训练数据集,支持开源研究与商用定制。
- NVIDIA 生态:与 NVIDIA NIM、build.nvidia.com 及 Nemotron 工具链原生集成。
快速开始
在 build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b 在线体验,或从 Hugging Face(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)下载 BF16 权重。本地部署时在 80GB 显卡上用 transformers 或 vLLM 加载,困难任务开启思考模式,延迟敏感场景可启用 DSpark。
替代方案
- Muse Glimmer:Meta 的 30B 稠密智能体模型,可在 24GB 消费级显卡上运行。
- Qwen 3.6 27B:同尺寸稠密竞品,基准表现接近。
- DeepSeek V4:规模更大的开源 MoE,效率取舍不同。
总结
需要一款开源、高效、可单卡部署且具备长上下文与深度定制能力的推理模型时,Nemotron 3.5 Lightning 30B A3B 是当前最务实的选择之一。混合架构与 3B 激活设计,让它成为本地私有化部署中最接近前沿水平的选项。
评论
还没有评论。成为第一个评论的人!
相关工具
Kimi K3
www.kimi.com
月之暗面(Moonshot AI)开源的 2.8T 参数多模态智能体模型,1M token 上下文,全球首个开源 3T 级模型,在编码与智能体基准上逼近封闭前沿模型。
NVIDIA: Llama 3.1 Nemotron 70B Instruct
build.nvidia.com/nvidia/llama-3_1-nemotron-70b-instruct
NVIDIA的Llama 3.1 Nemotron 70B是一种旨在生成精确且有用回应的语言模型。
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic 前沿 Opus 级模型,1M token 上下文与可调思考强度,以 Opus 4.8 的价格带来接近 Fable 5 的智能水平,适合智能体与长周期编码任务。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。