Gemma 4 26B A4B 是 Google DeepMind Gemma 4 开源权重家族中的混合专家(MoE)型号,2026 年 4 月 2 日发布,权重自 3 月 11 日起在 Hugging Face 开放。总参数 25.2B,每 token 仅激活 3.8B,以大模型级的知识容量跑出小模型级的速度,采用 Apache 2.0 协议。
模型规格
| 规格 | Gemma 4 26B A4B |
|---|---|
| 总参数 | 25.2B |
| 激活参数 | 每 token 3.8B |
| 专家 | 128 个专家激活 8 个 + 1 个共享专家,30 层,1024 token 滑动窗口 |
| 上下文长度 | 256K token,词表 262K |
| 模态 | 文本 + 图像输入(约 550M 视觉编码器),文本输出 |
| 协议 | Apache 2.0(商用友好) |
核心特点
- MoE 速度:每 token 仅激活约 4B 参数,远快于同量级稠密模型。
- 256K 上下文:长文档与大型代码库一次装下。
- 思考模式:难题用原生推理,日常保持快速响应。
- 多模态输入:约 550M 参数视觉编码器理解图文。
- 开放可部署:Apache 2.0 免费商用;BF16 单张 80GB H100 可跑,量化版可在消费级显卡运行。
适用场景
- 本地编码助手:消费级显卡驱动 IDE 编程辅助,无需 API。
- 智能体工作流:长上下文加思考模式;Google 已接入 Android Studio 的 Agent Mode。
- 文档与图像理解:长报告、截图与图文混排分析。
- 多语言产品:支持 140+ 种语言。
价格与获取
权重基于 Apache 2.0 免费下载,Google AI Studio 可免费体验 26B MoE。除自选托管成本外无 API 费用:可在自有 GPU 自托管,或用第三方推理平台仅付算力费。
优势对比
- 对比 Llama:Llama 同量级为稠密架构;Gemma 4 以约 4B 激活参数达到同级质量,位列 Arena AI 文本榜开源第 6。
- 对比 Qwen:Qwen 有强大开源 MoE,但 Gemma 4 自带 Google 工具链(AI Studio、端侧 AICore、Android Studio Agent Mode)与 262K 多语言词表。
- 生态:Gemma 累计下载超 4 亿次、社区变体超 10 万,微调与工具跟进快。
快速开始
- 免费体验:打开 Google AI Studio 选择 26B MoE。
- 下载权重:Hugging Face 拉取
gemma-4-26b-a4b-it(约 1010 万下载、1391 点赞)。 - 部署:单张 80GB H100 跑 BF16,或消费级显卡跑量化版。
常见问题
可以商用吗?
可以,Apache 2.0 协议商用友好。
需要什么硬件?
BF16 单张 80GB H100;每 token 仅激活约 3.8B 参数,量化版可在消费级显卡原生运行。
排名如何?
Arena AI 文本榜开源第 6;同系列 31B 排名第 3。
替代方案
- Meta Llama 3.2 1B Instruct:小得多的端侧稠密 Llama。
- Qwen 3.8 27B:同尺寸级稠密开源竞品。
- Qwen 3.8 2.4T A95B:追求极致能力的超大规模开源 MoE。
使用技巧
- 思考模式只在难题时开启。
- 本地先用量化版。
- 整个仓库或长文档直接输入,不必切分,256K 足够容纳。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
ChatGPT 额度不够用?在 Codex 里切换 DeepSeek 和 Grok
Codex Router 让你继续使用熟悉的 Codex 工作台,同时把任务交给 DeepSeek、Grok 等外部模型。看懂它怎样工作、额度怎么算,以及“不用翻墙”的前提。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。

Obsidian CLI + Codex:把笔记库变成 Agent 的知识引擎
Obsidian CLI 让 Codex、Claude Code、Gemini CLI 等 Agent 能以可搜索、可追踪、保留双链语义的方式读写本地 Vault。本文用真实社区案例和可复制工作流说明如何搭建。