Gemma 4 26B A4B 是 Google DeepMind Gemma 4 开源权重家族中的混合专家(MoE)型号,2026 年 4 月 2 日发布,权重自 3 月 11 日起在 Hugging Face 开放。总参数 25.2B,每 token 仅激活 3.8B,以大模型级的知识容量跑出小模型级的速度,采用 Apache 2.0 协议。
模型规格
| 规格 | Gemma 4 26B A4B |
|---|---|
| 总参数 | 25.2B |
| 激活参数 | 每 token 3.8B |
| 专家 | 128 个专家激活 8 个 + 1 个共享专家,30 层,1024 token 滑动窗口 |
| 上下文长度 | 256K token,词表 262K |
| 模态 | 文本 + 图像输入(约 550M 视觉编码器),文本输出 |
| 协议 | Apache 2.0(商用友好) |
核心特点
- MoE 速度:每 token 仅激活约 4B 参数,远快于同量级稠密模型。
- 256K 上下文:长文档与大型代码库一次装下。
- 思考模式:难题用原生推理,日常保持快速响应。
- 多模态输入:约 550M 参数视觉编码器理解图文。
- 开放可部署:Apache 2.0 免费商用;BF16 单张 80GB H100 可跑,量化版可在消费级显卡运行。
适用场景
- 本地编码助手:消费级显卡驱动 IDE 编程辅助,无需 API。
- 智能体工作流:长上下文加思考模式;Google 已接入 Android Studio 的 Agent Mode。
- 文档与图像理解:长报告、截图与图文混排分析。
- 多语言产品:支持 140+ 种语言。
价格与获取
权重基于 Apache 2.0 免费下载,Google AI Studio 可免费体验 26B MoE。除自选托管成本外无 API 费用:可在自有 GPU 自托管,或用第三方推理平台仅付算力费。
优势对比
- 对比 Llama:Llama 同量级为稠密架构;Gemma 4 以约 4B 激活参数达到同级质量,位列 Arena AI 文本榜开源第 6。
- 对比 Qwen:Qwen 有强大开源 MoE,但 Gemma 4 自带 Google 工具链(AI Studio、端侧 AICore、Android Studio Agent Mode)与 262K 多语言词表。
- 生态:Gemma 累计下载超 4 亿次、社区变体超 10 万,微调与工具跟进快。
快速开始
- 免费体验:打开 Google AI Studio 选择 26B MoE。
- 下载权重:Hugging Face 拉取
gemma-4-26b-a4b-it(约 1010 万下载、1391 点赞)。 - 部署:单张 80GB H100 跑 BF16,或消费级显卡跑量化版。
常见问题
可以商用吗?
可以,Apache 2.0 协议商用友好。
需要什么硬件?
BF16 单张 80GB H100;每 token 仅激活约 3.8B 参数,量化版可在消费级显卡原生运行。
排名如何?
Arena AI 文本榜开源第 6;同系列 31B 排名第 3。
替代方案
- Meta Llama 3.2 1B Instruct:小得多的端侧稠密 Llama。
- Qwen 3.8 27B:同尺寸级稠密开源竞品。
- Qwen 3.8 2.4T A95B:追求极致能力的超大规模开源 MoE。
使用技巧
- 思考模式只在难题时开启。
- 本地先用量化版。
- 整个仓库或长文档直接输入,不必切分,256K 足够容纳。
总结
Gemma 4 26B A4B 集 Apache 2.0 开放权重、多模态输入、256K 上下文与 MoE 效率于一身,可在开发者自有硬件运行。想要接近前沿的质量又不想被 API 绑定,它是 Gemma 4 家族的理想起点之一。
评论
还没有评论。成为第一个评论的人!
相关工具
Kimi K3
www.kimi.com
月之暗面(Moonshot AI)开源的 2.8T 参数多模态智能体模型,1M token 上下文,全球首个开源 3T 级模型,在编码与智能体基准上逼近封闭前沿模型。
Qwen3.8-2.4T-A95B
qwen.ai
阿里巴巴旗舰 2.4T MoE 模型,激活参数 95B,1M token 上下文,原生多模态输入,PaperBench 与 OSWorld 全球登顶,史上最大的 Qwen 模型。
Google: Gemini 2.0 Flash
gemini.google.com
Google 下一代多模态 AI 模型,拥有 2 倍速度提升、原生工具使用和多模态输出能力。
相关洞察
6 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。