Gemma 4 26B A4B logo

Gemma 4 26B A4B

打开

Google DeepMind 开源权重模型,25.2B 总参数 MoE 架构每 token 仅激活 3.8B,256K 上下文,支持图文多模态输入,Apache 2.0 商用友好协议。

分享:

Gemma 4 26B A4B 是 Google DeepMind Gemma 4 开源权重家族中的混合专家(MoE)型号,2026 年 4 月 2 日发布,权重自 3 月 11 日起在 Hugging Face 开放。总参数 25.2B,每 token 仅激活 3.8B,以大模型级的知识容量跑出小模型级的速度,采用 Apache 2.0 协议。

模型规格

规格 Gemma 4 26B A4B
总参数 25.2B
激活参数 每 token 3.8B
专家 128 个专家激活 8 个 + 1 个共享专家,30 层,1024 token 滑动窗口
上下文长度 256K token,词表 262K
模态 文本 + 图像输入(约 550M 视觉编码器),文本输出
协议 Apache 2.0(商用友好)

核心特点

  • MoE 速度:每 token 仅激活约 4B 参数,远快于同量级稠密模型。
  • 256K 上下文:长文档与大型代码库一次装下。
  • 思考模式:难题用原生推理,日常保持快速响应。
  • 多模态输入:约 550M 参数视觉编码器理解图文。
  • 开放可部署:Apache 2.0 免费商用;BF16 单张 80GB H100 可跑,量化版可在消费级显卡运行。

适用场景

  • 本地编码助手:消费级显卡驱动 IDE 编程辅助,无需 API。
  • 智能体工作流:长上下文加思考模式;Google 已接入 Android Studio 的 Agent Mode。
  • 文档与图像理解:长报告、截图与图文混排分析。
  • 多语言产品:支持 140+ 种语言。

价格与获取

权重基于 Apache 2.0 免费下载,Google AI Studio 可免费体验 26B MoE。除自选托管成本外无 API 费用:可在自有 GPU 自托管,或用第三方推理平台仅付算力费。

优势对比

  1. 对比 Llama:Llama 同量级为稠密架构;Gemma 4 以约 4B 激活参数达到同级质量,位列 Arena AI 文本榜开源第 6。
  2. 对比 Qwen:Qwen 有强大开源 MoE,但 Gemma 4 自带 Google 工具链(AI Studio、端侧 AICore、Android Studio Agent Mode)与 262K 多语言词表。
  3. 生态:Gemma 累计下载超 4 亿次、社区变体超 10 万,微调与工具跟进快。

快速开始

  1. 免费体验:打开 Google AI Studio 选择 26B MoE。
  2. 下载权重:Hugging Face 拉取 gemma-4-26b-a4b-it(约 1010 万下载、1391 点赞)。
  3. 部署:单张 80GB H100 跑 BF16,或消费级显卡跑量化版。

常见问题

可以商用吗?

可以,Apache 2.0 协议商用友好。

需要什么硬件?

BF16 单张 80GB H100;每 token 仅激活约 3.8B 参数,量化版可在消费级显卡原生运行。

排名如何?

Arena AI 文本榜开源第 6;同系列 31B 排名第 3。

替代方案

使用技巧

  1. 思考模式只在难题时开启。
  2. 本地先用量化版。
  3. 整个仓库或长文档直接输入,不必切分,256K 足够容纳。

总结

Gemma 4 26B A4B 集 Apache 2.0 开放权重、多模态输入、256K 上下文与 MoE 效率于一身,可在开发者自有硬件运行。想要接近前沿的质量又不想被 API 绑定,它是 Gemma 4 家族的理想起点之一。

评论

还没有评论。成为第一个评论的人!