GLM-5.3-Flash logo

GLM-5.3-Flash

打开

智谱首个原生多模态 GLM 系列模型(即此前匿名的 'Ox Alpha'):320B MoE、仅 18B 激活、1M 上下文、MIT 开源权重,输入定价 $0.15/百万 token。

分享:

GLM-5.3-Flash 是智谱(Z.ai)GLM-5 系列中首个原生多模态模型,2026 年 8 月 26 日发布,并被确认就是数日前匿名出现在 OpenRouter 上的 "Ox Alpha" 模型。它是一款 320B 参数的混合专家(MoE)模型,每次推理只激活 18B 参数,拥有 1M token 上下文窗口和 MIT 许可的开源权重。按 $0.15/百万 token 的输入定价,定位为面向智能体的高性价比长上下文开源模型。

模型规格

规格 GLM-5.3-Flash
架构 MoE,混合稀疏 + 线性注意力
总参数 320B
激活参数 每次前向 18B
输入模态 文本、图像、视频、文件(原生多模态)
上下文窗口 1M tokens
预训练语料 30T 多模态 tokens
推理模式 思考模式始终开启(不可关闭)
许可 MIT(Hugging Face 开放权重)
API 价格 $0.15 / 百万输入,$0.50 / 百万输出,$0.03 / 百万缓存输入

核心功能

  • 原生多模态:与早期 GLM 视觉改造版不同,该模型从头在 30 万亿多模态 token 语料上预训练,因此原生读取图像和视频输入。
  • 混合稀疏 + 线性注意力:GLM 系列首次将稀疏注意力与线性注意力层相结合,注意力计算减少约 3 倍、KV 缓存缩小约 4.4 倍(对比 GLM-5.3)。
  • 1M 上下文、低成本服务:更小的 KV 缓存是长上下文自托管可行的关键;320B MoE 仍需要可观内存,但远低于全注意力方案。
  • MIT 开源权重:权重可从 Hugging Face 以 MIT 许可下载,允许自托管和商用。
  • 始终思考:推理不可关闭,每次响应都会消耗推理 token;官方建议 temperature 1.0、top_p 0.95、最大化推理强度。
  • 接入 Coding Plan:纳入 GLM Coding Plan,额度提升 3 倍,非高峰时段 50% 折扣。

适用场景

谁应该使用这个工具?

  • 智能体开发者:长时间推理循环中重复上下文占大头,$0.03 缓存输入价格让重复上下文近乎免费。
  • 多模态管线:需要一个开源模型同时理解图像和视频。
  • 自托管团队:GPU 内存足够承载 320B MoE,4.4 倍更小的 KV 缓存让 1M 上下文服务成为可能。
  • 成本敏感团队:与每次任务成本高数倍的封闭前沿模型做对比。

解决的问题

  1. 长上下文服务成本:全注意力呈二次方增长并强制大 KV 缓存;混合设计同时降低两者。
  2. 多模态碎片化:一个模型取代独立的图像、视频编码器。
  3. 厂商锁定:MIT 开源权重让团队可脱离托管供应商,同时保留同一模型。

定价方案

路径 价格 备注
API 输入 $0.15 / 百万 token 缓存输入 $0.03 / 百万
API 输出 $0.50 / 百万 token
开源权重 免费(MIT) 自托管自担算力
GLM Coding Plan 3x 额度 + 非高峰 5 折 并入现有订阅

优势对比

相比竞品的优势

  1. 对比 GLM-5.3:长上下文服务能力更强且便宜得多,代价是激活参数更少。
  2. 对比 DeepSeek-V4-Flash 与 Kimi-K3:智谱称在所测基线中注意力计算最低,同时承认 KV 缓存略大于部分竞品。
  3. 对比封闭前沿模型:在同等长上下文智能体任务上,单任务成本低约一个数量级。

独特卖点

  • GLM 首款原生多模态,系从头预训练而非改造。
  • 据 Z.ai 称全程运行于国产 AI 芯片。
  • 以 "Ox Alpha" 身份匿名发布,是具有明确不训练承诺的罕见隐身预演。

用户评价

社区关注度极高。Patrick Collison 评价匿名 "Ox Alpha" 预览"令人印象深刻",引发大批开发者前来测试。指纹分析者用分词器探针宣称"99% 确定"其为智谱 GLM 家族,早于官方证实。基准测试者记录到强劲的编码分数,但社区在部分服务平台上指出其部署速度慢于部分同类快模型。

快速开始

入门指南

  1. 走 API:在 Z.ai 开放平台或智谱 bigmodel 平台调用模型 ID glm-5.3-flash,使用标准 OpenAI 兼容格式。
  2. 走 OpenRouterstealth/ox-alpha 列表让位于官方 GLM-5.3-Flash 列表;免费窗口约 8 月 27 日关闭,之后为标准定价。
  3. 自托管:从 Hugging Face 的 zai-org/GLM-5.3-Flash 下载权重,用你偏好的运行时服务;显存紧张时用量化版本。

集成

  • OpenAI 兼容的聊天、函数调用、流式输出与 JSON 结构化输出。
  • 图像 URL 或 Base64 输入。
  • Hugging Face Transformers、llama.cpp、Unsloth(GGUF)本地推理。

常见问题

GLM-5.3-Flash 和 GLM-5.3 是同一个吗?

不是。GLM-5.3-Flash 是全新训练的基座模型,而非 GLM-5.3 的蒸馏,且原生多模态,而 GLM-5.3 仅文本。

可以关闭思考吗?

不可以。思考始终开启,每次响应都会消耗推理 token,请据此规划预算。

它真的开源吗?

权重以 MIT 许可开放,允许商用与自托管。与所有开源权重发布一样,训练数据未公开。

什么是 "Ox Alpha"?

Ox Alpha 是 GLM-5.3-Flash 的匿名代号,8 月 26 日被 Z.ai 证实。它先匿名出现在 OpenRouter 上,靠独立社区使用验证后再挂上品牌。

替代方案

  • GLM-5.3:文本向编码旗舰,网络安全能力更强,但激活参数省得少。
  • Qwen3.8-Flash-Next:同日发布的另一款开源成本效率模型,125B 总参 / 6B 激活。
  • DeepSeek V4 Flash:成本敏感智能体部署的强劲开源选择。

使用技巧

  1. 为思考 token 留预算:推理不可关闭,按重复推理而非单轮估算单任务成本。
  2. 用足缓存输入:智能体循环反复发送系统提示与上下文,$0.03/百万缓存让上下文首轮后近乎免费。
  3. 单机服务需量化:320B MoE 即便只有 18B 激活仍需可观显存;选用适配量化或卸载到内存。

总结

GLM-5.3-Flash 是智谱对"便宜、长上下文、原生多模态开源权重"的押注,其注意力重构让 1M 上下文服务变得经济。对于看重单任务成本而非峰值基准的智能体开发者与多模态管线,它是当前开源空间中价值优势最明显的一档之一。建议从 Z.ai 官方公告Hugging Face 模型卡 入手。

评论

还没有评论。成为第一个评论的人!