GLM-5.3-Flash 是智谱(Z.ai)GLM-5 系列中首个原生多模态模型,2026 年 8 月 26 日发布,并被确认就是数日前匿名出现在 OpenRouter 上的 "Ox Alpha" 模型。它是一款 320B 参数的混合专家(MoE)模型,每次推理只激活 18B 参数,拥有 1M token 上下文窗口和 MIT 许可的开源权重。按 $0.15/百万 token 的输入定价,定位为面向智能体的高性价比长上下文开源模型。
模型规格
| 规格 | GLM-5.3-Flash |
|---|---|
| 架构 | MoE,混合稀疏 + 线性注意力 |
| 总参数 | 320B |
| 激活参数 | 每次前向 18B |
| 输入模态 | 文本、图像、视频、文件(原生多模态) |
| 上下文窗口 | 1M tokens |
| 预训练语料 | 30T 多模态 tokens |
| 推理模式 | 思考模式始终开启(不可关闭) |
| 许可 | MIT(Hugging Face 开放权重) |
| API 价格 | $0.15 / 百万输入,$0.50 / 百万输出,$0.03 / 百万缓存输入 |
核心功能
- 原生多模态:与早期 GLM 视觉改造版不同,该模型从头在 30 万亿多模态 token 语料上预训练,因此原生读取图像和视频输入。
- 混合稀疏 + 线性注意力:GLM 系列首次将稀疏注意力与线性注意力层相结合,注意力计算减少约 3 倍、KV 缓存缩小约 4.4 倍(对比 GLM-5.3)。
- 1M 上下文、低成本服务:更小的 KV 缓存是长上下文自托管可行的关键;320B MoE 仍需要可观内存,但远低于全注意力方案。
- MIT 开源权重:权重可从 Hugging Face 以 MIT 许可下载,允许自托管和商用。
- 始终思考:推理不可关闭,每次响应都会消耗推理 token;官方建议 temperature 1.0、top_p 0.95、最大化推理强度。
- 接入 Coding Plan:纳入 GLM Coding Plan,额度提升 3 倍,非高峰时段 50% 折扣。
适用场景
谁应该使用这个工具?
- 智能体开发者:长时间推理循环中重复上下文占大头,$0.03 缓存输入价格让重复上下文近乎免费。
- 多模态管线:需要一个开源模型同时理解图像和视频。
- 自托管团队:GPU 内存足够承载 320B MoE,4.4 倍更小的 KV 缓存让 1M 上下文服务成为可能。
- 成本敏感团队:与每次任务成本高数倍的封闭前沿模型做对比。
解决的问题
- 长上下文服务成本:全注意力呈二次方增长并强制大 KV 缓存;混合设计同时降低两者。
- 多模态碎片化:一个模型取代独立的图像、视频编码器。
- 厂商锁定:MIT 开源权重让团队可脱离托管供应商,同时保留同一模型。
定价方案
| 路径 | 价格 | 备注 |
|---|---|---|
| API 输入 | $0.15 / 百万 token | 缓存输入 $0.03 / 百万 |
| API 输出 | $0.50 / 百万 token | |
| 开源权重 | 免费(MIT) | 自托管自担算力 |
| GLM Coding Plan | 3x 额度 + 非高峰 5 折 | 并入现有订阅 |
优势对比
相比竞品的优势:
- 对比 GLM-5.3:长上下文服务能力更强且便宜得多,代价是激活参数更少。
- 对比 DeepSeek-V4-Flash 与 Kimi-K3:智谱称在所测基线中注意力计算最低,同时承认 KV 缓存略大于部分竞品。
- 对比封闭前沿模型:在同等长上下文智能体任务上,单任务成本低约一个数量级。
独特卖点:
- GLM 首款原生多模态,系从头预训练而非改造。
- 据 Z.ai 称全程运行于国产 AI 芯片。
- 以 "Ox Alpha" 身份匿名发布,是具有明确不训练承诺的罕见隐身预演。
用户评价
社区关注度极高。Patrick Collison 评价匿名 "Ox Alpha" 预览"令人印象深刻",引发大批开发者前来测试。指纹分析者用分词器探针宣称"99% 确定"其为智谱 GLM 家族,早于官方证实。基准测试者记录到强劲的编码分数,但社区在部分服务平台上指出其部署速度慢于部分同类快模型。
快速开始
入门指南
- 走 API:在 Z.ai 开放平台或智谱 bigmodel 平台调用模型 ID
glm-5.3-flash,使用标准 OpenAI 兼容格式。 - 走 OpenRouter:
stealth/ox-alpha列表让位于官方 GLM-5.3-Flash 列表;免费窗口约 8 月 27 日关闭,之后为标准定价。 - 自托管:从 Hugging Face 的
zai-org/GLM-5.3-Flash下载权重,用你偏好的运行时服务;显存紧张时用量化版本。
集成
- OpenAI 兼容的聊天、函数调用、流式输出与 JSON 结构化输出。
- 图像 URL 或 Base64 输入。
- Hugging Face Transformers、llama.cpp、Unsloth(GGUF)本地推理。
常见问题
GLM-5.3-Flash 和 GLM-5.3 是同一个吗?
不是。GLM-5.3-Flash 是全新训练的基座模型,而非 GLM-5.3 的蒸馏,且原生多模态,而 GLM-5.3 仅文本。
可以关闭思考吗?
不可以。思考始终开启,每次响应都会消耗推理 token,请据此规划预算。
它真的开源吗?
权重以 MIT 许可开放,允许商用与自托管。与所有开源权重发布一样,训练数据未公开。
什么是 "Ox Alpha"?
Ox Alpha 是 GLM-5.3-Flash 的匿名代号,8 月 26 日被 Z.ai 证实。它先匿名出现在 OpenRouter 上,靠独立社区使用验证后再挂上品牌。
替代方案
- GLM-5.3:文本向编码旗舰,网络安全能力更强,但激活参数省得少。
- Qwen3.8-Flash-Next:同日发布的另一款开源成本效率模型,125B 总参 / 6B 激活。
- DeepSeek V4 Flash:成本敏感智能体部署的强劲开源选择。
使用技巧
- 为思考 token 留预算:推理不可关闭,按重复推理而非单轮估算单任务成本。
- 用足缓存输入:智能体循环反复发送系统提示与上下文,$0.03/百万缓存让上下文首轮后近乎免费。
- 单机服务需量化:320B MoE 即便只有 18B 激活仍需可观显存;选用适配量化或卸载到内存。
总结
GLM-5.3-Flash 是智谱对"便宜、长上下文、原生多模态开源权重"的押注,其注意力重构让 1M 上下文服务变得经济。对于看重单任务成本而非峰值基准的智能体开发者与多模态管线,它是当前开源空间中价值优势最明显的一档之一。建议从 Z.ai 官方公告 或 Hugging Face 模型卡 入手。
评论
还没有评论。成为第一个评论的人!
相关工具
Qwen3.8-Flash-Next
qwen.ai
阿里通义千问公开的 Qwen4 架构预览:125B 多模态 MoE、每 token 仅激活 6B,外加 51B N-gram 词表,原生 262K 上下文,输入定价 $0.16/百万 token。
Gemma 4 26B A4B
ai.google.dev/gemma
Google DeepMind 开源权重模型,25.2B 总参数 MoE 架构每 token 仅激活 3.8B,256K 上下文,支持图文多模态输入,Apache 2.0 商用友好协议。
LongCat 2.0
longcat.chat
美团开源 MoE 大模型:总参数 1.6T / 激活约 48B,1M 上下文,MIT 协议,擅长编码与智能体任务(2026-08-25)。
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。