GLM-5.3 是智谱 AI 面向编程与智能体场景的旗舰模型,于 2026 年 8 月 14 日发布。智谱沿用了与 GLM-5.2 完全相同的基座模型,把全部提升押在极致的后训练扩展上:长程任务环境数量提升数十倍、环境类型更丰富,并在 IndexShare、SAO、Slime 框架栈上进行了更长时间的强化学习。结果是智谱内部评测中编程能力跃升 50%,在 Terminal Bench 3.0 与 Agents' Last Exam(CLI)上拿下开源模型第一,编程与智能体表现据称已接近 Claude Fable 5。模型权重计划在发布两周后开源。
核心功能
- 后训练扩展,基座不变:所有提升都来自后训练阶段,基座仍是 GLM-5 MoE,没有重新预训练。
- 逼近前沿的编程:编程与智能体能力接近 Claude Fable 5,智谱称其为中国模型中最强的开源权重编程体验。
- 内置网络防御:智谱表示 GLM-5.3 搭载了迄今最稳健的风险审查系统,目标是让安全能力普惠化。
- 两周后开放权重:安全评估完成后将以 MIT 风格协议开源,延续智谱一贯的开源策略。
- Coding Plan 集成:发布当天所有用户的 GLM Coding Plan 额度已重置,模型在现有 Lite/Pro/Max/Team 订阅档位上消耗额度。
模型规格
| 规格 | GLM-5.3 |
|---|---|
| 基座模型 | 与 GLM-5.2 相同的 MoE 基座(约 744B,激活约 40B) |
| 提升来源 | 仅后训练扩展(IndexShare/SAO/Slime 上的强化学习) |
| 编程提升(内部) | 对比 GLM-5.2 提升 50% |
| 开放权重 | 计划中,发布后约 2 周 |
| 上下文 | 继承 GLM-5 系列的 1M token 窗口(据 Z.ai 文档) |
评测亮点
- Terminal Bench 3.0:28.3 分,GLM-5.2 仅 4.6 分,约 6 倍跃升,开源模型第一。
- DeepSWE v1.1:66.9 分,GLM-5.2 为 46.2 分,长程软件工程任务提升 44.8%。
- Agents' Last Exam(CLI):28.5 分对 23.8 分,跨工具长程任务的开源最高分。
- AutomationBench:48.2 分,超过 Kimi K3(46.7)、Claude Fable 5(46.2)与 GPT-5.6 Sol。
- CyberGym:84.5%,高于 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%)。
- ExploitGym:2 小时完成 105 个任务、6 小时完成 130 个,GLM-5.2 仅为 29 和 39。
- GDPval-AA v2:覆盖 44 个职业共 1,769 分,说明编程增益正延伸到专业知识工作。
定价
发布时智谱尚未重新公布 GLM-5.3 的按 token API 定价,预计将沿用 GLM-5.2 的结构(输入约 $1.40 / 1M token,输出约 $4.40 / 1M token)。GLM Coding Plan 订阅(Lite/Pro/Max/Team)约 $18/月起,模型继承套餐的高峰/非高峰额度倍率。
适用场景
- 智能体编程:多步长程任务,终端与 CLI 工具调用需要在整个会话内保持连贯。
- 网络安全工作:从源码出发的漏洞发现与验证,评测结果已缩小与闭源前沿模型的差距。
- 成本敏感团队:权重发布后即可用开源权重的经济性获得接近前沿的编程能力。
- 私有化部署:MIT 协议权重计划支持 vLLM、SGLang 与 transformers 技术栈。
优势
- 后训练效率:智谱证明了在现有基座上仅靠强化学习与任务环境扩展,仍能挖出不靠新预训练的大幅能力提升。
- 开源评测榜首:发布当天就在两项重磅编程/智能体评测上位列开源模型第一。
- 安全与开放兼得:网络防御能力选择开源,而不是留作独占。
使用技巧
- 盯紧权重发布:两周的开源窗口是决定 GLM-5.3 能否成为智能体团队默认开源编程模型的关键事件。
- 按生产环境的会话形态做基准测试:各评测增益差异较大,迁移前先用你自己的长程工作流实测,再决定是否从 GLM-5.2 升级。
- 重置额度预期:Coding Plan 额度已在发布当天刷新,重度使用前先看一眼"使用统计"。
总结
GLM-5.3 展示了后训练扩展的威力:同一基座上编程能力比 GLM-5.2 提升 50%,开源评测登顶,还有一条清晰的网络防御故事线。如果你在意接近前沿的开源权重编程表现,GLM-5.3 是这个月最值得关注的发布。
评论
还没有评论。成为第一个评论的人!
相关工具
GLM-5.2
z.ai
智谱 AI 旗舰 744B MoE 编码模型:扎实的 1M 上下文、MIT 开源权重、双档思考强度,长程智能体编程性能约为 GPT-5.5 的六分之一价格。
Muse Glimmer
developer.meta.com/ai/models/muse-glimmer
Meta 开源 30B 智能体多模态模型:从 Muse Spark 蒸馏,专为本地常驻编码与工具调用智能体设计,单张消费级 GPU 即可运行。
Muse Spark 1.2
developer.meta.com/ai/models/muse-spark
Meta 面向编码的旗舰模型,驱动 Muse Code 终端智能体:1M 上下文、更高的首试准确率、可靠的工具调用,通过 Meta Model API 提供端到端开发工作流。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。