GLM-5.3 logo

GLM-5.3

打开

智谱 AI 最新旗舰编码与网络安全模型:沿用 GLM-5 基座,仅靠后训练扩展把编程能力提升 50%,Terminal Bench 3.0 与 Agents' Last Exam(CLI)位列开源模型第一。

分享:

GLM-5.3 是智谱 AI 面向编程与智能体场景的旗舰模型,于 2026 年 8 月 14 日发布。智谱沿用了与 GLM-5.2 完全相同的基座模型,把全部提升押在极致的后训练扩展上:长程任务环境数量提升数十倍、环境类型更丰富,并在 IndexShare、SAO、Slime 框架栈上进行了更长时间的强化学习。结果是智谱内部评测中编程能力跃升 50%,在 Terminal Bench 3.0 与 Agents' Last Exam(CLI)上拿下开源模型第一,编程与智能体表现据称已接近 Claude Fable 5。模型权重计划在发布两周后开源。

核心功能

  • 后训练扩展,基座不变:所有提升都来自后训练阶段,基座仍是 GLM-5 MoE,没有重新预训练。
  • 逼近前沿的编程:编程与智能体能力接近 Claude Fable 5,智谱称其为中国模型中最强的开源权重编程体验。
  • 内置网络防御:智谱表示 GLM-5.3 搭载了迄今最稳健的风险审查系统,目标是让安全能力普惠化。
  • 两周后开放权重:安全评估完成后将以 MIT 风格协议开源,延续智谱一贯的开源策略。
  • Coding Plan 集成:发布当天所有用户的 GLM Coding Plan 额度已重置,模型在现有 Lite/Pro/Max/Team 订阅档位上消耗额度。

模型规格

规格 GLM-5.3
基座模型 与 GLM-5.2 相同的 MoE 基座(约 744B,激活约 40B)
提升来源 仅后训练扩展(IndexShare/SAO/Slime 上的强化学习)
编程提升(内部) 对比 GLM-5.2 提升 50%
开放权重 计划中,发布后约 2 周
上下文 继承 GLM-5 系列的 1M token 窗口(据 Z.ai 文档)

评测亮点

  • Terminal Bench 3.0:28.3 分,GLM-5.2 仅 4.6 分,约 6 倍跃升,开源模型第一。
  • DeepSWE v1.1:66.9 分,GLM-5.2 为 46.2 分,长程软件工程任务提升 44.8%。
  • Agents' Last Exam(CLI):28.5 分对 23.8 分,跨工具长程任务的开源最高分。
  • AutomationBench:48.2 分,超过 Kimi K3(46.7)、Claude Fable 5(46.2)与 GPT-5.6 Sol。
  • CyberGym:84.5%,高于 Mythos 5(83.8%)与 GPT-5.6 Sol(83.6%)。
  • ExploitGym:2 小时完成 105 个任务、6 小时完成 130 个,GLM-5.2 仅为 29 和 39。
  • GDPval-AA v2:覆盖 44 个职业共 1,769 分,说明编程增益正延伸到专业知识工作。

定价

发布时智谱尚未重新公布 GLM-5.3 的按 token API 定价,预计将沿用 GLM-5.2 的结构(输入约 $1.40 / 1M token,输出约 $4.40 / 1M token)。GLM Coding Plan 订阅(Lite/Pro/Max/Team)约 $18/月起,模型继承套餐的高峰/非高峰额度倍率。

适用场景

  • 智能体编程:多步长程任务,终端与 CLI 工具调用需要在整个会话内保持连贯。
  • 网络安全工作:从源码出发的漏洞发现与验证,评测结果已缩小与闭源前沿模型的差距。
  • 成本敏感团队:权重发布后即可用开源权重的经济性获得接近前沿的编程能力。
  • 私有化部署:MIT 协议权重计划支持 vLLM、SGLang 与 transformers 技术栈。

优势

  1. 后训练效率:智谱证明了在现有基座上仅靠强化学习与任务环境扩展,仍能挖出不靠新预训练的大幅能力提升。
  2. 开源评测榜首:发布当天就在两项重磅编程/智能体评测上位列开源模型第一。
  3. 安全与开放兼得:网络防御能力选择开源,而不是留作独占。

使用技巧

  1. 盯紧权重发布:两周的开源窗口是决定 GLM-5.3 能否成为智能体团队默认开源编程模型的关键事件。
  2. 按生产环境的会话形态做基准测试:各评测增益差异较大,迁移前先用你自己的长程工作流实测,再决定是否从 GLM-5.2 升级。
  3. 重置额度预期:Coding Plan 额度已在发布当天刷新,重度使用前先看一眼"使用统计"。

总结

GLM-5.3 展示了后训练扩展的威力:同一基座上编程能力比 GLM-5.2 提升 50%,开源评测登顶,还有一条清晰的网络防御故事线。如果你在意接近前沿的开源权重编程表现,GLM-5.3 是这个月最值得关注的发布。

评论

还没有评论。成为第一个评论的人!