GLM-5.3 は、Zhipu AI が2026年8月14日にリリースした、コーディングとエージェント向けのフラッグシップモデルです。Zhipu は GLM-5.2 と同一のベースモデルを維持し、すべての向上を極限まで拡大したポストトレーニングに託しました。長期間タスク環境を数十倍に増やし、環境の種類を広げ、IndexShare・SAO・Slime のフレームワークスタック上でより長い強化学習を実施。その結果、Zhipu の内部評価でコーディング能力が50%向上し、Terminal Bench 3.0 と Agents' Last Exam(CLI)でオープンソースモデル首位を獲得。コーディングとエージェント性能は Claude Fable 5 に迫るとされています。モデルウェイトはリリースから2週間後にオープンソース化される予定です。
主な機能
- ポストトレーニング拡張、ベースは同一:すべてのゲインは変更されていない GLM-5 MoE ベースへのポストトレーニング由来。新たな事前学習ランはなし。
- フロンティアに迫るコーディング:コーディングとエージェント能力は Claude Fable 5 に接近。Zhipu によれば中国モデル最強のオープンウェイトコーディング体験。
- サイバー防御を内蔵:Zhipu 史上最も堅牢なリスクレビューシステムを搭載し、セキュリティ能力の普及を目指す。
- 2週間後にオープンウェイト:安全性評価を経て MIT スタイルで公開。Zhipu 一貫のオープンソース戦略を継続。
- Coding Plan 統合:リリース当日に全ユーザーの GLM Coding Plan クォータをリセット。既存の Lite/Pro/Max/Team サブスクリプション階層でクォータを消費。
モデル仕様
| 仕様 | GLM-5.3 |
|---|---|
| ベースモデル | GLM-5.2 と同一の MoE ベース(約744B、活性化約40B) |
| 向上の源泉 | ポストトレーニング拡張のみ(IndexShare/SAO/Slime 上の強化学習) |
| コーディング向上(内部) | GLM-5.2 比 +50% |
| オープンウェイト | 計画中、リリース後約2週間 |
| コンテキスト | GLM-5 系の100万トークンウィンドウを継承(Z.ai ドキュメントより) |
ベンチマーク
- Terminal Bench 3.0:28.3 対 GLM-5.2 の 4.6。約6倍の跳躍でオープンソースモデル首位。
- DeepSWE v1.1:66.9 対 GLM-5.2 の 46.2。長期間ソフトウェアエンジニアリングで44.8%向上。
- Agents' Last Exam(CLI):28.5 対 23.8。クロスツール長期間タスクでオープンソース最高スコア。
- AutomationBench:48.2。Kimi K3(46.7)、Claude Fable 5(46.2)、GPT-5.6 Sol を上回る。
- CyberGym:84.5%。Mythos 5(83.8%)と GPT-5.6 Sol(83.6%)を上回る。
- ExploitGym:2時間で105タスク、6時間で130タスク。GLM-5.2 は29と39。
- GDPval-AA v2:44職種で1,769ポイント。コーディングの向上が専門的なナレッジワークへも波及していることを示唆。
料金
リリース時点で GLM-5.3 のトークン課金 API 価格は再公表されていません。GLM-5.2 の構造(入力100万トークンあたり約$1.40、出力約$4.40)を踏襲する見込みです。GLM Coding Plan サブスクリプション(Lite/Pro/Max/Team)は約$18/月から。モデルはプランのピーク/オフピーククォータ倍率を継承します。
ユースケース
- エージェント型コーディング:ターミナルや CLI ツール利用がセッション全体で一貫性を保つ必要がある多段階・長期間タスク。
- サイバーセキュリティ業務:ソースコードからの脆弱性発見と検証。ベンチマーク結果はクローズドフロンティアモデルとの差を縮めている。
- コスト重視チーム:ウェイト公開後、オープンウェイトの経済性でフロンティアに近いコーディングを実現。
- セルフホスト展開:MIT ライセンスのウェイトは vLLM・SGLang・transformers スタックに対応予定。
優位性
- ポストトレーニングの効率性:新たな事前学習なしに、既存ベースへの強化学習とタスク環境拡張だけで大きな能力向上が得られることを Zhipu が実証。
- オープンソースベンチマークのリーダー:リリース当日に2つの主要コーディング/エージェントベンチマークでオープンモデル首位。
- セキュリティとオープン性の両立:サイバー防御能力を独占せずオープンソース化。
ヒント
- ウェイト公開を注視:2週間のオープンソース化ウィンドウが、GLM-5.3 がエージェントチームのデフォルトのオープンコーディングモデルになるかを決めるイベント。
- 本番と同じセッション形状でベンチマーク:ベンチマークごとにゲインは異なる。GLM-5.2 から移行する前に、自分の長期間ワークフローでテストを。
- クォータ期待値をリセット:Coding Plan のクォータはリリース日に更新済み。ヘビーな実行前に「使用統計」を確認。
まとめ
GLM-5.3 はポストトレーニング拡張の可能性を示しています。同一ベースモデルで GLM-5.2 比50%のコーディング向上、オープンソースベンチマークの最高スコア、そして具体的なサイバー防御のストーリー。フロンティアに近いオープンウェイトのコーディング性能が重要なら、GLM-5.3 は今月注目のリリースです。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
GLM-5.2
z.ai
Zhipu AI のフラッグシップ744B MoEコーディングモデル。確実な100万トークンコンテキスト、MITオープンウェイト、2段階の思考強度、長期間エージェント型プログラミングをGPT-5.5の約6分の1のコストで実現。
GLM-4.7
www.bigmodel.cn
Zhipu AIが提供するオープンソースの多言語マルチモーダル対話モデルで、高度な思考能力、優れたコーディング性能、強化されたUI生成機能を備えています。
Muse Glimmer
developer.meta.com/ai/models/muse-glimmer
Metaのオープンウェイト30Bエージェント型マルチモーダルモデル。Muse Sparkから蒸留し、ローカルで常駐するコーディング・ツール利用エージェント向けに設計。コンシューマーGPU1枚で稼働。
関連インサイト
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。