GLM-5.3-Flash は智譜(Z.ai)の GLM-5 シリーズ初のネイティブ・マルチモーダルモデルで、2026年8月26日にリリースされ、数日前に OpenRouter に匿名で登場した「Ox Alpha」モデルであることが確定しました。320B パラメータの新・混合エキスパート(MoE)モデルで、トークンごとに 18B のみを活性化し、1M トークンのコンテキストウィンドウと MIT ライセンスのオープンウェイトを持ちます。入力 $0.15/百万トークンで、エージェント向けの低コスト・長コンテキストオプションとして位置付けられています。
モデル仕様
| 仕様 | GLM-5.3-Flash |
|---|---|
| アーキテクチャ | MoE、ハイブリッド(スパース+リニア)アテンション |
| 総パラメータ | 320B |
| 活性化パラメータ | フォワードあたり 18B |
| 入力モダリティ | テキスト、画像、動画、ファイル(ネイティブ・マルチモーダル) |
| コンテキストウィンドウ | 1M トークン |
| 事前学習コーパス | 30T マルチモーダルトークン |
| 推論モード | 思考モード常時オン(無効化不可) |
| ライセンス | MIT(Hugging Face でオープンウェイト) |
| API 価格 | $0.15 / 百万入力、$0.50 / 百万出力、$0.03 / 百万キャッシュ入力 |
主な機能
- ネイティブ・マルチモーダル:初期の GLM ビジョン版とは異なり、本モデルは 30 兆トークンのマルチモーダルコーパスでゼロから事前学習されたため、画像・動画入力をネイティブに処理します。
- ハイブリッド(スパース+リニア)アテンション:GLM シリーズ初の組み合わせで、GLM-5.3 比でアテンション計算を約 3 倍、KV キャッシュを約 4.4 倍削減。
- 1M コンテキストを低コストで提供:小さな KV キャッシュが長コンテキストのセルフホストを現実に。320B MoE でもフルアテンションより大幅にメモリを抑えられます。
- MIT オープンウェイト:Hugging Face から MIT ライセンスでダウンロード可能。セルフホスト・商用利用とも可。
- 常時思考:推論は無効化できず、各レスポンスが思考トークンを消費。公式推奨は temperature 1.0、top_p 0.95、最大の推論強度。
- Coding Plan 統合:GLM Coding Plan に含まれ、クォータ 3 倍+オフピーク時 50% オフ。
使用シナリオ
このモデルを使うべき人は?
- エージェント開発者:反復的なコンテキスト送信がコストの大半を占める長時間推論ループで、$0.03 のキャッシュ入力でほぼ無料になる。
- マルチモーダルパイプライン:画像・動画理解を 1 つのオープンウェイトモデルで完結させたい。
- セルフホストチーム:320B MoE を載せられる GPU メモリがあり、4.4 倍小さい KV キャッシュで 1M コンテキストを提供したい。
- コスト重視のチーム:タスクあたり数倍かかる独自フロンティアモデルと比較する。
解決する問題
- 長コンテキストの提供コスト:フルアテンションは二次関数的に増え、大きな KV キャッシュを要求。ハイブリッド設計で両方を削減。
- マルチモーダルの断片化:1 つのモデルで画像・動画エンコーダを置き換え。
- ベンダーロックイン:MIT のオープンウェイトでホストサービスから離れても同じモデルを維持。
料金プラン
| パス | 価格 | 備考 |
|---|---|---|
| API 入力 | $0.15 / 百万トークン | キャッシュ入力 $0.03 / 百万 |
| API 出力 | $0.50 / 百万トークン | |
| オープンウェイト | 無料(MIT) | セルフホストは自前計算コスト |
| GLM Coding Plan | 3 倍クォータ+オフピーク 50% オフ | 既存サブスクに統合 |
優位性と独自の価値提案
競合他社との比較:
- GLM-5.3 比:長コンテキストの提供能力が大幅に向上し、より安価。代償として活性化パラメータが少ない。
- DeepSeek-V4-Flash・Kimi-K3 比:智譜は計測したベースラインのなかで最低のアテンション計算と主張。一方 KV キャッシュは一部競合よりわずかに大きいと認める。
- 独自フロンティアモデル比:同等の長コンテキストエージェント作業でタスクあたり約 1 桁安価。
際立つポイント:
- GLM 初のネイティブ・マルチモーダル(改造ではなく事前学習)。
- Z.ai によると中国製 AI チップのみで動作。
- 匿名の「Ox Alpha」として、学習に使わない明示的条件付きでプレビュー公開された異例のリリース。
ユーザーレビュー
コミュニティの注目度は極めて高く、Patrick Collison 氏が匿名の「Ox Alpha」プレビューを「非常に印象的」と評したことがきっかけで開発者が押し寄せました。指紋調査者はトークナイザー解析で、公式発表前から「99% 確実に智譜の GLM ファミリー」と断定。ベンチマークでは強いコーディングスコアが記録された一方、一部の提供環境では展開が遅めと指摘する声もあります。
はじめに
クイックスタートガイド
- API 経由:Z.ai オープンプラットフォームまたは智譜 bigmodel でモデル ID
glm-5.3-flashを、標準の OpenAI 互換チャット形式で呼び出し。 - OpenRouter 経由:
stealth/ox-alphaリストは公式 GLM-5.3-Flash リストに交代。無料枠は 8/27 頃に終了し、以降は標準価格。 - セルフホスト:Hugging Face の
zai-org/GLM-5.3-Flashから重みをダウンロードし、好みのランタイムで提供。VRAM が厳しければ量子化版を。
統合
- OpenAI 互換のチャット、関数呼び出し、ストリーミング、JSON 構造化出力。
- 画像 URL または Base64 入力。
- Hugging Face Transformers、llama.cpp、Unsloth(GGUF)でのローカル推論。
よくある質問
GLM-5.3-Flash と GLM-5.3 は同じですか?
違います。GLM-5.3-Flash は新規に訓練された基盤モデルで GLM-5.3 の蒸留ではありません。また GLM-5.3 がテキストのみなのに対しネイティブ・マルチモーダルです。
思考を無効化できますか?
できません。思考は常時オンで、各レスポンスが思考トークンを消費します。予算計画に考慮してください。
本当にオープンソースですか?
重みは MIT ライセンスで提供され、商用・セルフホストが可能です。他のオープンウェイト同様、学習データは非公開です。
「Ox Alpha」とは?
Ox Alpha は GLM-5.3-Flash の隠し名称で、8月26日に Z.ai が確認。OpenRouter に匿名で登場し、独立したコミュニティ利用の後にブランド化されました。
代替案
- GLM-5.3:テキスト向けコーディング旗艦。サイバー能力は高いが活性化削減は少なめ。
- Qwen3.8-Flash-Next:同じく 8/26 公開のオープンウェイト・コスト効率モデル。125B 総参 / 6B 活性。
- DeepSeek V4 Flash:コスト重視のエージェント運用で有力なオープンモデル。
ヒントとベストプラクティス
- 思考トークンの予算を確保:推論は無効化不可。単発ではなく反復推論でタスクあたりコストを見積もる。
- キャッシュ入力を活用:エージェントはシステムプロンプトとコンテキストを再送。$0.03/百万で初回後はほぼ無料。
- 単機提供は量子化:18B 活性でも 320B MoE は相当な VRAM が必要。適合する量子化を選ぶか RAM へオフロード。
まとめ
GLM-5.3-Flash は「安く・長い・ネイティブ・マルチモーダルなオープンウェイト」を狙った Z.ai の一手で、アテンション再設計により 1M コンテキストの提供を経済化しました。ピーク性能よりタスクあたりコストを重視するエージェント開発者やマルチモーダルパイプラインにとって、現時点のオープンウェイト空間でも屈指のバリューです。Z.ai 公式発表またはHugging Face モデルカードから始めるのがおすすめです。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Gemma 4 26B A4B
ai.google.dev/gemma
Google DeepMind のオープンウェイトモデル。総パラメータ 25.2B の MoE で 1 トークンあたり 3.8B のみ活性化。256K コンテキスト、マルチモーダル入力、Apache 2.0 ライセンス。
LongCat 2.0
longcat.chat
MeituanのオープンウェイトMoEモデル:総パラメータ1.6T/活性約48B、1Mコンテキスト、MITライセンス。コーディングとエージェントタスクに強み(2026-08-25)。
Qwen3.8-Flash-Next
qwen.ai
Alibaba(通義千問)による Qwen4 アーキテクチャの先行公開:125B のマルチモーダル MoE、トークンごと 6B のみ活性化、51B の N-gram 語彙、ネイティブ 262K コンテキスト、入力 $0.16/百万トークン。
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。
Claude Skills 完全ガイド - 必須10大 Skills 徹底解説
Claude Skills の拡張メカニズムを深掘りし、10の中核スキルと Obsidian 連携を詳しく解説。高効率な AI ワークフロー構築を支援します
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。