GLM-5.3-Flash logo

GLM-5.3-Flash

開く

智譜(Z.ai)GLM-5 シリーズ初のネイティブ・マルチモーダルモデル(匿名モデル「Ox Alpha」と判明):320B MoE、18B のみ活性化、1M コンテキスト、MIT オープンウェイト、入力 $0.15/百万トークン。

共有:

GLM-5.3-Flash は智譜(Z.ai)の GLM-5 シリーズ初のネイティブ・マルチモーダルモデルで、2026年8月26日にリリースされ、数日前に OpenRouter に匿名で登場した「Ox Alpha」モデルであることが確定しました。320B パラメータの新・混合エキスパート(MoE)モデルで、トークンごとに 18B のみを活性化し、1M トークンのコンテキストウィンドウと MIT ライセンスのオープンウェイトを持ちます。入力 $0.15/百万トークンで、エージェント向けの低コスト・長コンテキストオプションとして位置付けられています。

モデル仕様

仕様 GLM-5.3-Flash
アーキテクチャ MoE、ハイブリッド(スパース+リニア)アテンション
総パラメータ 320B
活性化パラメータ フォワードあたり 18B
入力モダリティ テキスト、画像、動画、ファイル(ネイティブ・マルチモーダル)
コンテキストウィンドウ 1M トークン
事前学習コーパス 30T マルチモーダルトークン
推論モード 思考モード常時オン(無効化不可)
ライセンス MIT(Hugging Face でオープンウェイト)
API 価格 $0.15 / 百万入力、$0.50 / 百万出力、$0.03 / 百万キャッシュ入力

主な機能

  • ネイティブ・マルチモーダル:初期の GLM ビジョン版とは異なり、本モデルは 30 兆トークンのマルチモーダルコーパスでゼロから事前学習されたため、画像・動画入力をネイティブに処理します。
  • ハイブリッド(スパース+リニア)アテンション:GLM シリーズ初の組み合わせで、GLM-5.3 比でアテンション計算を約 3 倍、KV キャッシュを約 4.4 倍削減。
  • 1M コンテキストを低コストで提供:小さな KV キャッシュが長コンテキストのセルフホストを現実に。320B MoE でもフルアテンションより大幅にメモリを抑えられます。
  • MIT オープンウェイト:Hugging Face から MIT ライセンスでダウンロード可能。セルフホスト・商用利用とも可。
  • 常時思考:推論は無効化できず、各レスポンスが思考トークンを消費。公式推奨は temperature 1.0、top_p 0.95、最大の推論強度。
  • Coding Plan 統合:GLM Coding Plan に含まれ、クォータ 3 倍+オフピーク時 50% オフ。

使用シナリオ

このモデルを使うべき人は?

  • エージェント開発者:反復的なコンテキスト送信がコストの大半を占める長時間推論ループで、$0.03 のキャッシュ入力でほぼ無料になる。
  • マルチモーダルパイプライン:画像・動画理解を 1 つのオープンウェイトモデルで完結させたい。
  • セルフホストチーム:320B MoE を載せられる GPU メモリがあり、4.4 倍小さい KV キャッシュで 1M コンテキストを提供したい。
  • コスト重視のチーム:タスクあたり数倍かかる独自フロンティアモデルと比較する。

解決する問題

  1. 長コンテキストの提供コスト:フルアテンションは二次関数的に増え、大きな KV キャッシュを要求。ハイブリッド設計で両方を削減。
  2. マルチモーダルの断片化:1 つのモデルで画像・動画エンコーダを置き換え。
  3. ベンダーロックイン:MIT のオープンウェイトでホストサービスから離れても同じモデルを維持。

料金プラン

パス 価格 備考
API 入力 $0.15 / 百万トークン キャッシュ入力 $0.03 / 百万
API 出力 $0.50 / 百万トークン
オープンウェイト 無料(MIT) セルフホストは自前計算コスト
GLM Coding Plan 3 倍クォータ+オフピーク 50% オフ 既存サブスクに統合

優位性と独自の価値提案

競合他社との比較

  1. GLM-5.3 比:長コンテキストの提供能力が大幅に向上し、より安価。代償として活性化パラメータが少ない。
  2. DeepSeek-V4-Flash・Kimi-K3 比:智譜は計測したベースラインのなかで最低のアテンション計算と主張。一方 KV キャッシュは一部競合よりわずかに大きいと認める。
  3. 独自フロンティアモデル比:同等の長コンテキストエージェント作業でタスクあたり約 1 桁安価。

際立つポイント

  • GLM 初のネイティブ・マルチモーダル(改造ではなく事前学習)。
  • Z.ai によると中国製 AI チップのみで動作。
  • 匿名の「Ox Alpha」として、学習に使わない明示的条件付きでプレビュー公開された異例のリリース。

ユーザーレビュー

コミュニティの注目度は極めて高く、Patrick Collison 氏が匿名の「Ox Alpha」プレビューを「非常に印象的」と評したことがきっかけで開発者が押し寄せました。指紋調査者はトークナイザー解析で、公式発表前から「99% 確実に智譜の GLM ファミリー」と断定。ベンチマークでは強いコーディングスコアが記録された一方、一部の提供環境では展開が遅めと指摘する声もあります。

はじめに

クイックスタートガイド

  1. API 経由:Z.ai オープンプラットフォームまたは智譜 bigmodel でモデル ID glm-5.3-flash を、標準の OpenAI 互換チャット形式で呼び出し。
  2. OpenRouter 経由stealth/ox-alpha リストは公式 GLM-5.3-Flash リストに交代。無料枠は 8/27 頃に終了し、以降は標準価格。
  3. セルフホスト:Hugging Face の zai-org/GLM-5.3-Flash から重みをダウンロードし、好みのランタイムで提供。VRAM が厳しければ量子化版を。

統合

  • OpenAI 互換のチャット、関数呼び出し、ストリーミング、JSON 構造化出力。
  • 画像 URL または Base64 入力。
  • Hugging Face Transformers、llama.cpp、Unsloth(GGUF)でのローカル推論。

よくある質問

GLM-5.3-Flash と GLM-5.3 は同じですか?

違います。GLM-5.3-Flash は新規に訓練された基盤モデルで GLM-5.3 の蒸留ではありません。また GLM-5.3 がテキストのみなのに対しネイティブ・マルチモーダルです。

思考を無効化できますか?

できません。思考は常時オンで、各レスポンスが思考トークンを消費します。予算計画に考慮してください。

本当にオープンソースですか?

重みは MIT ライセンスで提供され、商用・セルフホストが可能です。他のオープンウェイト同様、学習データは非公開です。

「Ox Alpha」とは?

Ox Alpha は GLM-5.3-Flash の隠し名称で、8月26日に Z.ai が確認。OpenRouter に匿名で登場し、独立したコミュニティ利用の後にブランド化されました。

代替案

  • GLM-5.3:テキスト向けコーディング旗艦。サイバー能力は高いが活性化削減は少なめ。
  • Qwen3.8-Flash-Next:同じく 8/26 公開のオープンウェイト・コスト効率モデル。125B 総参 / 6B 活性。
  • DeepSeek V4 Flash:コスト重視のエージェント運用で有力なオープンモデル。

ヒントとベストプラクティス

  1. 思考トークンの予算を確保:推論は無効化不可。単発ではなく反復推論でタスクあたりコストを見積もる。
  2. キャッシュ入力を活用:エージェントはシステムプロンプトとコンテキストを再送。$0.03/百万で初回後はほぼ無料。
  3. 単機提供は量子化:18B 活性でも 320B MoE は相当な VRAM が必要。適合する量子化を選ぶか RAM へオフロード。

まとめ

GLM-5.3-Flash は「安く・長い・ネイティブ・マルチモーダルなオープンウェイト」を狙った Z.ai の一手で、アテンション再設計により 1M コンテキストの提供を経済化しました。ピーク性能よりタスクあたりコストを重視するエージェント開発者やマルチモーダルパイプラインにとって、現時点のオープンウェイト空間でも屈指のバリューです。Z.ai 公式発表またはHugging Face モデルカードから始めるのがおすすめです。

コメント

まだコメントがありません。最初のコメントを投稿してください!