Grok 4.6 は 2026 年 8 月 12 日に SpaceXAI(旧 xAI)からリリースされた、同社最新のフロンティア推論モデルです。Grok 4.5 と同じ 1.5 兆パラメータの V9 基盤を採用しながら、性能向上は生のスケールではなく大幅に作り直されたポストトレーニングパイプラインによって実現されており、焦点は純粋な知能から長時間稼働するエージェントとインタラクティブで視覚的な作業、すなわち複数ステップの調査、コードベースのナビゲーション、プロダクトアイデアを洗練されたアプリケーションへと仕上げる作業へと移っています。
モデル仕様
| 仕様 | Grok 4.6 |
|---|---|
| パラメータ | 1.5T(V9 基盤) |
| コンテキストウィンドウ | 500,000 トークン |
| モダリティ | テキスト + 画像入力、テキスト出力 |
| 推論努力 | low、medium、high(デフォルト)、xhigh |
| API 互換性 | OpenAI SDK 互換(Responses + Chat Completions) |
| 提供先 | Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare |
| ライセンス | クローズドウェイト |
Grok 4.5 からの進化点
- ポストトレーニングの全面刷新:同じ 1.5T V9 ベースながら、SFT と強化学習を大幅に改善。知識労働、一般的なコーディング、Web 開発、CAD、カーネル最適化にわたるエージェント RL タスクで訓練されています。
- 自己検証の振る舞い:複数ステップのタスク全体で、次に進む前に自身の出力をテスト・検証する動作が強化されました。
- 視覚的・インタラクティブなプロジェクトでの初回試行の強化:プロダクトアイデアからアプリケーションの構造とビジュアル言語を確立してから改良を加えることができます。
- より長い追加トレーニング:モデルが生成した推論データとエンジニアリング素材を用いた補助トレーニングランを延長。
ベンチマークのハイライト(自己申告)
- AA Intelligence Index:61(Grok 4.5 の 56 から上昇)
- APEX-Agents:57.5%(47.1% から上昇)
- DeepSWE v1.1:65.9%(54% から上昇)
- CursorBench v3.2:69.9%(66.7% から上昇)
- Harvey LAB (Vals):15.8%。比較対象の中で最高のプロフェッショナル・法務作業スコア
- 既知の弱点:Terminal-Bench v3.0 で 26% と競合(34-35%)に後れを取っており、実際のターミナル作業における真のギャップとなっています
料金
| ティア | 入力 / 100 万トークン | キャッシュ入力 / 100 万トークン | 出力 / 100 万トークン |
|---|---|---|---|
| プロンプト 20 万トークン未満 | $2.00 | $0.50 | $6.00 |
| プロンプト 20 万トークン以上 | $4.00 | $1.00 | $12.00 |
| Fast バリアント | 標準の 2 倍 | 標準の 2 倍 | 標準の 2 倍 |
コンシューマープランには、制限付きの無料ティア、月額 $30 の SuperGrok、月額 $100 の SuperGrok Plus、月額 $300 の SuperGrok Heavy が含まれます。100 万トークンあたり $2/$6 の Grok 4.6 は、Claude Opus 5($5/$25)や GPT-5.6 Sol($5/$30)などの同等のフロンティアモデルの約半額です。
注意点
すべてのベンチマークは SpaceXAI による自己申告であり、独立した再現検証はまだ行われていません。1.5T というパラメータ数は正式なモデルカードではなく、Elon Musk の X への投稿に由来します。後継モデル Grok 4.7(2.1T パラメータ)は 2026 年 8 月下旬から 9 月上旬に登場が見込まれています。
まとめ
Grok 4.6 は、xAI の競争優位性がモデルスケール単体ではなく、エージェントトレーニングとインタラクティブな作業にあることを示しています。エージェント開発者やヘビーなコーディングユーザーにとって、主要競合の約半分の API コストでフロンティア級の能力を提供し、リアルタイムの X データアクセスという象徴的な差別化要素も維持しています。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic の最上位 Opus モデル。1M トークンのコンテキストと調整可能な思考強度を備え、Opus 4.8 と同じ価格で Fable 5 に迫る性能を発揮。エージェントと長期コーディング向け。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek のフラッグシップ 1.6T MoE モデル。活性化パラメータ 49B、1M トークンのコンテキスト、MIT ライセンスのオープンウェイトを備え、世界トップのコーディングスコアをクローズドモデルのごく一部の価格で実現。
Grok
x.ai
xAI のフロンティア・マルチモーダル AI モデルで、リアルタイム X データアクセス、100 万トークンコンテキスト、Aurora 画像生成、業界をリードする推論能力を備えています。
関連インサイト
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
ローコードプラットフォームの黄昏:なぜClaude Agent SDKがDifyを歴史にするのか
大規模言語モデルの第一原理から、なぜClaude Agent SDKがDifyを置き換えるのかを深く分析。自然言語でプロセスを記述することが人間の原始的な行動パターンにより合致している理由、そしてなぜこれがAI時代の必然的な選択なのかを探る。