MiniMax H3
MiniMax H3 は、2026 年 7 月 31 日に出た MiniMax の汎用マルチモーダル生成モデルです。研究ポストは、テキスト、画像、動画、音声をまとめて理解し、最大 2K・15 秒、ネイティブステレオ付きの動画を出すと書いています。API ドキュメントのモデル名は MiniMax-H3 で、テキストから動画、先頭/末尾フレームの画像から動画、画像・動画クリップ・音声を使った参照生成に対応します。コンシューマー向けプレイグラウンドは Hailuo です。MiniMax は法令の範囲で重み公開を計画しています。現行の重み配布を確認するまで、ローカルチェックポイントがあると思わないでください。
主な機能
- 統一マルチモーダル文脈:公式例は、Video 1 のカメラ、Image 2 のキャラ、Audio 3 のボーカルを取り、関係をテキストで書く。
- 出力仕様:768P または 2K、長さ 4–15 秒(整数のみ)、モデル表では 24 fps、一般的または適応アスペクト。
- 参照上限:画像最大 9、動画クリップ最大 3(各 2–15 秒、入力動画合計 15 秒以下)、幅高さ 256–5760。
- 制作向けの主張:指示追従、文字とブランドの描画、動画から動画へのモーション転送。広告、EC、UI、ゲーム向け。
- オープンウェイトの意向:7 月 31 日の記事は「数日以内に重みを公開」と書いた。オフライン配備の前にブログと GitHub を再確認する。
使いどころ
- ロゴやパッケージを読ませる必要のあるブランド/商品動画。
- 静止画、カメラワーク、音声ベッドがすでに揃っている参照駆動ショット。
- 768P で下書きし、再生成エンドポイントで 2K にする。
料金
H3 は MiniMax の動画ポイントパッケージ対象外です。公式従量(2026-08-17 確認):
| 出力 | リスト価格 |
|---|---|
| 2K | $0.13 / 秒 |
| 768P | $0.08 / 秒 |
入力音声は無料。最初の 5 枚の画像は無料、追加は 1 枚 $0.04。入力動画は、その解像度の出力と同じ秒単価。768P 結果を 2K に再生成すると、新しい出力 1 秒あたり $0.05 で、元の入力素材も再課金されます。発表文は 2K の秒単価が主流モデルの 3 分の 1 未満だとしています。見積もりには上表を使い、その文言はベンダーコピーとして扱ってください。
はじめ方
- H3 の記事 を読み、試すだけなら Hailuo。
- API なら 従量動画ガイド と v2 create を使う。Hailuo 2.3 のパッケージで H3 が走ると期待しない。
- プロンプト探しは 768P、仕上げは 2K 再生成。
- 重みが必要なら、本当に出たか確認する。7 月の記事は計画であり、ダウンロードリンクではない。
よくある質問
名前を変えた Hailuo 02 ですか?
違います。Hailuo 2.3 は旧動画表に残っています(1080p/768p、6–10 秒)。H3 は 2K と 4–15 秒を持つ次世代マルチモーダルです。
動画ポイントで H3 を買えますか?
まだです。パッケージページは H3 未対応と書いています。従量かカスタム営業プランを使います。
FLUX 3 との違いは?
FLUX 3 は最大 20 秒クリップの BFL マルチモーダル生成です。H3 は MiniMax の 2K ステレオ経路で、オープンウェイトを約束しています。
代替案
- FLUX 3:BFL のドラフト後レンダの動画と音声。
- Veo 3:すでに Gemini にいるなら Google 動画。
- MiniMax:Code、Speech、Music と H3 を並べる会社ハブ。
ヒント
- 参照同士の関係をプロンプトに書く。モデルはそれを結ぶためにあり、推測するためではない。
- 入力動画は 15 秒予算に収める。追加クリップは公開上限に入らない。
- キャンペーン前に従量を再確認する。パッケージ SKU はまだ Hailuo の説明です。
まとめ
2026 年後半にマルチモーダル参照と 2K ステレオ短尺が必要なら、H3 を評価対象にしてください。Hailuo か従量 API から始め、オープンウェイトが本当に落ちたかを確認します。第一方の起点は H3 研究ポスト です。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
MiniMax M3
www.minimax.io/blog/minimax-m3
MiniMax の 2026 年 6 月 1 日オープンウェイト級フラッグシップ。MSA による 100 万トークン文脈、ネイティブな画像/動画入力とデスクトップ操作、割引中の API 料金。
FLUX 3
bfl.ai/models/flux-3
Black Forest Labs のマルチモーダルモデル。動画、音声、近日公開の画像、アクション予測に対応し、最大 20 秒クリップ、ネイティブ音声、ドラフトモードを備える。
Seedance 2.5
seed.bytedance.com/en/seedance2_5
ByteDance Seed の音声付き動画モデル。30 秒ストーリー、精密な参照制御、2 回の延長、グリーンスクリーンなど制作向け編集を備える。
関連インサイト
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。