FLUX 3 logo

FLUX 3

開く

Black Forest Labs のマルチモーダルモデル。動画、音声、近日公開の画像、アクション予測に対応し、最大 20 秒クリップ、ネイティブ音声、ドラフトモードを備える。

共有:

FLUX 3

FLUX 3 は Black Forest Labs のマルチモーダル生成モデルで、動画、音声、近日公開の画像生成、アクション予測を扱います。同社はこれを FLUX.1 の動画版後継ではなく、複数モダリティを 1 つのモデルで担うものだと説明しています。bfl.ai の公式ページは、映画的表現に限らない多様な動画、任意のネイティブ音声、1 回の生成で最大 20 秒、多言語発話、ドラフトから本レンダーへ進むエージェント向けワークフローを強調しています。製品ページでは画像生成は “soon” です。

主な機能

  • 1 モデル、複数モダリティ:動画と音声は利用可能。画像生成は近日。アクション予測はロボティクス向けで、視覚観察とテキスト指示から予測結果と制御動作を出します。
  • 動画コントロール:テキスト/画像からの動画、開始・終了および順序付きキーフレーム、1 テイクでの複数シーンとカメラ、最終フレームからの継続、クリップのエージェント連鎖。
  • ネイティブ音声:任意の多言語発話、効果音、環境音をフレームと同時生成し、リップシンク重視の台詞にも触れています。
  • ドラフトモード:安く速いプレビューを出し、同じプロンプトを送り返して本品質でレンダーします。
  • Self-Flow アーキテクチャ:BFL は同一基盤でマルチモーダル生成と理解を揃える手法として Self-Flow を示し、flow matching との生成誤差・操作タスク成功率比較を掲載しています。
  • API、プレイグラウンド、オープンウェイト経路:サイトはプレイグラウンド、本番 API、別系統のオープンウェイト許諾を案内します。FLUX 3 自体の重みが今ダウンロードできるかは、現行モデルページで確認してください。

使用シナリオ

  • エージェント動画パイプライン:Nous Research の Dillon Rolnick は、Hermes がショットを生成し、確認し、継続することで 20 秒クリップを長い作品にすると述べています。
  • プロダクトとブランド動画:公式ページの Magnific と Envato の言及は、映画だけでなくモーションデザインやブランド制作を強調しています。
  • 絵コンテと広告:複数シーン、タイポグラフィ、多言語台詞は解説、ドキュメンタリー、キャンペーンに向きます。
  • ロボティクス研究:アクション予測は知覚・シミュレーション・実行向けであり、コンシューマー動画向けではありません。

料金プラン

Black Forest Labs は席料なしの従量 API です。bfl.ai/pricing の公開電卓(2026-08-16 確認)は、HD ドラフトのテキスト/画像→動画で FLUX 3 動画を $0.17/秒、5 秒で $0.85 と表示していました。解像度、尺、ドラフト/通常、動画→動画で合計は変わるため、$0.17/秒は電卓が表示したドラフト HD レートであり、万能な定価ではありません。

同ページのオープンウェイト許諾は、まだ FLUX.2 系(Builder、Platform、Professional、Enterprise、Synthetic Data)の説明です。エンタープライズ API は販売経由でボリューム、SLA、組み合わせ価格を確認できます。

はじめに

  1. FLUX 3 ページ を開き、プレイグラウンドで試す。
  2. 本番量が必要なら BFL ダッシュボードで API キーを作る。
  3. ドラフトで安くプロンプトを探してから、選んだドラフトを本品質でレンダーする。
  4. 長い話は 1 本の長回しではなく、最終フレームからの継続やクリップ連鎖で作る。
  5. オンプレミスの重みが必要なら、現行のオープンウェイト条件を読む。FLUX 3 のチェックポイントが FLUX.2 klein/dev に入っていると思わないこと。

よくある質問

FLUX 3 は動画専用ですか?

いいえ。公開面は動画と音声です。画像生成は近日、アクション予測はロボティクス向けモダリティです。

重みはダウンロードできますか?

BFL は一部 FLUX モデルのオープンウェイト許諾を販売しています。FLUX 3 のマーケページは API、プレイグラウンド、「モデルのダウンロード」に触れますが、公開料金ページはまだ FLUX.2 klein / dev を詳述しています。ローカル配備を計画する前に、FLUX 3 の正確な提供形態を確認してください。

クリップは何秒までですか?

公式文は 1 回の生成で最大 20 秒です。より長い作品は継続とエージェント連鎖で作る想定です。

代替案

  • Flux.1 Pro:静止画だけなら、BFL の先行商用画像モデルが基準です。
  • Veo 3:すでに Gemini 圏にいるなら Google の動画生成プロダクト。
  • MiniMax:動画と音声 API を持つ別のマルチモーダルベンダー。

ヒントとベストプラクティス

  1. まずドラフト:公式の流れは安く探してから本レンダーです。プロンプト探索を本品質で始めない。
  2. 映画ではなくショットで書く:20 秒クリップと継続が、公式デモの単位です。
  3. 音声は別に確認する:多言語発話とリップシンクは強みでも失敗点です。長い連鎖の前に台詞をプレビューしてください。

まとめ

FLUX 3 は、動画、音声、画像、ロボット動作を 1 本のマルチモーダル基盤で担うという BFL の賭けです。エージェントが制御でき、音が乗った短いクリップが必要なら、公式プレイグラウンドから始め、1 回の生成を短く保ち、それから API を長いパイプラインへつなぐのが安全です。

コメント

まだコメントがありません。最初のコメントを投稿してください!