Supra2-IMG logo

Supra2-IMG

開く

Supra2-IMG は Apache-2.0 の 104M パラメータのテキストto画像 DiT で、H100 1 枚で 9 時間ゼロから学習し 256x256 の画像を生成します。

共有:
代替ツールを見る

Supra2-IMG は SupraLabs による、ある具体的な問いへの答えです。テキストから画像を生成するモデルは、出力が使い物にならなくなる前にどこまで小さくできるのか。第一者モデルカード2026-09-21 に公開され、重みは Apache-2.0 ライセンスで配布されています。2026-09-22 時点の Hugging Face では 56 likes でした。104.1M パラメータの拡散 Transformer を完全にゼロから学習したもので、比較対象になるホスト型の画像モデルとはそもそも重みの桁が違います。

仕様

アーキテクチャ 小型拡散 Transformer(DiT)
パラメータ 104.1M
テキストエンコーダ 凍結した Flan-T5-Base(128 トークン)
VAE SD-VAE-FT-MSE
解像度 256 x 256
潜在サイズ 32 x 32、patch 2
ライセンス Apache-2.0

公開された設定は 14 層、D_MODEL 576、アテンションヘッド 9、ヘッド次元 64、MLP 比率 4.0 です。無条件埋め込みは実行時に計算せずチェックポイント内に保存されているため、推論スクリプトを短く保てます。

学習の内容

本題は学習そのものです。Supra2-IMG は LucasFang/FLUX-Reason-6M データセット全体で 10 エポック学習され、caption を構図、実体、テキスト、スタイル、想像性の順にフォールバックしながら選別した結果、560 万枚が使われました。ジョブ全体は Nvidia H100 SXM 80GB の Runpod マシン 1 台で、データ準備を含めて 9 時間、ディスク 2.5TB で実行されています。サンプリング設定も公開され固定です。seed 0、50 ステップ、cfg 3.0 で、公開されたすべてのサンプルが同じ設定で生成されています。

動かし方

インストールすべき pipeline ラッパーはありません。モデルリポジトリから inference.py を取得し、チェックポイントに対して実行します。

mkdir Supra2-IMG && cd Supra2-IMG
wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py

python inference.py \
  --prompt "a sea jellyfish floating in the pitch-black ocean depths" \
  --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

スクリプトは凍結した Flan-T5-Base のトークナイザとエンコーダ、そして SD-VAE-FT-MSE のデコーダを取得し、指定ステップ数で Euler flow サンプリングを実行します。チェックポイントは約 416MB なので、数 GB の重みを配る一般的な画像モデルに比べてダウンロードはほぼ無視できます。

向いている用途

  • DiT によるテキストto画像学習の全体像を読む。 データパイプライン、設定、推論スクリプトが一度に読み切れます。
  • CPU と低スペック GPU での実験。 104M パラメータはこのカテゴリでは珍しく、手頃なハードウェアで生成できます。
  • 予算を固定したプロトタイプ。 組み込み可能で再学習もできる 256x256 のサムネイル生成器が必要なら、小ささそのものが機能です。

制約とリスク

  • 256 x 256 のみ。 印刷、商品撮影、細部が必要な用途向けではありません。
  • 「同サイズで SOTA」はラボ自身の表現。 この規模で中立的な第三者ランキングは存在しません。
  • プロダクト面がない。 ホスト型プレイグラウンドも API もアプリもなく、成果物は Python スクリプトです。
  • テキストエンコーダが小さくプロンプトが短い。 Flan-T5-Base は 128 トークンが上限で、長く構成的なプロンプトは劣化します。
  • 評価はベンダー実施。 サンプルグリッドはラボ提供で、単一 GPU 9 時間という予算はコストとシャープさの特定のトレードオフを意味します。

よくある質問

Supra2-IMG は商用利用できますか?

モデルカードは Apache-2.0 を宣言しており寛容です。ただし学習コーパスには独自の来歴があるため、出力を商用で使う場合はデータセットの条件も確認してください。

GPU なしで動きますか?

ラボの報告では CPU で 1 枚あたり約 20 秒、GPU で約 2 秒です。これらはプロジェクト自身の計測値として扱ってください。

ホスト型モデルと比べてどうですか?

品質では比較になりません。同じく小さなオープンモデルと比べるべきで、フロンティア API と比べるものではありません。同じ課題への別のオープンなアプローチとして Qwen-Image-2.1 も参照してください。

代替案

  • Qwen-Image-2.1:編集も扱える、はるかに大規模なオープンウェイトモデル。ただしハードウェアコストは大きく上がります。
  • Nano Banana:制御よりも品質を求める場合のホスト型選択肢。
  • GPT Image 2:プロンプト追従を比較したいクローズドなエンドポイント。

まとめ

Supra2-IMG は小さく誠実で、完全に再現可能な実験です。H100 1 枚で 9 時間、104M パラメータの DiT はホスト型の画像モデルには遠く及びませんが、そこが要点です。レシピ全体が、読めて、再学習できて、手持ちのハードウェアで動かせるリポジトリに収まっています。超小型の拡散 Transformer を理解したいなら試す価値があり、プロダクション用の画像が必要なら向いていません。

コメント

まだコメントがありません。最初のコメントを投稿してください!