Supra2-IMG logo

Supra2-IMG

打开

Supra2-IMG 是 Apache-2.0 许可的 104M 参数文生图 DiT,在一张 H100 上从零训练 9 小时,输出 256x256 图像。

分享:
查看替代方案

Supra2-IMG 是 SupraLabs 对一个具体问题的回答:文生图模型能做到多小,输出才还不至于没用?第一方模型卡 发布于 2026-09-21,权重以 Apache-2.0 许可放出;2026-09-22 时 Hugging Face 显示 56 个赞。这是一个 104.1M 参数的扩散 Transformer,完全从零训练,和它必定会被拿来对比的各种托管图像模型完全不是一个量级。

规格

数值
架构 小型扩散 Transformer(DiT)
参数量 104.1M
文本编码器 冻结的 Flan-T5-Base(128 token)
VAE SD-VAE-FT-MSE
分辨率 256 x 256
潜在尺寸 32 x 32,patch 2
许可 Apache-2.0

公开的配置是 14 层模型,D_MODEL 为 576,9 个注意力头,头维度 64,MLP 比例为 4.0。无条件嵌入直接存在检查点里,而不是运行时计算,这也是推理脚本能保持简短的原因。

训练过程

训练本身才是真正的重点。Supra2-IMG 在完整的 LucasFang/FLUX-Reason-6M 数据集上训练了 10 个 epoch,按构图、实体、文字、风格、想象力的顺序依次回退筛选 caption 后,实际使用 560 万张图。整个任务跑在一台 Nvidia H100 SXM 80GB 的 Runpod 机器上,含数据准备共 9 小时,磁盘 2.5TB。采样参数也公开固定:seed 0、50 步、cfg 3.0,所有公布的样例都用同一套设置。

怎么运行

不需要安装任何 pipeline 封装。从模型仓库下载 inference.py,直接对检查点运行:

mkdir Supra2-IMG && cd Supra2-IMG
wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py

python inference.py \
  --prompt "a sea jellyfish floating in the pitch-black ocean depths" \
  --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

脚本会拉取冻结的 Flan-T5-Base 分词器与编码器,以及 SD-VAE-FT-MSE 解码器,然后按指定步数执行 Euler flow 采样。检查点文件约 416MB,相比大多数图像模型动辄数 GB 的权重,下载几乎可以忽略。

适合什么场景

  • 完整理解 DiT 文生图训练流程。 数据管线、配置和推理脚本,一次就能读完。
  • CPU 与低端显卡实验。 104M 参数在同类模型里相当少见,小到可以在普通硬件上出图。
  • 预算固定的原型。 如果你需要一个可嵌入、可重新训练的 256x256 缩略图生成器,体积本身就是卖点。

局限与风险

  • 只有 256 x 256。 它不是为印刷、商品图或任何需要细节的场景准备的。
  • 「同尺寸 SOTA」是实验室自己的说法。 这个量级上并不存在中立的第三方排名。
  • 没有产品面。 没有在线 playground、没有 API、也没有应用,交付物就是一个 Python 脚本。
  • 文本编码器小、提示词短。 Flan-T5-Base 对提示词的处理上限是 128 token,长而复杂的提示会明显退化。
  • 评测由厂商执行。 样例图来自实验室本身,而单卡 9 小时的预算天然锁定了成本与清晰度之间的某个取舍。

常见问题

Supra2-IMG 可以商用吗?

模型卡声明为 Apache-2.0,许可宽松。但训练语料有自己的来源与条款,如果输出要用于商业用途,请一并核对数据集许可。

没有显卡能跑吗?

实验室给出的数字是 CPU 上约 20 秒一张、GPU 上约 2 秒一张。请把这些当作项目自身提供的计时。

跟托管模型比怎么样?

质量上没法比。应该和同样小尺寸的开源模型比较,而不是和前沿 API 比较。想看同一问题的另一种开放路线,可以对照 Qwen-Image-2.1

替代方案

  • Qwen-Image-2.1:规模大得多的开源权重模型,还能做图像编辑,但硬件成本高很多。
  • Nano Banana:想要质量而不是控制权时的托管方案。
  • GPT Image 2:在指令跟随上可以对比的闭源端点。

总结

Supra2-IMG 是一个小而诚实、完全可复现的实验。一张 H100 上 9 小时、104M 参数的 DiT,离托管图像模型的能力差得很远,但这正是它的意义:整套配方都在一个你读得完、能重训、也能在自己已有硬件上跑起来的仓库里。想理解超小型扩散 Transformer 就用它,需要生产级图像就别用它。

评论

还没有评论。成为第一个评论的人!