Supra2-IMG 是 SupraLabs 对一个具体问题的回答:文生图模型能做到多小,输出才还不至于没用?第一方模型卡 发布于 2026-09-21,权重以 Apache-2.0 许可放出;2026-09-22 时 Hugging Face 显示 56 个赞。这是一个 104.1M 参数的扩散 Transformer,完全从零训练,和它必定会被拿来对比的各种托管图像模型完全不是一个量级。
规格
| 数值 | |
|---|---|
| 架构 | 小型扩散 Transformer(DiT) |
| 参数量 | 104.1M |
| 文本编码器 | 冻结的 Flan-T5-Base(128 token) |
| VAE | SD-VAE-FT-MSE |
| 分辨率 | 256 x 256 |
| 潜在尺寸 | 32 x 32,patch 2 |
| 许可 | Apache-2.0 |
公开的配置是 14 层模型,D_MODEL 为 576,9 个注意力头,头维度 64,MLP 比例为 4.0。无条件嵌入直接存在检查点里,而不是运行时计算,这也是推理脚本能保持简短的原因。
训练过程
训练本身才是真正的重点。Supra2-IMG 在完整的 LucasFang/FLUX-Reason-6M 数据集上训练了 10 个 epoch,按构图、实体、文字、风格、想象力的顺序依次回退筛选 caption 后,实际使用 560 万张图。整个任务跑在一台 Nvidia H100 SXM 80GB 的 Runpod 机器上,含数据准备共 9 小时,磁盘 2.5TB。采样参数也公开固定:seed 0、50 步、cfg 3.0,所有公布的样例都用同一套设置。
怎么运行
不需要安装任何 pipeline 封装。从模型仓库下载 inference.py,直接对检查点运行:
mkdir Supra2-IMG && cd Supra2-IMG
wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py
python inference.py \
--prompt "a sea jellyfish floating in the pitch-black ocean depths" \
--seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png
脚本会拉取冻结的 Flan-T5-Base 分词器与编码器,以及 SD-VAE-FT-MSE 解码器,然后按指定步数执行 Euler flow 采样。检查点文件约 416MB,相比大多数图像模型动辄数 GB 的权重,下载几乎可以忽略。
适合什么场景
- 完整理解 DiT 文生图训练流程。 数据管线、配置和推理脚本,一次就能读完。
- CPU 与低端显卡实验。 104M 参数在同类模型里相当少见,小到可以在普通硬件上出图。
- 预算固定的原型。 如果你需要一个可嵌入、可重新训练的 256x256 缩略图生成器,体积本身就是卖点。
局限与风险
- 只有 256 x 256。 它不是为印刷、商品图或任何需要细节的场景准备的。
- 「同尺寸 SOTA」是实验室自己的说法。 这个量级上并不存在中立的第三方排名。
- 没有产品面。 没有在线 playground、没有 API、也没有应用,交付物就是一个 Python 脚本。
- 文本编码器小、提示词短。 Flan-T5-Base 对提示词的处理上限是 128 token,长而复杂的提示会明显退化。
- 评测由厂商执行。 样例图来自实验室本身,而单卡 9 小时的预算天然锁定了成本与清晰度之间的某个取舍。
常见问题
Supra2-IMG 可以商用吗?
模型卡声明为 Apache-2.0,许可宽松。但训练语料有自己的来源与条款,如果输出要用于商业用途,请一并核对数据集许可。
没有显卡能跑吗?
实验室给出的数字是 CPU 上约 20 秒一张、GPU 上约 2 秒一张。请把这些当作项目自身提供的计时。
跟托管模型比怎么样?
质量上没法比。应该和同样小尺寸的开源模型比较,而不是和前沿 API 比较。想看同一问题的另一种开放路线,可以对照 Qwen-Image-2.1。
替代方案
- Qwen-Image-2.1:规模大得多的开源权重模型,还能做图像编辑,但硬件成本高很多。
- Nano Banana:想要质量而不是控制权时的托管方案。
- GPT Image 2:在指令跟随上可以对比的闭源端点。
总结
Supra2-IMG 是一个小而诚实、完全可复现的实验。一张 H100 上 9 小时、104M 参数的 DiT,离托管图像模型的能力差得很远,但这正是它的意义:整套配方都在一个你读得完、能重训、也能在自己已有硬件上跑起来的仓库里。想理解超小型扩散 Transformer 就用它,需要生产级图像就别用它。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。