Qwen-Image-2.1 logo

Qwen-Image-2.1

打开

Qwen-Image-2.1 是阿里 7B 开放权重模型,同一套权重既做文生图也做图像编辑,还支持原生透明 PNG 与最多十张参考图。

分享:
查看替代方案

Qwen-Image-2.1 是阿里 Qwen-Image 系列在 2026 年 9 月的新版本,它把生成和编辑合并进同一个模型。你不再需要在「文生图模型」和「单独的编辑器」之间二选一,而是加载同一条流水线:描述一张图就得到一张图,或者给它一张原图并描述要改什么。第一方仓库 创建于 2026-09-14,权重于 2026-09-20 发布;2026-09-21 GitHub 显示 435 star20 fork。它与此前那个 Qwen-Image 是两个不同发布,许可证也不一样,这比版本号本身更重要(见下文)。

模型规格

  • 视觉生成部分为 7B 参数,由 32 层单流 DiT 构成。
  • 生成与编辑统一在同一个模型里,同一套权重既处理文生图,也处理基于指令的编辑。
  • 原生透明:可以从文本生成普通图像或 RGBA 图像,编辑透明图层,也能从普通照片里提取主体。
  • 最多 10 张参考图参与编辑,局部修改可用圈选、涂抹标注或独立蒙版来指定。
  • 身份保持:编辑而非重绘时,人物与商品的外观可以保持一致。
  • 效率优化:混合粒度注意力与 prefix KV cache 复用,降低了长上下文生成与编辑的开销。

官方把这次发布概括为四点:紧凑高效的架构、原生透明且生成与编辑统一、多参考图的多样化编辑能力,以及更真实的材质、排版与肖像光影。如果想看同一实验室在语言模型侧的开源架构预览,可以对照 Qwen3.8-Flash-Next

适用场景

  • 商品与设计工作:先生成一个主体,再把它放到不同背景上,同时保持主体一致。
  • 需要透明通道的素材流水线:直接产出 RGBA 抠图,而不是先带背景生成再做抠图。
  • 本地或自托管图像任务:权重可通过 Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 运行,不绑定托管端点。

可用性与 Day-0 支持

权重发布在 Hugging Face 与 ModelScope。多个运行时在模型公布当天就提供了支持:

运行时 支持情况
Diffusers 当天合入 QwenImage21Pipeline
ComfyUI 原生支持,并附带文生图与编辑示例工作流
vLLM-Omni 逐步执行、prefix KV cache、CUDA Graph 解码、FP8 量化、TP/Ulysses
SGLang prefix caching、Cache-DiT、CUDA graphs、并行与组件 offload
LightX2V Day-0 加速脚本

许可证

这是规划产品前必须先看的部分。Qwen-Image-2.1 采用 Qwen Research License Agreement(落款 2026-09-20),授权范围是仅限非商业用途的使用、修改与分发。商业用途需要单独向实验室申请许可。这与此前 Apache-2.0 的 Qwen-Image 有本质区别,所以请把这个版本号理解成一次许可变更,而不只是一次例行升级。

快速开始

pip install torch>=2.4.0
pip install transformers>=5.17
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")

编辑时给同一条流水线传入 image= 参数即可,也可以传入多张参考图。

常见问题

生成和编辑真的是同一套权重吗?

是。这次发布明确是统一模型,生成与编辑共用一条流水线,而不是两个 checkpoint。

它能输出透明图像吗?

能。原生 RGBA 输出是这次的主打特性之一,同时还能从照片中提取主体。

可以商用吗?

默认许可下不行。Qwen Research License Agreement 限定为非商业用途,商业部署需要单独授权。

替代方案

  • Nano Banana:不跑本地权重、想要快速生成与编辑时的托管方案。
  • GPT Image 2:在文字渲染与指令式编辑上可做对比的闭源模型。
  • FLUX 1 dev:使用广泛、许可与生态都不同的开源图像模型。

使用技巧

  1. 想先看编辑能力再动手写代码的话,从 ComfyUI 的工作流入手最快。
  2. 局部修改优先用蒙版或涂抹标注,而不是整张重绘,毕竟身份保持才是重点。
  3. 先按自己的用途核对许可。研究或评测场景下条款相当宽松,做成对外产品则不然。

总结

Qwen-Image-2.1 是一个体量相对小、能力扎实的图像模型,真正的看点是「统一」:一套权重同时覆盖生成、透明与多参考图编辑,并且在主流运行时上做到了 Day-0 支持。做本地图像任务时值得一试,前提是 Qwen Research License 适合你要做的事。

评论

还没有评论。成为第一个评论的人!