Qwen-Image-2.1 是阿里 Qwen-Image 系列在 2026 年 9 月的新版本,它把生成和编辑合并进同一个模型。你不再需要在「文生图模型」和「单独的编辑器」之间二选一,而是加载同一条流水线:描述一张图就得到一张图,或者给它一张原图并描述要改什么。第一方仓库 创建于 2026-09-14,权重于 2026-09-20 发布;2026-09-21 GitHub 显示 435 star、20 fork。它与此前那个 Qwen-Image 是两个不同发布,许可证也不一样,这比版本号本身更重要(见下文)。
模型规格
- 视觉生成部分为 7B 参数,由 32 层单流 DiT 构成。
- 生成与编辑统一在同一个模型里,同一套权重既处理文生图,也处理基于指令的编辑。
- 原生透明:可以从文本生成普通图像或 RGBA 图像,编辑透明图层,也能从普通照片里提取主体。
- 最多 10 张参考图参与编辑,局部修改可用圈选、涂抹标注或独立蒙版来指定。
- 身份保持:编辑而非重绘时,人物与商品的外观可以保持一致。
- 效率优化:混合粒度注意力与 prefix KV cache 复用,降低了长上下文生成与编辑的开销。
官方把这次发布概括为四点:紧凑高效的架构、原生透明且生成与编辑统一、多参考图的多样化编辑能力,以及更真实的材质、排版与肖像光影。如果想看同一实验室在语言模型侧的开源架构预览,可以对照 Qwen3.8-Flash-Next。
适用场景
- 商品与设计工作:先生成一个主体,再把它放到不同背景上,同时保持主体一致。
- 需要透明通道的素材流水线:直接产出 RGBA 抠图,而不是先带背景生成再做抠图。
- 本地或自托管图像任务:权重可通过 Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 运行,不绑定托管端点。
可用性与 Day-0 支持
权重发布在 Hugging Face 与 ModelScope。多个运行时在模型公布当天就提供了支持:
| 运行时 | 支持情况 |
|---|---|
| Diffusers | 当天合入 QwenImage21Pipeline |
| ComfyUI | 原生支持,并附带文生图与编辑示例工作流 |
| vLLM-Omni | 逐步执行、prefix KV cache、CUDA Graph 解码、FP8 量化、TP/Ulysses |
| SGLang | prefix caching、Cache-DiT、CUDA graphs、并行与组件 offload |
| LightX2V | Day-0 加速脚本 |
许可证
这是规划产品前必须先看的部分。Qwen-Image-2.1 采用 Qwen Research License Agreement(落款 2026-09-20),授权范围是仅限非商业用途的使用、修改与分发。商业用途需要单独向实验室申请许可。这与此前 Apache-2.0 的 Qwen-Image 有本质区别,所以请把这个版本号理解成一次许可变更,而不只是一次例行升级。
快速开始
pip install torch>=2.4.0
pip install transformers>=5.17
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")
编辑时给同一条流水线传入 image= 参数即可,也可以传入多张参考图。
常见问题
生成和编辑真的是同一套权重吗?
是。这次发布明确是统一模型,生成与编辑共用一条流水线,而不是两个 checkpoint。
它能输出透明图像吗?
能。原生 RGBA 输出是这次的主打特性之一,同时还能从照片中提取主体。
可以商用吗?
默认许可下不行。Qwen Research License Agreement 限定为非商业用途,商业部署需要单独授权。
替代方案
- Nano Banana:不跑本地权重、想要快速生成与编辑时的托管方案。
- GPT Image 2:在文字渲染与指令式编辑上可做对比的闭源模型。
- FLUX 1 dev:使用广泛、许可与生态都不同的开源图像模型。
使用技巧
- 想先看编辑能力再动手写代码的话,从 ComfyUI 的工作流入手最快。
- 局部修改优先用蒙版或涂抹标注,而不是整张重绘,毕竟身份保持才是重点。
- 先按自己的用途核对许可。研究或评测场景下条款相当宽松,做成对外产品则不然。
总结
Qwen-Image-2.1 是一个体量相对小、能力扎实的图像模型,真正的看点是「统一」:一套权重同时覆盖生成、透明与多参考图编辑,并且在主流运行时上做到了 Day-0 支持。做本地图像任务时值得一试,前提是 Qwen Research License 适合你要做的事。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。