Qwen-Image-2.1 は、Alibaba の Qwen-Image 系における 2026 年 9 月のリリースで、生成と編集を 1 つのモデルに統合しました。テキストから画像を生成するモデルと別個の編集ツールを使い分ける代わりに、1 つのパイプラインを読み込みます。プロンプトを書けば画像が返り、元画像を渡して変更内容を書けば編集結果が返ります。第一者リポジトリ は 2026-09-14 に作成され、重みは 2026-09-20 に発表されました。2026-09-21 の GitHub は 435 stars、20 forks でした。以前の Qwen-Image とは別のリリースで、ライセンスも異なります。これはバージョン番号以上に重要な点です(後述)。
モデル仕様
- 視覚生成コンポーネントは 7B パラメータ、32 層のシングルストリーム DiT で構成されます。
- 生成と編集を統合し、同じ重みでテキストからの生成と指示ベースの編集を処理します。
- ネイティブな透過:テキストから通常画像または RGBA 画像を生成し、透過レイヤを編集し、通常の写真から被写体を抽出できます。
- 編集には 最大 10 枚の参照画像を使え、局所編集は円指定、塗り注釈、個別マスクで指定します。
- 編集時に人物や商品の同一性を保持します。
- 効率化:混合粒度アテンションと prefix KV cache の再利用で、長いコンテキストの生成と編集のコストを下げます。
ラボは今回のリリースを 4 つの軸で説明しています。コンパクトで効率的なアーキテクチャ、ネイティブ透過と生成・編集の統合、多様なマルチ参照編集、そして質感・タイポグラフィ・ポートレート照明の改善です。言語モデル側のオープンウェイトなアーキテクチャプレビューとして Qwen3.8-Flash-Next と見比べるのも有用です。
使用シナリオ
- 商品・デザイン業務:被写体を 1 度生成し、同一性を保ったまま別の背景へ移します。
- 透過が必要なアセット制作:背景付きで生成してから切り抜くのではなく、RGBA の切り抜きを直接出力します。
- ローカル/セルフホストの画像処理:重みは Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V で動かせるため、ホスト型エンドポイントに縛られません。
提供状況と Day-0 対応
重みは Hugging Face と ModelScope で公開されています。発表当日から複数のランタイムが対応しました。
| ランタイム | 対応 |
|---|---|
| Diffusers | 当日に QwenImage21Pipeline をマージ |
| ComfyUI | ネイティブ対応。テキスト生成と編集のサンプルワークフロー付き |
| vLLM-Omni | ステップ実行、prefix KV cache、CUDA Graph デコード、FP8 量子化、TP/Ulysses |
| SGLang | prefix caching、Cache-DiT、CUDA graphs、並列化、コンポーネント offload |
| LightX2V | Day-0 の高速化スクリプト |
ライセンス
製品化を考える前に必ず読むべき部分です。Qwen-Image-2.1 は Qwen Research License Agreement(2026-09-20 付)で提供され、使用・改変・配布は 非商業目的に限定されます。商業利用にはラボからの別途ライセンスが必要です。以前の Apache-2.0 の Qwen-Image とは本質的に異なるため、このバージョンアップは通常の更新ではなくライセンス変更として扱ってください。
はじめに
pip install torch>=2.4.0
pip install transformers>=5.17
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night, reflections on wet pavement",
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")
編集では同じパイプラインに image= を渡します。複数の参照画像も指定できます。
よくある質問
生成と編集は本当に同じ重みですか?
はい。今回のリリースは明示的に統合モデルで、生成と編集は 2 つのチェックポイントではなく 1 つのパイプラインを共有します。
透過画像を出力できますか?
できます。ネイティブな RGBA 出力は今回の主要機能の 1 つで、写真からの被写体抽出にも対応します。
商用利用できますか?
既定のライセンスではできません。Qwen Research License Agreement は非商業利用に限定され、商業展開には別途契約が必要です。
代替案
- Nano Banana:ローカルの重みを動かさず、素早い生成と編集を求める場合のホスト型の選択肢。
- GPT Image 2:文字描画と指示ベース編集で比較したいクローズドモデル。
- FLUX 1 dev:広く使われ、ライセンスもエコシステムも異なるオープンな画像モデル。
ヒント
- 編集機能を先に見たいなら、コードを書く前に ComfyUI のワークフローから始めるのが最短です。
- 局所編集は画像全体の再生成ではなく、マスクや塗り注釈を使いましょう。同一性の保持が狙いだからです。
- まず自分の用途でライセンスを確認してください。研究や評価では条件は寛容ですが、出荷する製品ではそうではありません。
まとめ
Qwen-Image-2.1 は比較的小型で実力のある画像モデルであり、本質は「統合」にあります。1 組の重みで生成・透過・マルチ参照編集をまかない、主要ランタイムで Day-0 対応を実現しています。Qwen Research License が自分の用途に合うなら、ローカルの画像処理で試す価値があります。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。