画像・動画生成

Qwen-Image 2.1:手元のPCで画像生成と編集を

気に入った画像ができても、背景だけ変えたいことがあります。生成し直すと被写体まで変わり、編集用モデルを別に導入するのも手間です。Qwen-Image 2.1は、その間を埋めます。新規生成から参照写真の編集、透明な素材づくりへ進めます。

実行条件と要点
  • 2026年9月20日公開の、生成と編集を統合したモデルです。
  • GGUFは生成本体のみ。エンコーダーと専用VAEも用意します。
  • 透明画像と最大10枚の参照に対応しますが、アプリの対応範囲は異なります。

うれしいのは、最初からやり直さずに済むこと

個人制作の画面に、カップと木の机の絵を入れるとします。実際に置くと背景色が合わず、カップも少し右に寄せたい。最初の良い一枚を得るのと同じくらい、用途に合わせた修正が大切になる瞬間です。生成と編集の環境が別だと、小さな修正にも時間がかかります。

Qwen-Image 2.1は文章からの新規生成と、入力画像の編集を同じモデルで扱います。対応ツールなら、人物を参考に服や背景を変えたり、製品の形状を基に構図を変えたりできます。ただし、参照しても細部が必ず保たれるわけではありません。ロゴ、文字、顔、手は完成画像を拡大して確認しましょう。

モニターと静物画のプリントがある机
最初の一枚だけでなく、用途に合わせた修正まで考えます。

2512の新しいファイルではなく、実行構成が変わった2.1

Qwen-Image-2512を使っていると、重みだけ交換したくなります。しかし2.1は7Bの画像生成本体とQwen3-VL-8Bエンコーダー、専用VAE1を使う別の構成です。ComfyUIでは対応バージョン、ノード、2.1用ワークフローを一緒に確認する方が早道です。

当サイトでは2512を残し、2.1を別項目にしました。以前の作業を再現する必要があり、ライセンスも異なるためです。新モデルが出ても、動いている環境を急いで置き換える必要はありません。よく使うプロンプトで、自分が繰り返す修正に役立つか試してみましょう。

透明背景は白い背景とは違います

白背景の画像を別の画面に貼ると、白い四角も付いてきます。RGBAのアルファチャンネルは透明にする部分を保存するため、異なる背景に被写体を載せられます。Qwen-Image 2.1は透明生成とレイヤー編集に対応しますが、アプリがRGB出力なら透明度は失われる場合があります。

PNGまたは透明度対応のWebPで保存し、明るい背景と暗い背景に重ねてください。髪やガラスの縁を確認しやすくなります。JPEGに変換するとアルファは消えます。本稿の水彩画は概念説明用で、Qwen-Image 2.1の実際の生成例ではありません。

透明な植物の絵を異なる背景に重ねた様子
透明度は背景色とは別に保存されます。

参照は1枚、修正も一つから

最大10枚の参照を受け付けますが、最初から10枚が最適とは限りません。照明や視点、背景が食い違うと、何を残すべきか伝えにくくなります。まず被写体が明瞭な1枚で背景だけ変え、安定したら構図や素材の条件を追加しましょう。

参照入力は画像トークン2とメモリ使用量を増やします。新規生成の時間をそのまま編集時間と考えると、待ち時間が長く感じられます。当サイトの体験はテキストからの生成が基準です。写真編集用の機器を選ぶなら、参照入力時のメモリ余裕も確認してください。

手元の機器では、どの実行方法から試すか

NVIDIAならDiffusersやComfyUIが出発点になり、RTX 5090にはLightX2Vの専用最適化もあります。MacではMetalを使うComfyUI GGUF3やstable-diffusion.cppが候補です。同じQ4という名前でもローダー間で互換とは限りません。変換版に合う実行環境を選びます。

12〜16GB級の案内は量子化4オフロード5が前提です。ファイルが入ることと、快適に反復できることは別。1024角・1枚から始め、問題がなければ解像度を上げます。手持ち機器で時々作る場合と、一日中候補を作る場合では、購入の判断も変わります。

2Kを選ぶ前に、繰り返す作業を確認する

ネイティブ2K対応は出力の選択肢が広いという意味で、1Kと同じ速度ではありません。縦横2倍なら画素数は4倍で、計算量やメモリはそれ以上増える場合もあります。サムネイルなら低解像度で構図と文言を決め、選んだ候補を大きく確認すると待つ回数を減らせます。

Qwen-Image 2.1を選び、機器と解像度を変えると推定の待ち時間を体験できます。これはサンプル再生であり、閲覧中の機器でQwenを実行する機能ではありません。画質ではなく、修正してもう一度待てる時間かを確かめてください。導入はGGUFガイドへ進めます。

同じ花瓶を異なる背景に置いた2枚の絵
一つだけ変え、何が維持されたか確認します。

個人での検証と商用利用は分けて考える

重みはQwen Research Licenseで配布され、非商用の研究・評価と、別途許可が必要な商用利用を区別します。2512のApache 2.0をそのまま当てはめないでください。Unsloth GGUFに変換されても、元の利用条件が消えるわけではありません。

有料サービス、顧客への納品、販売用コンテンツに使うなら、作業前に条件の適用範囲を確認してください。ローカルで動くかの検証と事業利用は別の判断です。速度と利用許諾を一緒に確認すれば、後から環境全体を変える事態を減らせます。

用語の注釈

  1. VAEVariational Autoencoderの略です。入力を圧縮した潜在表現に変換したり、その表現から出力を復元したりします。

    本文に戻る
  2. トークンモデルが入力や出力を分けて処理する単位です。1トークンが1文字や一定の時間に相当するわけではありません。

    本文に戻る
  3. GGUFモデル情報を格納するファイル形式で、llama.cpp系のツールで広く使われます。形式だけで特定ハードウェアへの対応や速度が保証されるわけではありません。

    本文に戻る
  4. 量子化モデルの数値を少ないビット数で表す方法です。メモリ使用量のほか、精度や実行速度も変わることがあり、影響は形式と実装によります。

    本文に戻る
  5. オフロード容量が足りないとき、モデルデータの一部をGPUメモリからシステムRAMやストレージへ移して処理する方法です。データ転送が追加されます。

    本文に戻る