NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / MODELS
AlibabaのQwen、画像生成・編集モデル「Qwen-Image-2.1」をオープンウェイト公開 — 7Bで透過PNG生成と最大10枚参照編集に対応
Qwenチームは2026年9月20日、テキストからの画像生成と画像編集を1モデルに統合した「Qwen-Image-2.1」を公開した。画像生成部は70億パラメータ、ネイティブ2K解像度、透過(RGBA)画像の生成・編集に対応し、最大10枚の参照画像を使った多主体の合成や、丸囲み・マスク指定の局所編集ができる。重みはHugging FaceとModelScopeで公開され、Diffusers・ComfyUI・vLLM-Omni・SGLangが初日から対応した。
AlibabaのQwenチームは2026年9月20日、テキストからの画像生成(text-to-image)と画像編集を1つのモデルに統合した**「Qwen-Image-2.1」を公開した。公式リポジトリのNews欄に同日付で「We released Qwen-Image-2.1!」と記載され、重みはHugging FaceとModelScopeでダウンロードできる。画像生成を担う部分のパラメータ数は70億(7B)**と比較的軽量で、生成品質と推論効率の両立を狙った設計と説明されている。
モデルの概要 — 7B生成部・透過対応・2K解像度
- アーキテクチャ: 画像生成コンポーネントは70億パラメータ、32層のSingle-Stream DiT。混合粒度アテンション(mixed-granularity attention)とprefix KVキャッシュの再利用で、低い計算コストでの高画質化を図るとしている。
- 統合モデル: 通常の画像生成に加え、透過(RGBA)画像のテキストからの生成、透過レイヤーの編集、写真からの被写体抽出を1モデルで扱える。透過生成時はプロンプトに「This is an RGBA image with transparency. …」と付ける形式が推奨されている。
- 解像度: ネイティブ2K解像度に対応し、1:1(2048×2048)から16:9(2752×1536)など7種類のアスペクト比の推奨サイズが示されている。既定の推論ステップ数は40。
- プロンプト書き換え: 短いプロンプトを詳細化するための公式モデルとして、Qwen3.5-VL 9Bを fine-tune した2種(テキスト→画像用
Qwen-Image-2.1-PE-T2I、編集用Qwen-Image-2.1-PE-I2I)もHugging Faceで公開されている。
編集機能 — 最大10枚参照と局所指定
- 多参照編集: 最大10枚の参照画像を使った多主体の合成に対応する。複数キャラクターを同じ場面に配置するような用途を想定している。
- 局所編集の指定方法: 円での丸囲み、ペイント注釈、別マスクの3方式で編集箇所を指定できる。人物や商品のアイデンティティ保持にも対応するとしている。
- 質感の改善点: タイポグラフィ(文字描画)、ポートレートのライティング、細部のディテールの改善をうたっている。
- 注意: 性能比較の数値表や他モデルとのベンチマーク対照表は、GitHubリポジトリ・Hugging Faceモデルカードの一次情報には掲載されていない(比較画像なし)。一部二次情報が他モデルとの優劣に触れているが、一次情報で裏が取れないため本稿では断定しない。
公開形態と初日対応のエコシステム
- ライセンス: リポジトリは Qwen Research License Agreement の下で提供される。利用条件の詳細はリポジトリ同梱のLICENSEを参照する必要がある。
- 入手先: 重みは Hugging Face とModelScopeで公開。Hugging Face Spacesにデモも用意されている。中国本土向けにはwuli.artで無料利用できると案内されている。
- 初日対応: Diffusers(
QwenImage21Pipeline、PR #14804)、ComfyUI(ネイティブ対応+サンプルワークフロー)、vLLM-Omni(FP8量子化・prefix KVキャッシュ・並列化)、SGLang(PR #39983)、LightX2Vがリリース当日から対応を表明している。 - API利用の入り口: Diffusers経由で
Qwen/Qwen-Image-2.1を指定してパイプラインを構築する使い方がクイックスタートとして示されている(torch.bfloat16、CUDA実行が前提の例)。