Alibaba⁠⁠、画像生成⁠⁠・編集モデル「Qwen-Image-2.1」を公開  —⁠—透明背景の画像にも対応

AlibabaのQwenチームは9月20日、画像生成・編集モデル「Qwen-Image-2.1」をオープンウェイトモデルとして公開した。テキストからの画像生成と画像編集を1つのモデルで扱い、背景が透明な画像の生成・編集や、最大10枚の参照画像を使った編集に対応する。なお、Qwen-Image-2.1にはQwen Research License Agreementが適用される。

透明画像の生成から複数画像を使う編集まで

Qwen-Image-2.1は、色に加えて透明度の情報を持つRGBA画像を、テキストの指示から直接生成できる。背景を透明に保ったまま被写体の表情を変えたり、画像内の文字を書き換えたりする編集にも対応する。

写真から指定した被写体を切り出し、背景が透明な画像として出力することもできる。生成した素材や切り出した被写体は、他の画像との合成に利用できる。

複数の参照画像を使う編集では、人物の顔立ちや商品の形状などの特徴を保ちながら、画像を組み合わせられる。公式ブログには、6人分の顔写真を基に集合写真を生成する例が掲載されている。着せ替えの例では、人物、服、靴、バッグ、帽子をそれぞれ写した5枚の画像を組み合わせ、指定した服や小物を身に着けた人物画像を生成している。

編集したい範囲は、画像上で円を描いて囲んだり、塗りつぶしたりして指定できる。公開した例では、腕時計、髪、衣服をそれぞれ円で囲み、腕時計の削除、髪色の変更、衣服の置き換えを一度に指示している。

元の画像とは別に、編集範囲を示すマスク画像を入力することもできる。この方法なら、円や塗りつぶしで元画像の一部を隠すことなく、編集箇所を指定できる。

また、モデルを3方向から写した参照画像を基に、一連の場面からなるストーリーボードを生成する例も紹介している。

パノラマ画像やインフォグラフィックの生成にも対応する。公式ブログには、自撮り写真からパノラマ画像を作る例が掲載されている。人物の写真を基に、文字や図で情報を伝えるインフォグラフィックを生成する例も紹介している。

画質面では、Qwenチームは質感や文字表現の改善をうたっている。文字の描画では、書く内容だけでなく、書体や配置、画像全体との調和も考慮する。人物画像では、光の当たり方や細部の描写を改善し、より写実的な表現が可能になったとしている。

画像生成部分は7B⁠、複数画像の処理を効率化

公式リポジトリによると、画像生成部分のパラメーター数は7B(70億⁠)⁠。テキスト指示と参照画像の情報を処理するエンコーダーには、画像と言語を扱うモデル「Qwen3-VL 8B」を採用している。[1]

推論の高速化には、計算結果を保持して再利用するキャッシュの仕組みを使う。画像生成の最初のステップで入力画像とテキスト指示に関する計算を行い、その結果を後続のステップで再利用する。Qwenチームは、これにより、特に複数画像を入力する際の推論を高速化したとしている。

出力は2K解像度に対応し、デフォルトの画像サイズは2048×2048ピクセル。縦長や横長の画像も生成できる。

Qwenチームは公式ブログで、画像生成ベンチマーク「Qwen-Image-Bench」の比較グラフも公開した。Qwen-Image-2.1の総合スコアは60.28で、Nano Banana 2.0(59.82)に匹敵する結果を示している。[2]

モデルの配布と利用条件

モデルはHugging FaceとModelScopeからダウンロードできる。

適用ライセンスはQwen Research License Agreementで、モデルの重みやコード、文書などの提供物について、研究・評価目的の非商用利用を認めている。モデルを商用利用するには、開発元から別途ライセンスを取得する必要がある。[3]

なお、Qwenの開発者向け公式XアカウントQwen Developersは、ライセンス、特に生成物の扱いについて多くの質問が寄せられたとして、9月21日の追加投稿で補足した。Qwen-Image-2.1で生成した画像などのコンテンツは、ライセンスが定義する提供物には含まれず、その権利はユーザーに残ると説明している。

おすすめ記事

記事・ニュース一覧