AlibabaのQwenチームは9月20日、画像生成・
透明画像の生成から複数画像を使う編集まで
Qwen-Image-2.
写真から指定した被写体を切り出し、背景が透明な画像として出力することもできる。生成した素材や切り出した被写体は、他の画像との合成に利用できる。
複数の参照画像を使う編集では、人物の顔立ちや商品の形状などの特徴を保ちながら、画像を組み合わせられる。公式ブログには、6人分の顔写真を基に集合写真を生成する例が掲載されている。着せ替えの例では、人物、服、靴、バッグ、帽子をそれぞれ写した5枚の画像を組み合わせ、指定した服や小物を身に着けた人物画像を生成している。
編集したい範囲は、画像上で円を描いて囲んだり、塗りつぶしたりして指定できる。公開した例では、腕時計、髪、衣服をそれぞれ円で囲み、腕時計の削除、髪色の変更、衣服の置き換えを一度に指示している。
元の画像とは別に、編集範囲を示すマスク画像を入力することもできる。この方法なら、円や塗りつぶしで元画像の一部を隠すことなく、編集箇所を指定できる。
また、モデルを3方向から写した参照画像を基に、一連の場面からなるストーリーボードを生成する例も紹介している。
パノラマ画像やインフォグラフィックの生成にも対応する。公式ブログには、自撮り写真からパノラマ画像を作る例が掲載されている。人物の写真を基に、文字や図で情報を伝えるインフォグラフィックを生成する例も紹介している。
画質面では、Qwenチームは質感や文字表現の改善をうたっている。文字の描画では、書く内容だけでなく、書体や配置、画像全体との調和も考慮する。人物画像では、光の当たり方や細部の描写を改善し、より写実的な表現が可能になったとしている。
画像生成部分は7B、複数画像の処理を効率化
公式リポジトリによると、画像生成部分のパラメーター数は7B
推論の高速化には、計算結果を保持して再利用するキャッシュの仕組みを使う。画像生成の最初のステップで入力画像とテキスト指示に関する計算を行い、その結果を後続のステップで再利用する。Qwenチームは、これにより、特に複数画像を入力する際の推論を高速化したとしている。
出力は2K解像度に対応し、デフォルトの画像サイズは2048×2048ピクセル。縦長や横長の画像も生成できる。
Qwenチームは公式ブログで、画像生成ベンチマーク
モデルの配布と利用条件
モデルはHugging FaceとModelScopeからダウンロードできる。
適用ライセンスはQwen Research License Agreementで、モデルの重みやコード、文書などの提供物について、研究・
なお、Qwenの開発者向け公式XアカウントQwen Developersは、ライセンス、特に生成物の扱いについて多くの質問が寄せられたとして、9月21日の追加投稿で補足した。Qwen-Image-2.