本文へスキップ

Qwen-Image-2.1の使い方と必要スペック:商用利用は別ライセンス

試すなら公式Space、手元ならComfyUIかUnslothのGGUF、組み込むならAPI(1枚約$0.035〜$0.04)。仕事で公開ウェイトを使うなら商用許諾の申請が先です。

A
AI Free API Team
••32 分で読めます•AI画像生成
台座の上に積まれた3つの層。VRAM6GB(オフロード)、12GB(GGUF)、24GB(INT8/FP8)の高さを比べ、左に「Qwen-Image-2.1 必要スペック」と書かれた図

Qwen-Image-2.1は、AlibabaのQwenチームが2026年9月20日に公開した画像生成・編集モデルです。1つのモデルでテキストからの生成と指示による編集をこなし、背景が透明な透過PNGをそのまま出力でき、編集では参照画像を最大10枚まで使えます。重みはHugging FaceとModelScopeから無料でダウンロードできます。

ただし、無料なのはダウンロードと研究・評価の範囲までです。ライセンスはQwen Research Licenseで、利用は「研究または評価の目的」に限られます。クライアントワークや自社商品の画像づくりに公開ウェイトを使うなら、Alibaba側へ商用ライセンスを別途申請する必要があります。

手元の環境と目的で、始め方は次のように分かれます(2026年10月7日時点)。

手元の環境・目的始め方気をつける点
まず1枚見てみたい、GPUがないHugging Faceの公式Space、またはModelScope無料枠の量は公開されておらず、混雑すると待たされる
NVIDIA GPU、VRAM12〜16GBUnslothのGGUF Q4_K_M を1024×1024で研究・評価目的に限る
NVIDIA GPU、VRAM24GB以上ComfyUIの公式テンプレート(INT8版)、またはGGUF Q4_K_Mを1024×1024でUnslothの目安ではINT8/FP8は512×512から。2Kはさらにメモリを使う
VRAM6GBFP8をCPUオフロード付きで(2倍弱遅くなる目安)オフロード分のシステムメモリが別に要る
Apple Silicon(ユニファイドメモリ12〜16GB以上)UnslothのGGUF対応するネイティブバックエンドが必要
VRAM6GB未満、またはGPUなしCPU(RAM12〜16GB)でGGUF、もしくはSpaceやAPICPUのみでの速度目安は公開されていない
アプリやサービスに組み込むAlibaba Cloud Model Studioのqwen-image-2.1-pro、1枚$0.035333〜$0.04出力の扱いはAlibaba Cloudの契約条件による
仕事で使う公開ウェイトなら商用ライセンスを申請生成物の権利と、モデルを業務で動かす許可は別の話

VRAMの数字は、量子化版を配布しているUnslothのガイドが示す出発点の目安で、検証済みの下限ではありません。解像度やオフロードの設定でメモリ使用量は変わります。

Qwen-Image-2.1でできること:7Bの1モデルで生成・編集・透過

公式GitHubによると、画像を生成する部分は7Bパラメータ(single-stream DiT 32層)で、指示文と参照画像を読み取るテキストエンコーダーにQwen3-VL 8Bを使います。VAEは透明度(アルファチャンネル)を持つRGBA対応で、透過画像を後から切り抜くのではなく最初から透過で生成・編集できます。

公式に挙げられている機能は次のとおりです。

  • テキストから通常画像と透過画像を生成し、透過レイヤーの編集や写真からの被写体の切り出しもできる
  • 参照画像を最大10枚使った合成・編集(人物や商品の見た目を保ったまま組み合わせる)
  • 丸囲み、手描きの印、マスクによる部分編集
  • ネイティブ2K出力(正方形なら2048×2048)と、細かい文字の描画

性能については、Alibabaが自社の比較図でNano Banana 2.0やGPT-Image-1.5より高いスコアだとしていますが、独立した比較ではありません。GIGAZINEの試用記事は、ChatGPTやGeminiのオンラインサービスより品質は劣るものの、ローカルなら回数を気にせずシードを変えて良い1枚を選べる、と評価しています。

Qwen-Image-2.0・3.0との関係:2.1だけが重みを公開

バージョン番号と公開形態の関係は少しややこしくなっています。

バージョン公開時期重みの公開ライセンス
Qwen-Image(初代)2025年8月ありApache 2.0
Qwen-Image-2.02026年2月なし(API専用)―
Qwen-Image-3.02026年7月なし(API専用)―
Qwen-Image-2.12026年9月20日ありQwen Research License(非商用)

2.1は番号こそ3.0より小さいものの、3.0より後に公開された、シリーズでは久しぶりのオープンウェイトモデルです。初代と同じApache 2.0だと思い込みやすい点に注意してください。3.0は公式ベンチマークも重みも公開されていないため、2.1と3.0のどちらが上かを示す材料はありません。

商用利用はできる?研究用ライセンスと生成物の権利は別の話

公開ウェイトを、許諾なしに仕事へ使うことはできません。ライセンス本文は利用・複製・改変を「非商用目的に限り」認めると定め、非商用を「研究または評価の目的のみ」と定義しています。商用で使う場合は model-business@notice.qwencloud.com に申請して別のライセンスを受ける必要があります。UnslothのGGUFやFP8のような量子化版も元のモデルの派生物なので、同じ条件がかかります。

混乱しやすいのが生成物の扱いです。Qwen公式のXアカウントは2026年9月21日、「生成物はライセンス対象の素材に含まれず、生成した画像などの権利はユーザーにある」と回答しています(GIGAZINEの記事に埋め込まれた投稿)。ただしこれはSNS上の回答で、ライセンス本文には書かれていません。また「できた画像の権利が自分にある」ことと、「業務のためにモデルを動かすことが研究・評価の範囲に入る」ことは別の問題で、後者についての回答はありません。

用途ごとに整理すると次のようになります。

用途公開ウェイトでの扱い
性能の比較テスト、研究、導入前の評価ライセンスの範囲内
趣味の作品づくり「研究または評価」に当たるかは定義されていない
クライアントワーク、広告・商品画像、有料サービスへの組み込み商用ライセンスの申請が必要
生成画像やモデルを使って別のAIモデルを学習し公開する関連文書に「Built with Qwen」または「Improved using Qwen」の表示が必要
改変した重みや量子化版の再配布ライセンス本文とNoticeファイルを同梱する

APIで使う場合の扱いも、経路ごとに異なります。

  • Alibaba Cloud Model Studioのコンソールで試す「モデルの試用」で作った画像は、サービス規約上、性能評価にしか使えず、商用を含む他の目的には使えません。試用サービスが付けた「AI生成」の表示も外せません。
  • 有料のAPI呼び出しで得た出力の扱いは、このサービス規約には書かれておらず、Alibaba Cloudの一般的な利用契約に委ねられています。「APIなら商用OK」と決めつけず、契約時の条件を確認してください。
  • サードパーティのKie.aiはページに「Commercial use」と表示していますが、Alibabaから商用ライセンスを受けているかどうかは書かれていません。
Qwen-Image-2.1を仕事に使えるかを経路別にまとめた表。公開ウェイトの研究・評価は使える、仕事・商用は要申請、趣味は定義なし、Model Studioの試用は評価のみ、有料APIは契約次第

仕事での利用が決まっているなら、公開ウェイトは商用ライセンスを申請してから使い、それまでは評価にとどめるのが安全です。ライセンスの心配が少ない有料の画像APIを比べるなら、GoogleのNano Banana 2.1の使い方と料金も選択肢になります。

無料で試せる場所:Hugging Face Space・ModelScope

インストールせずに試すなら、Hugging Faceの公式Spaceがいちばん手軽です。2026年10月7日時点ではZeroGPU(共有GPU)で動いており、1日に何枚まで使えるかは公開されていません。混雑すると順番待ちになることがあります。

ほかに無料で触れる場所は次のとおりです。

  • ModelScope:ダウンロードに加えて、オンライン生成やLoRA学習ができます。
  • Kie.ai:新規ユーザー向けの無料クレジットでプレイグラウンドを試せます。
  • Alibaba Cloud Model Studio:シンガポールリージョンではqwen-image-2.1-proに10枚(90日間有効)の無料枠があります。なお、コンソールの「試用」で作った画像は評価目的にしか使えません。

公式READMEが紹介しているwuli.artは中国本土のユーザー向けで、日本から使う前提のサービスではありません。どこで試しても、公開ウェイトのライセンスと同じく、評価の範囲で使うのが基本です。Qwen以外の無料ツールも含めて比べたい場合は、無料AI画像生成ツールおすすめ比較【2026年3月版】を参照してください(Qwen-Image-2.1の公開前の内容です)。

必要スペック:VRAM・メモリ別にどの量子化から始めるか

ローカルで動かすときの目安は、Unslothのガイドが最もまとまっています。いずれも「推定値で、検証済みの最小値ではない」と明記された出発点です。

手元のハードウェア最初の設定(Unslothの目安)
VRAM12〜16GBGGUF Q4_K_M、1024×1024、バッチ1
VRAM24GBINT8/FP8なら512×512、GGUF Q4_K_Mなら1024×1024
VRAM6GBFP8をオフロード付きで。速度は2倍弱遅くなる
CPUのみ(RAM12〜16GB)GGUF Q4_K_M、テキストエンコーダーはQ4_K_XL
Apple Silicon(ユニファイドメモリ12〜16GB以上)GGUF(対応するネイティブバックエンドで)

同じページの導入文には「GGUFならVRAM11GB、INT8/FP8なら24GBで動く」ともあります。表とあわせると、GGUFならVRAM11〜16GBあたりが出発点です。

量子化の種類による差も公開されています。INT8のファイルは7.26GBで元の画像との差(LPIPS平均)が0.064、FP8は7.12GBで0.112でした。サイズはほぼ同じで誤差はINT8のほうが小さいため、UnslothはINT8を標準にしています。FP8はVRAM24GB以上のGPU向けで、RAMに余裕があればオフロードしてもGGUFより速い場合がある、とも説明されています。

ComfyUIの公式テンプレートが読み込むのは、INT8版のqwen_image_2.1_int8_convrot.safetensorsです。テンプレートに必要なVRAMの目安は公開されていませんが、GIGAZINEはIntel Arc Pro B70(VRAM32GB)とRyzen 5 7600Xの環境で、1024×1024・25ステップの生成に初回約45秒、2回目以降約30秒かかったと報告しています。1台・1回の試用の数字なので、自分の環境の速さを測る参考程度にしてください。

メモリが足りないときは、次の順で試します。

  1. 解像度を1024×1024まで下げ、バッチを1にする
  2. より小さいGGUF(Q4_K_Mなど)に替える
  3. CPUオフロードを使う(システムメモリが必要で、速度は落ちる)
  4. GPUを使う他のアプリを閉じる

ステップ数を減らしても速くはなりますが、メモリ不足の解消にはつながりにくいとUnslothは注意しています。

Unsloth DesktopでGGUFを動かす:GUIで最短の1枚

コマンドに慣れていない場合は、GUIで操作できるUnsloth Desktopが手軽です。macOS・Windows・Linuxに対応しています。

  1. Unslothのガイドからアプリをダウンロードします。手動でインストールする場合は、macOS・Linux・WSLならcurl -fsSL https://unsloth.ai/install.sh | sh、Windows PowerShellならirm https://unsloth.ai/install.ps1 | iexです。
  2. サイドバーの「Images」を開き、モデル選択からQwen-Image-2.1のGGUFかFP8を選んでダウンロードします。
  3. プロンプトを入力して「Generate」を押します。初回はモデルの読み込みに時間がかかり、結果はギャラリーに保存されます。

推奨設定は、ステップ40、ガイダンス(CFG)1.0、ネガティブプロンプトは空欄、最初の解像度は1024×1024、比較用にシードを固定(例:42)です。画像サイズは32で割り切れる値にし、Unslothでは1辺2048ピクセルまでです。

なお、Unslothのページは「今回のリリースではテキストからの生成のみ対応」と書く一方で、編集タブの使い方も説明しており、記述が食い違っています。複数参照の編集や背景除去をしたい場合は、公式テンプレートがそろっているComfyUIを使うほうが確実です。

ComfyUIで最初の1枚を出す:ファイル配置と推奨設定

ComfyUIは公開当日からQwen-Image-2.1にネイティブ対応しています。手順はComfyUIの公式ドキュメントのとおりです。

  1. ComfyUIを最新版に更新します。テンプレートが見つからない、ノードが足りないという場合は、ComfyUIが古いか、新しいコアノードがまだ安定版に入っていない可能性があります(その場合はNightly版を使うか、次の安定版を待ちます)。
  2. テンプレートライブラリで「Qwen-Image-2.1」を検索し、テキストから画像を作るテンプレートを開きます。
  3. 「Models are missing」と表示されたら「Show details」を開き、「Download All」で必要なファイルをまとめて取得します。
  4. ダウンロード後にComfyUIを再起動するか画面を再読み込みし、プロンプトを入力して「Run」を押します。

GIGAZINEの試用ではこの流れで生成でき、プロンプトは日本語でも受け付けました。

必要なファイルと置き場所

手動で入れる場合は、Comfy-OrgのHugging Faceリポジトリから次のファイルを取得し、以下のフォルダーに置きます。テンプレートが読み込むのはメモリ消費の少ないINT8版で、bf16版は精度が高い代わりにより多くのメモリを使います。

text
ComfyUI/models/
├── diffusion_models/
│   └── qwen_image_2.1_int8_convrot.safetensors   (または qwen_image_2.1_bf16.safetensors)
├── text_encoders/
│   ├── qwen3vl_8b_int8_convrot.safetensors        (または qwen3vl_8b_bf16.safetensors)
│   ├── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors   ※任意
│   └── qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors   ※任意
└── vae/
    └── qwen_image_2.1_vae_bf16.safetensors

pe_t2iとpe_i2iは、短いプロンプトを詳しく書き直す「プロンプト強化」用のエンコーダーです。テンプレートではrefine_promptが既定でオフなので、使わないなら省略できます。中身はQwen3.5ベースの9Bモデルなので、オンにするとその分メモリを使います。

サンプラー設定:steps 25・cfg 1から1つずつ変える

テンプレートの既定値は、steps 25、cfg 1、サンプラーeuler、スケジューラーsimpleです。変えるときは1か所ずつ、シードを固定して比べます。

設定変えたときの変化(ComfyUIドキュメントより)
cfg 1既定。ネガティブプロンプトは計算されず、効かない
cfg 2細かい文字や数字への追従が良くなる一方、輪郭が硬くなる
cfg 5品質が大きく崩れる
cfg 0.5画像が壊れる
steps 4〜8服の色を変える程度の部分編集なら十分で、数倍速い
steps 30前後手や指など細部が落ち着く
steps 40細部のざらつきが減る。公式パイプラインは40〜50ステップ

ネガティブプロンプトを効かせたいときだけcfgを上げます。文字が指示どおりに出ない場合は、GIGAZINEの試用のようにシードを変えるだけで直ることもあります。

解像度:1024で試し、2Kは公式プリセットで

テキストからの生成では、Resolution Selectorノードで縦横比と画素数を指定します。1.0MPがおよそ1024×1024で、2048×2048の正方形を出すなら約4.0MPにします。公式の推奨サイズは次のとおりです。

縦横比推奨サイズ
1:12048×2048
4:3 / 3:42400×1792 / 1792×2400
3:2 / 2:32528×1696 / 1696×2528
16:9 / 9:162752×1536 / 1536×2752

学習時の解像度である2Kを大きく超える4Kなどを指定すると、プロンプトへの追従が落ちます。高解像度が必要な場合は、2Kで生成してから別の方法で拡大するほうが無難です。

透過PNGを出すプロンプト:公式の書式と背景除去

Qwenが推奨する透過画像用のプロンプトは、説明文を決まった英文で挟む書き方です(公式GitHub)。

text
This is an RGBA image with transparency. <作りたい画像の説明>. The image has alpha channel and the background is transparent.

たとえばThis is an RGBA image with transparency. A cute cartoon dragon sticker. The image has alpha channel and the background is transparent.のように使います。GIGAZINEの試用では、プロンプトに「透過PNG」と書くだけでも背景が完全に透過した画像が得られました。ただし1回の観察なので、確実に透過させたいときは公式の書式を使ってください。

透過できたかどうかは、GIMPなどアルファチャンネルを表示できるソフトで開いて確かめます。Webのプレビューやチャットアプリに貼り付けると、縮小や再圧縮で透明部分が塗りつぶされることがあり、元のファイルが透過していないように見えます。

既存の写真から背景を消したい場合は、ComfyUIの背景除去テンプレート(Remove Background)を使います。中身は編集テンプレートと同じで、Remove the background, and output a PNG imageという指示で背景を取り除き、元画像と並べて比較できます。

参照画像は最大10枚:ComfyUIの16スロットとの違い

公式にサポートされている参照画像は最大10枚です。ComfyUIの「Text Encode Qwen Image 2.1」ノードにはimage_1からimage_16まで16個の入力口がありますが、これはノードの仕様で、公式の対応枚数ではありません。ComfyUIの編集テンプレート自体も10枚分(image_1〜image_10)しか接続していません。

ComfyUIのText Encode Qwen Image 2.1ノードの入力口16個のうち、image_1が編集対象、image_2〜10が素材、image_11〜16が公式対応外の空きであることを色分けした図

編集では、image_1が「編集される画像」、2枚目以降が「素材」になります。プロンプトでは番号で呼び分けます。

text
Keep the character and pose in <image1> unchanged, put this light blue denim shirt from <image2> on the character, preserve the original facial features, hair, body shape and pose

一部分だけを変えたいときは、image_1を読み込むLoadImageノードを右クリックして「Open in Mask Editor」を開き、Paint Penで変えたい範囲に色を塗って保存します。プロンプトで「赤い部分のジャケットを変えて」のように印の色を指定すると、その範囲だけに指示が効きます。印の色が出力に残る場合は、仕上がりの色もプロンプトで指定します。

編集が遅いと感じたら、まず出力サイズを確認します。テンプレートの既定(resolutionが0)では、キャンバスはimage_1の画素数そのままになります。ComfyUIのドキュメントによると、3000×4000の写真は3008×4000(約12MP)で処理され、RTX 5090でも1ステップ約6秒かかります。resolutionを1024にすると約896×1184(約1MP)になり、1ステップ約0.3秒まで下がります。

複数参照の編集は、1回で狙いどおりになるとは限りません。GIGAZINEの試用でも、2枚を組み合わせる編集は成功率が低く、何度も生成して良いものを選ぶ必要がありました。前述のプロンプト強化をオンにすると、短い指示を詳しく書き直してくれます。

Python(Diffusers)で動かす:QwenImage21Pipelineの例

自分のスクリプトやサーバーに組み込む場合は、DiffusersのQwenImage21Pipelineを使います。必要なパッケージは公式READMEで次のように指定されています。

bash
pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers

以下は公式READMEの例をもとに、透過画像の書式とメモリ節約の設定を組み合わせたコードです。bf16の元の重みを読み込むので、Unslothの量子化版よりも多くのメモリを使います。

python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
# VRAMが足りない場合はCPUオフロード。余裕があれば pipe.to("cuda") に置き換える
pipe.enable_model_cpu_offload()

prompt = (
    "This is an RGBA image with transparency. "
    "A cute cartoon dragon sticker. "
    "The image has alpha channel and the background is transparent."
)

image = pipe(
    prompt=prompt,
    width=1024,
    height=1024,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("dragon_sticker.png")  # 透過で生成されればRGBAのPNGとして保存される

Diffusersの既定値は40ステップ・2048×2048です。最初は1024×1024で動作を確かめ、余裕があれば推奨サイズに上げます。編集する場合はimage=にPIL.Imageを渡し、複数参照ならリストで渡します。

まとまった枚数を処理するサーバーとして動かすなら、vLLM-Omni(vllm serve Qwen/Qwen-Image-2.1 --omniでOpenAI互換の/v1/images/generationsを提供)やSGLangも公開当日から対応しています。

API料金:qwen-image-2.1-proは1枚$0.04、東京リージョンは$0.035333

自前のGPUを用意せずにアプリへ組み込むなら、Alibaba Cloud Model Studioのqwen-image-2.1-proが公式のAPIです。テキストと画像を入力して画像を出力し、1枚単位で課金されます。料金ページの標準価格(2026年10月7日時点、キャンペーン価格を除く)は次のとおりです。

リージョン1枚あたり1,000枚あたり無料枠
シンガポール(International)$0.04$4010枚(シンガポールのみ、90日間有効)
東京・香港・フランクフルト・バージニア・北京(Global)$0.035333約$35.33なし

1,000枚あたりの金額は「枚数×単価」で計算しています(1,000×$0.04=$40、1,000×$0.035333≒$35.33)。生成に失敗した分は課金されませんが、品質に納得できず作り直した分は成功した生成として課金されます。税金は含みません。

使える量の上限は、QwenCloudのモデルページによると同時実行10、非同期キュー200件、毎分20リクエスト(RPM)です。毎分20件だと、1,000枚を出すには少なくとも1,000÷20=50分かかります。

「Pro」はAlibabaのクラウド版の名前で、公開ウェイトと同一のモデルかどうかは公表されていません。APIにはプロンプトを自動で書き直すprompt_extendパラメーターもあり、ローカルと同じプロンプトでも結果が一致するとは限りません。QwenCloudのページに載っている呼び出し例は次の形です。

bash
curl --location 'https://maas.qwencloudapi.com/api/v1/services/aigc/multimodal-generation/generation' \
  --header 'Content-Type: application/json' \
  --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
  --data '{
    "model": "qwen-image-2.1-pro",
    "input": {
      "messages": [
        {"role": "user", "content": [{"text": "A ceramic teapot on a wooden table"}]}
      ]
    },
    "parameters": {"prompt_extend": true}
  }'

エンドポイントとAPIキーは、契約したリージョンのコンソールに表示されるものを使ってください。

同じModel Studioの他のQwen画像モデルと比べると、シンガポールの単価はqwen-image-3.0が$0.03、qwen-image-2.0が$0.035、qwen-image-2.0-proが$0.075です。単価だけなら3.0のほうが安いので、2.1-proを選ぶのは、ローカルで評価した2.1と同じ名前の系統でそろえたい場合です。

サードパーティでは、Kie.aiが1K画像を4クレジット(約$0.02)、2K画像を8クレジット(約$0.04)で提供しています。1K中心なら1,000枚で約$20と公式より安くなりますが、前述のとおりAlibabaからのライセンス状況は書かれていないため、仕事に使う場合は事前に確認が必要です。

Qwen-Image-2.1がうまく動かないとき:症状別の対処

症状考えられる原因対処
テンプレートが見つからない、ノードが赤くなるComfyUIが古い最新版(必要ならNightly版)に更新する
「Models are missing」と出るモデルファイル未取得「Show details」→「Download All」、取得後に再起動
メモリ不足で止まる解像度・量子化が環境に対して大きい1024×1024、バッチ1、小さいGGUF、CPUオフロードの順に試す
ネガティブプロンプトが効かないcfg 1ではネガティブ側を計算しない必要なときだけcfgを上げる(2程度)
画像内の文字が指示と違うシードによるばらつきシードを変える、cfg 2を試す
編集が極端に遅いimage_1の画素数がそのままキャンバスになっているresolutionを1024にする
4Kで指示を無視する学習解像度(2K)を大きく超えている2Kで生成して後から拡大する
透過したはずが背景が白いプレビューやアプリが透明部分を塗りつぶしている元ファイルをGIMPなどで開いて確認する

Qwen-Image-2.1のよくある質問

Qwen-Image-2.1は無料で使えますか?

重みのダウンロードと、研究・評価目的でのローカル実行は無料です。仕事で使う場合は商用ライセンスの申請が必要です。APIは有料(1枚$0.035333〜$0.04)で、シンガポールリージョンに10枚の無料枠があります。

Qwen-Image-2.1は日本語のプロンプトに対応していますか?

GIGAZINEの試用では、ComfyUIで日本語のプロンプトをそのまま受け付けて画像を生成できました。ただし画像内に長い文字を入れる指示はシード次第で、一度で指示どおりにならないこともあります。透過画像の書式やComfyUIのドキュメントの例は英語なので、うまくいかない場合は英語で試すと比較しやすくなります。

Qwen-Image-3.0とQwen-Image-2.1はどちらを使えばいいですか?

自分の環境で動かしたいなら、重みが公開されているのは2.1だけです。APIで使うなら、シンガポールの単価は3.0が$0.03、2.1-proが$0.04で3.0のほうが安くなります。3.0は公式ベンチマークを出していないため、画質の優劣はサンプルを両方で作って比べるのが確実です。