Перейти к содержанию

Qwen-Image 2.1: как запустить локально и что запрещает лицензия

Попробовать модель можно в демо на Hugging Face, генерировать у себя — в ComfyUI. Для работы на клиентов исследовательская лицензия весов не подходит.

A
AI Free API Team
••13 мин чтения•Генерация изображений ИИ
Светлая обложка: заголовок «Qwen-Image 2.1 — как запустить» и три возрастающих изометрических блока на подставке с подписями «Демо», «ComfyUI» и «API»

Qwen-Image 2.1 — модель Alibaba для генерации и редактирования изображений. Её веса выложены 20 сентября 2026 года на Hugging Face и в репозитории на GitHub. Модель рисует картинки с прозрачным фоном, правит изображение по набору до 10 референсов и генерирует в нативном 2K. Скачать и запустить её можно бесплатно, но лицензия разрешает только исследования и оценку. Для работы на клиента, в магазине или внутри своего сервиса нужна отдельная коммерческая лицензия.

С чего начать, в зависимости от задачи:

  • Посмотреть, на что способна модель, — официальное демо на Hugging Face, ничего не устанавливая.
  • Генерировать у себя — ComfyUI со встроенными шаблонами. По оценке Unsloth, для старта хватает 12–16 ГБ видеопамяти с квантизацией GGUF Q4_K_M при 1024×1024.
  • Подключить генерацию к своему продукту — облачная модель qwen-image-2.1-pro в Alibaba Cloud Model Studio: $0,04 за картинку в Сингапуре и $0,035333 в остальных регионах по состоянию на 7 октября 2026 года. Платный API работает по договорам Alibaba Cloud, а не по исследовательской лицензии весов.

Что умеет Qwen-Image 2.1 и чем она отличается от 2.0 и 3.0

Qwen-Image 2.1 — одна модель на две задачи: генерация по тексту и редактирование по инструкции, без смены чекпойнта. Генерирующая часть — 7 млрд параметров (32 слоя single-stream DiT). Текст и картинки-условия кодирует Qwen3-VL 8B, а VAE работает с четырьмя каналами RGBA, поэтому прозрачный фон модель рисует сама, а не вырезает потом (архитектура в README).

В карточке модели заявлены:

  • обычные и прозрачные (RGBA) картинки из текста, правка прозрачных слоёв, вырезание объекта с фотографии;
  • до 10 референсных изображений в одном запросе;
  • локальные правки: нужную область можно обвести кружком, закрасить или передать отдельной маской;
  • сохранение внешности людей и вида товаров при правке;
  • нативное 2K: 2048×2048 для квадрата, 2400×1792 для 4:3, 2752×1536 для 16:9, 1536×2752 для 9:16.

Это заявления разработчика. Из сторонних данных есть рейтинг Artificial Analysis: в публикации начала октября 2026 года Qwen-Image 2.1 занимала 18-е место в обоих рейтингах — генерации по тексту (AA-Image-T2I v2.0) и редактирования (AA-Image-Editing v2.0) — и первое среди моделей с открытыми весами. Qwen-Image 2.0 в тех же рейтингах стояла на 72-м и 58-м местах. Рейтинги пересчитываются, так что это снимок на дату публикации. Сравнение Alibaba, где 2.1 обгоняет Nano Banana 2.0 и GPT-Image-1.5, взято из собственного графика компании.

Путаница с версиями объясняется тем, что серия то открывалась, то закрывалась:

ВерсияКогда вышлаВесаКак пользоваться (цены API — Сингапур)
Qwen-Imageавгуст 2025открыты, Apache 2.0локально
Qwen-Image 2.0февраль 2026закрытытолько API: $0,035, версия Pro — $0,075 за картинку
Qwen-Image 3.0июль 2026закрытытолько API: $0,03 за картинку
Qwen-Image 2.1сентябрь 2026открыты, исследовательская лицензиялокально; API qwen-image-2.1-pro — $0,04 за картинку

Даты выпуска — по обзорам GIGAZINE и Unite.AI, цены — по прайсу Alibaba Cloud на 7 октября 2026 года. Сказать, что 2.1 лучше 3.0 или наоборот, нельзя: для 3.0 Alibaba не опубликовала ни весов, ни бенчмарков. Практическая разница другая: 2.1 можно запустить на своём железе, 3.0 — только через облако.

Бесплатно ли Qwen-Image 2.1: что разрешает исследовательская лицензия

Платить за веса не нужно, но это не открытая лицензия в привычном смысле. Qwen Research License Agreement от 20 сентября 2026 года выдаёт права «только для некоммерческих целей», а некоммерческим называет использование «исключительно для исследований или оценки». Для коммерческого использования нужна отдельная лицензия, запрос отправляют на model-business@notice.qwencloud.com (текст лицензии). Первая Qwen-Image 2025 года выходила под Apache 2.0, поэтому привычка «Qwen можно брать в работу» к версии 2.1 не переносится.

Из той же лицензии следует ещё несколько вещей:

  • Квантованные сборки GGUF, FP8 и INT8 — это те же веса в другой форме, лицензия на них та же.
  • Тот, кто распространяет веса или производные от них, прикладывает текст соглашения и файл Notice с указанием авторских прав, а изменённые файлы помечает.
  • Если с помощью модели или её результатов обучена или улучшена другая модель и её выкладывают в общий доступ, в документации нужна пометка «Built with Qwen» или «Improved using Qwen».
  • Споры по лицензии разбираются по праву КНР в судах Ханчжоу.

Отдельный вопрос — права на сами картинки. 21 сентября 2026 года официальный аккаунт Qwen в X ответил пользователю, что результаты генерации не входят в лицензируемые материалы и права на сгенерированные изображения остаются у пользователя (ответ приводит GIGAZINE). Это ответ в соцсети, а не пункт лицензии. И он объясняет, кому принадлежат картинки, но не разрешает запускать модель ради заработка.

Как вы используете модельЧто из этого следует
Тестируете, сравниваете с другими моделями, пишете обзорИсследование или оценка — прямо разрешено лицензией
Рисуете для себя, без денег и клиентовВ определении лицензии такого случая нет: там названы только исследования и оценка
Делаете картинки для клиента, магазина, рекламыКоммерческое использование: нужна отдельная лицензия от Qwen
Встраиваете модель в свой сервис или продаёте доступКоммерческая лицензия плюс условия распространения из лицензии
Пробуете бесплатные генерации в консоли Model StudioТолько для оценки модели: без коммерции, без передачи третьим лицам, метки «AI-generated» удалять нельзя (условия Model Studio)
Вызываете платный API qwen-image-2.1-proДействуют договоры Alibaba Cloud, а не исследовательская лицензия весов; что они разрешают вашему проекту, сверьте с договором до запуска

Это пересказ условий, а не юридическая консультация. Если проект приносит деньги, надёжнее всего получить письменный ответ от Qwen на адрес из лицензии.

Какой путь выбрать для Qwen-Image 2.1: демо, локально или API

Выбор определяют три вещи: какое у вас железо, сколько картинок нужно в месяц и есть ли в работе коммерция.

Схема выбора: если проект коммерческий — коммерческая лицензия Qwen или платный API; если нет и есть GPU от 12 ГБ или Mac — локально в ComfyUI или Unsloth; иначе — онлайн-демо на Hugging Face
Ваша ситуацияПутьЧто учесть
Видеокарты нет, хочется посмотреть на модельДемо на Hugging Face (работает на ZeroGPU) или онлайн-генерация в ModelScopeКвота и очередь ZeroGPU не опубликованы. Бесплатный wuli.art, по README, рассчитан на пользователей из материкового Китая
Видеокарта NVIDIA на 12–24 ГБComfyUI со встроенными шаблонамиГенерация, редактирование и удаление фона в одном интерфейсе
Mac на Apple Silicon с 12–16 ГБ памяти и большеКвантованные GGUF-сборки UnslothНужен бэкенд с поддержкой GGUF; скорость Unsloth не приводит
Только процессор и 12–16 ГБ ОЗУGGUF Q4_K_M с текстовым энкодером Q4_K_XLРаботает по оценке Unsloth, скорость не указана
Нужны сотни картинок для продукта, своей GPU нетAPI qwen-image-2.1-pro$0,04 за картинку, не больше 20 запросов в минуту
Коммерческий проект на своём железеСначала коммерческая лицензия, потом любой локальный путьИсследовательская лицензия этот случай не покрывает

Если нужен просто бесплатный онлайн-генератор без установки и вопросов с лицензией весов, посмотрите подборку «Какой бесплатный ИИ-генератор изображений лучше в 2026 году?»: она написана до выхода 2.1, но сравнивает бесплатные лимиты других сервисов.

Сколько VRAM нужно для Qwen-Image 2.1: стартовые конфигурации Unsloth

В README Qwen требований к памяти нет. Ближе всего к ним таблица Unsloth, которая выпустила квантованные сборки. Сама Unsloth называет эти цифры оценками, а не проверенными минимумами: расход памяти зависит от разрешения и настроек выгрузки.

Ваше железоС чего начать
6 ГБ видеопамятиFP8 с выгрузкой (оффлоадом) в ОЗУ; генерация медленнее, но, по Unsloth, не больше чем вдвое
12–16 ГБ видеопамятиGGUF Q4_K_M, 1024×1024, по одной картинке
24 ГБ видеопамятиINT8 или FP8 при 512×512, либо GGUF Q4_K_M при 1024×1024
Только процессор, 12–16 ГБ ОЗУGGUF Q4_K_M с текстовым энкодером Q4_K_XL
Apple Silicon, 12–16 ГБ объединённой памяти (unified memory) и большеGGUF с совместимым нативным бэкендом

В вводной части той же страницы указано, что модель запускается на 11 ГБ видеопамяти с GGUF и на 24 ГБ с INT8/FP8. Между INT8 и FP8 Unsloth выбирает INT8: файл весит 7,26 ГБ против 7,12 ГБ, а средняя ошибка LPIPS ниже — 0,064 против 0,112 (чем меньше, тем ближе к полной точности). Размеры картинки должны делиться на 32; в Unsloth допускается до 2048 пикселей по стороне. Начните с 1024×1024 и поднимайте разрешение, пока хватает памяти. Уменьшение числа шагов ускоряет генерацию, но память не освобождает.

Две точки отсчёта по скорости, обе сторонние:

  • GIGAZINE запускала модель в ComfyUI на Intel Arc Pro B70 с 32 ГБ и Ryzen 5 7600X: при 1024×1024 и 25 шагах первая картинка заняла около 45 секунд, следующие — около 30. Это одна машина и один тестер.
  • В документации ComfyUI правка на холсте около 12 Мп на RTX 5090 идёт примерно 6 секунд на итерацию, а на холсте около 1 Мп — около 0,3 секунды.

Учтите и дополнительный расход: модели переписывания промпта (Qwen-Image-2.1-PE-T2I и PE-I2I) — это отдельные модели на 9 млрд параметров, и с включённым улучшением промпта памяти понадобится больше.

Если Unsloth вам удобнее ComfyUI, порядок такой: в Unsloth Desktop (macOS, Windows, Linux) откройте Images, выберите GGUF- или FP8-сборку Qwen-Image-2.1 и генерируйте с рекомендованными настройками: 40 шагов, guidance 1.0, пустой негативный промпт, 1024×1024. Сама Unsloth пишет, что модель доступна у неё только для генерации по тексту, но ниже на той же странице показывает вкладку Edit. Для редактирования надёжнее ComfyUI. Тот же подход к расчёту памяти для языковой модели разобран в статье «Как запустить Qwen3.8-Flash-Next локально через Unsloth и не ошибиться с памятью».

Установка Qwen-Image 2.1 в ComfyUI: шаблоны и файлы моделей

ComfyUI поддерживает модель штатно, без сторонних нод. Порядок такой:

  1. Обновите ComfyUI. Если шаблонов Qwen-Image 2.1 в библиотеке нет, версия устарела; если при загрузке воркфлоу не хватает нод, нужна свежая nightly-сборка.
  2. Откройте библиотеку шаблонов и найдите «Qwen-Image-2.1». Шаблонов три: Text to Image, Image Edit и Remove Background (удаление фона).
  3. При первом открытии ComfyUI сообщит, что моделей не хватает. Нажмите Show details, затем Download All.
  4. Перезапустите ComfyUI или обновите страницу, впишите промпт и нажмите Run.

Если скачиваете файлы вручную, они лежат в репозитории Comfy-Org и раскладываются так:

text
ComfyUI/models/
├── diffusion_models/
│   ├── qwen_image_2.1_int8_convrot.safetensors   # грузят шаблоны, меньше памяти
│   └── qwen_image_2.1_bf16.safetensors           # полная точность, больше памяти
├── text_encoders/
│   ├── qwen3vl_8b_int8_convrot.safetensors       # грузят шаблоны
│   ├── qwen3vl_8b_bf16.safetensors
│   ├── qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors   # улучшение промпта, по желанию
│   └── qwen3.5_9b_qwen_image_2.1_pe_i2i.int8_convrot.safetensors   # то же для правки
└── vae/
    └── qwen_image_2.1_vae_bf16.safetensors

Для первого запуска хватит трёх файлов: диффузионной модели INT8, текстового энкодера INT8 и VAE. Энкодеры для улучшения промпта нужны, только если включить refine_prompt — по умолчанию он выключен.

Первый запуск в ComfyUI: 25 шагов, cfg 1 и 4 Мп для 2K

Шаблоны уже настроены на рабочие значения: 25 шагов, cfg 1, сэмплер euler, планировщик simple. Менять стоит по одному параметру при фиксированном seed. Что из этого следует на практике (документация ComfyUI):

  • Негативный промпт при cfg 1 не работает: ComfyUI пропускает этот проход. Он начинает действовать, только если поднять cfg.
  • Плотный текст и цифры точнее при cfg 2, ценой пересвеченных краёв. При cfg 5 качество сильно падает, при cfg 0,5 изображение разваливается.
  • Шаги: официальный пайплайн Qwen рассчитан примерно на 40–50 шагов, шаблон начинает с 25. Простые локальные правки держатся и на 4–8 шагах, руки и пальцы устаканиваются примерно к 30 шагам, а переход с 25 на 40 убирает рябь в мелких деталях.
  • Разрешение: в ноде Resolution Selector 1,0 Мп — это примерно 1024×1024. Для нативного квадрата 2048×2048 поставьте около 4,0 Мп. Выше 2K, например в 4K, модель хуже следует промпту.
  • Надпись не получилась — смените seed. В тесте GIGAZINE текст газетного заголовка с первого seed не вышел, а со следующего лёг правильно.

О русских промптах в официальных материалах ничего не сказано; японские в тесте GIGAZINE модель понимала. Если русская формулировка срабатывает плохо, попробуйте ту же мысль по-английски — все примеры в документации на английском.

Прозрачный PNG в Qwen-Image 2.1: формат промпта и проверка альфа-канала

Qwen рекомендует оборачивать описание в фиксированные фразы (README, раздел про прозрачность):

text
This is an RGBA image with transparency. <ваше описание>. The image has alpha channel and the background is transparent.

Например: This is an RGBA image with transparency. A cute cartoon dragon sticker. The image has alpha channel and the background is transparent.

В тесте GIGAZINE хватило просто написать в промпте «transparent PNG», и фон тоже вышел полностью прозрачным. Это одна проверка; официальная формулировка надёжнее.

Проверяйте результат в редакторе с поддержкой альфа-канала — GIMP, Krita, Photoshop: прозрачные участки там видны как шахматная сетка. Превью в браузере и мессенджеры часто подставляют сплошной фон, и кажется, что прозрачности нет, хотя в файле она есть. В Diffusers картинка сохраняется в RGBA, если модель сгенерировала прозрачность.

Чтобы убрать фон с готовой фотографии, есть отдельный шаблон Remove Background. Он использует ту же модель правки с промптом Remove the background, and output a PNG image.

Редактирование по референсам: 10 картинок, а не 16 слотов

Официально модель принимает до 10 референсных изображений. Нода Text Encode Qwen Image 2.1 в ComfyUI показывает 16 слотов (от image_1 до image_16), но шаблоны правки подключают только первые 10. Шестнадцать — это число входов ноды, а не заявленная возможность модели, поэтому рассчитывайте на 10 (документация ComfyUI).

Как устроена правка:

  • image_1 — та картинка, которую вы меняете, остальные дают материал. В промпте на них ссылаются по номеру: <image1>, <image2> и так далее. Пример из документации: Keep the character and pose in <image1> unchanged, put this light blue denim shirt from <image2> on the character, preserve the original facial features, hair, body shape and pose.
  • Размер холста берётся от image_1. При resolution 0 (так в шаблоне) фото 3000×4000 даёт холст 3008×4000, около 12 Мп, и правка идёт медленно. При resolution 1024 тот же кадр считается примерно в 896×1184. Если правка тормозит, сначала проверьте resolution и размер референсов.
  • Локальная правка: откройте Mask Editor на ноде LoadImage с image_1, закрасьте область инструментом Paint Pen и сохраните. В промпте назовите цвет метки, например «change the jacket in the red area». Метка должна лежать внутри области, которую вы меняете.
  • Память: нода Qwen Image 2.1 Cache хранит закешированный префикс. В режиме cpu кеш лежит в ОЗУ и почти не замедляет работу, int8 вдвое уменьшает его размер.

Ждать идеального кадра с первой попытки не стоит: в тесте GIGAZINE сложная правка по двум картинкам удавалась редко, и подходящий результат пришлось выбирать из многих генераций.

Запуск через Diffusers и vLLM-Omni: код с выгрузкой в ОЗУ

Для своего скрипта или сервера есть официальный пайплайн QwenImage21Pipeline в Diffusers. Код ниже собран из примеров README: он генерирует прозрачный стикер 1024×1024 и при нехватке видеопамяти выгружает части модели в ОЗУ. Скачиваются полные веса bf16, а не квантованные, поэтому для выгрузки нужен запас оперативной памяти.

bash
pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
pip install git+https://github.com/huggingface/diffusers
python
import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()  # если видеопамяти хватает, вместо этого: pipe.to("cuda")

image = pipe(
    prompt=(
        "This is an RGBA image with transparency. "
        "A red fox mascot sticker, flat vector style. "
        "The image has alpha channel and the background is transparent."
    ),
    width=1024,
    height=1024,
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("fox_sticker.png")

По умолчанию пайплайн генерирует 2048×2048 за 40 шагов. Для правки передайте исходник в image=, для нескольких референсов — список картинок.

Если нужен локальный HTTP-сервер, vLLM-Omni поднимает его одной командой и отдаёт эндпоинт /v1/images/generations в стиле OpenAI:

bash
vllm serve Qwen/Qwen-Image-2.1 --omni --port 8091

curl http://localhost:8091/v1/images/generations \
  -H "Content-Type: application/json" \
  -d '{"model": "Qwen/Qwen-Image-2.1", "prompt": "A ceramic teapot on a wooden table", "size": "1024x1024", "num_inference_steps": 40, "seed": 42}'

Ещё в README есть варианты для SGLang (sglang generate), LightX2V, видеокарт AMD через ROCm и чипов через FlagOS. Лицензия от способа запуска не зависит: сервер, который отдаёт картинки клиентам, — коммерческое использование.

Цена API Qwen-Image 2.1: $0,04 за картинку, 1 000 картинок — $40

В Alibaba Cloud Model Studio модель продаётся как qwen-image-2.1-pro: на входе текст и картинки, на выходе изображение. Совпадает ли она байт в байт с открытыми весами, Alibaba не пишет. Описание у неё то же (7 млрд параметров, 32 слоя), но в названии стоит Pro, а в запросе есть параметр prompt_extend для автоматического расширения промпта. Поэтому считайте её облачной версией 2.1, а не гарантированно теми же файлами, что лежат на Hugging Face.

РегионЦена за картинкуБесплатно
Сингапур$0,0410 картинок на 90 дней (только в этом регионе)
Пекин, Гонконг, Франкфурт, Вирджиния, Токио$0,035333нет

Цены — по прайсу Alibaba Cloud на 7 октября 2026 года, это базовые тарифы без акций. Неудачные генерации не тарифицируются. Лимиты на странице модели в QwenCloud: 20 запросов в минуту, 10 параллельных задач, очередь асинхронных задач до 200.

Расчёт простой — число картинок × цена:

  • 100 картинок: 100 × $0,04 = $4 в Сингапуре или 100 × $0,035333 ≈ $3,53 в других регионах;
  • 1 000 картинок: 1 000 × $0,04 = $40 или 1 000 × $0,035333 ≈ $35,33;
  • если для одного годного кадра в среднем нужны три попытки (это допущение для примера), 1 000 годных картинок обойдутся в 3 000 × $0,04 = $120.
Расчёт стоимости 1 000 картинок: Сингапур 1 000 × $0,04 = $40, другие регионы Alibaba Cloud ≈ $35,33, Kie.ai при 1K ≈ $20, пример с тремя попытками на кадр — $120

Налоги в расчёт не входят. Для сравнения: закрытая qwen-image-3.0 стоит $0,03 за картинку, то есть $30 за 1 000, но её веса скачать нельзя.

Минимальный запрос из документации QwenCloud выглядит так (ключ в переменной DASHSCOPE_API_KEY):

bash
curl --location 'https://maas.qwencloudapi.com/api/v1/services/aigc/multimodal-generation/generation' \
  --header 'Content-Type: application/json' \
  --header "Authorization: Bearer $DASHSCOPE_API_KEY" \
  --data '{
    "model": "qwen-image-2.1-pro",
    "input": {"messages": [{"role": "user", "content": [{"text": "A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night"}]}]},
    "parameters": {"prompt_extend": true}
  }'

Сторонний вариант — Kie.ai: 4 кредита (около $0,02) за картинку 1K и 8 кредитов (около $0,04) за 2K, то есть примерно $20 или $40 за 1 000 штук; новым пользователям дают бесплатные кредиты. Есть ли у Kie коммерческая лицензия Alibaba на эту модель, на странице не сказано.

Прежде чем закладывать API в бюджет, проверьте, что сможете подключить способ оплаты к аккаунту Alibaba Cloud или Kie, и прочитайте их договоры в части прав на результаты. Если рассматриваете закрытую модель Google вместо Qwen, цены и условия разобраны в статье «Nano Banana 2.1: чем отличается, цена и переход до 29 октября».

Вопросы о Qwen-Image 2.1: продажа картинок, Mac и негативный промпт

Можно ли продавать картинки, сделанные в Qwen-Image 2.1?

Официальный аккаунт Qwen в X написал, что права на сгенерированные изображения остаются у пользователя. Но лицензия весов разрешает только исследования и оценку, поэтому генерация на продажу — это коммерческое использование модели. Для неё нужна отдельная лицензия от Qwen или платный API, условия которого вы сверили со своим проектом.

Запустится ли Qwen-Image 2.1 на Mac?

По оценке Unsloth — да, на Apple Silicon с 12–16 ГБ объединённой памяти и больше, через GGUF-сборки и бэкенд с их поддержкой. Скорость на Mac в документации Unsloth и в README Qwen не указана.

Почему в Qwen-Image 2.1 не работает негативный промпт?

В шаблонах ComfyUI стоит cfg 1, а при таком значении ComfyUI пропускает проход с негативным промптом. Чтобы он заработал, поднимите cfg, например до 2, и сравните результат на том же seed.