На 26 августа 2026 года вопрос «какая модель изображений лучшая» не имеет честного ответа без описания задачи. Для автоматизированного каталога важны стабильный идентификатор, точное редактирование, задержка и формат ответа. Для арт-директора — композиция, вариативность и удобство ручной итерации. Для закрытого контура — лицензия, открытые веса, VRAM и обслуживание.
Быстрый ориентир выглядит так:
| Задача | Что проверить первым | Почему | Что уточнить заранее |
|---|---|---|---|
| API-генерация и точные правки | GPT Image 2 + Gemini 3.1 Flash Image | Обе модели имеют актуальные прямые маршруты генерации и редактирования | Контракт эндпоинта, цена референсов, лимиты и формат ответа |
| Качественный финал в экосистеме Google | Gemini 3 Pro Image | Старшая модель линейки для сложного контроля и 4K | 1K/2K и 4K оплачиваются по-разному |
| Ручной поиск стиля и композиции | Midjourney V8.2 | Текущая версия продукта ориентирована на эстетику и персонализацию | Подписка и GPU-время нельзя считать обычной ценой API за файл |
| Открытые веса или локальный запуск | Нужный вариант FLUX.2 | В семействе есть быстрые, управляемые и премиальные маршруты | Лицензия, память GPU, холодный старт и сопровождение |
| Плакаты, схемы и плотный текст | Seedream 5.0 Pro | ByteDance заявляет усиление дизайна, текста и информационной графики | Доступ и цена зависят от региона и продукта |
| Типографика в веб-креативах | Ideogram 3.0 | Официальная документация по-прежнему называет 3.0 последней моделью | Не переносить неподтверждённое название новой версии из обзоров |
Это не рейтинг качества, а список кандидатов для первого теста.

Модель, приложение и API — разные вещи
Записывайте рядом с каждым результатом четыре поля: точный model ID, продукт или интерфейс, прямой либо сторонний API и тариф. Одинаковое имя модели не гарантирует одинаковые лимиты, политику, доступность и формат ответа.
Подписка на приложение Gemini не описывает цену Gemini Developer API. Наличие модели в ChatGPT не означает бесплатный API. Midjourney — прежде всего продукт с веб-интерфейсом/Discord и подписочным GPU-временем, а не стабильная строка прямого API. Если этот контекст потерять, сравнение нельзя будет повторить.
Актуальные версии, которые стоит занести в тест
OpenAI: gpt-image-2 и фиксированный снимок
OpenAI называет gpt-image-2 текущей флагманской моделью генерации и редактирования. Документация указывает движущийся alias gpt-image-2 и снимок gpt-image-2-2026-04-21, а также эндпоинты Images для генерации и правок.
Снимок удобнее, если нужно воспроизводить согласованный производственный процесс. Alias проще поддерживать, но после обновления его следует заново прогнать через приёмочные тесты. Images и инструмент изображений в Responses могут использовать одну модель, но их запросы, потоковые события и ответы всё равно проверяются отдельно.
Google: Flash Lite, Flash и Pro
Стабильная линейка Google сейчас состоит из:
gemini-3.1-flash-lite-image— низкая задержка, цена и высокая пропускная способность;gemini-3.1-flash-image(Nano Banana 2) — основная генерация и диалоговое редактирование;gemini-3-pro-image(Nano Banana Pro) — дорогие финальные материалы и сложное управление.
В официальном руководстве по генерации для Flash Image указаны 0.5K, 1K, 2K и 4K, Search grounding и работа с референсами. Лимиты на изображения, объекты и персонажей у трёх моделей различаются.
Старые учебники особенно опасны: в таблице прекращения поддержки preview-ID изображений закрыты 25 июня 2026 года, а для выведенных из эксплуатации Imagen 4 API указан переход на gemini-3.1-flash-image. Новую интеграцию не следует начинать с -preview.
Midjourney: версия V8.2 по умолчанию
Документация версий сообщает, что V8.2 стала версией по умолчанию 24 июля 2026 года. V8.1/V8.2 поддерживают генерацию 2K HD, а продукт включает персонализацию, черновики и редактирование. Правка HD может выполняться в SD с последующим upscale.
Официальная справка по GPU-времени оценивает один SD-промпт с четырьмя изображениями примерно в 0,8 GPU-минуты, HD — в 1,3. Варианты, upscale, Fast/Relax и время автора меняют реальную стоимость результата.
FLUX.2: сначала вариант и лицензия
Black Forest Labs рекомендует семейство FLUX.2: [klein], [pro], [flex], [max] и [dev]. Они отличаются скоростью, числом референсов, параметрами управления, grounding, способом запуска и лицензией.
Фраза «FLUX.2 — open source» недостаточна для коммерческого решения. Возможность скачать веса не делает условия 4B klein, 9B klein и dev одинаковыми. При локальном тесте учитывайте не только качество, но и VRAM, загрузку модели, очередь, обновления, наблюдаемость и стоимость инженеров.
Seedream 5.0 и Ideogram 3.0
ByteDance представила Seedream 5.0 Pro 8 июля 2026 года, заявив улучшения в соответствии изображения тексту, структуре, рендеринге надписей и плотной визуализации данных. Seedream 5.0 Lite — меньшая единая модель с рассуждением, опциональным поиском, правками и референсами; сам поставщик отмечает запас для улучшения структуры, реализма и эстетики. Это основания для теста, а не независимое доказательство превосходства.
Официальная страница моделей Ideogram всё ещё называет Ideogram 3.0 последней. До первичного подтверждения не стоит включать «Ideogram 4» в производственную карту.
Как сравнить цену без ложной точности
У поставщиков разные единицы:
- OpenAI берёт $5/млн текстовых входных токенов, $8/млн токенов входных изображений, $2/млн кэшированных токенов изображений и $30/млн выходных токенов изображения для стандартного GPT Image 2.
- Google публикует эквиваленты за файл: Flash Lite 1K — $0,0336; Flash Image 0.5K/1K/2K/4K — $0,045/$0,067/$0,101/$0,151; Pro 1K/2K — $0,134, 4K — $0,24. Вход, thinking и grounding могут оплачиваться отдельно.
- BFL указывает старт $0,014 за изображение для klein 4B, $0,03/MP для pro, $0,06/MP для flex и $0,07/MP для max.
- Midjourney продаёт GPU-время в подписке.
Поэтому считайте не минимальную цифру на лендинге, а:
стоимость принятого изображения = все запросы генерации и правок / число изображений, прошедших приёмку
Добавьте количество повторов, цену референсов, ручные минуты, ошибки и ожидание в очереди.
Тест, который учитывает кириллицу
Возьмите 12–20 реальных задач ближайшего проекта. Включите основной тип сцен, макет с точной кириллицей, цифрами и мелким шрифтом, локальную правку с сохранением всего остального, несколько референсов, требуемые пропорции и финальное разрешение.
Каждую модель запускайте не менее трёх раз при одинаковых доступных настройках. Оценивайте медианный результат, а не лучшую картинку. Записывайте процент приёмки с первой попытки, ошибки текста, сохранение правок и референсов, среднее число повторов, P50/P95 задержки, типы сбоев и полную стоимость принятого изображения.
Для API отдельно проверьте стабильный ID, rate limits, retry, контентную политику, MIME и поля ответа. Для локального маршрута — холодный старт, пиковую VRAM, throughput, лицензию и время сопровождения.

Итоговый выбор
Для общего программного процесса начните с параллельного теста GPT Image 2 и Gemini 3.1 Flash Image. Добавьте Gemini 3 Pro Image для дорогого финального материала в Google-стеке. Midjourney V8.2 берите в shortlist, когда человеком управляется эстетический поиск. Для локального запуска выбирайте конкретный FLUX.2 вместе с его лицензией. Seedream 5.0 Pro полезно проверить на плотных макетах и китайском тексте, Ideogram 3.0 — на типографике.
Дефолт и резервную модель выбирайте по своим данным. Версии изменятся, но набор реальных задач, точная запись поверхности доступа и стоимость принятого изображения останутся рабочим способом сравнения.



