A 26 de agosto de 2026, preguntar cuál es el mejor modelo de imagen sin definir el trabajo conduce a una respuesta falsa. Un flujo automatizado de catálogo necesita un identificador estable, edición precisa, latencia predecible y un contrato de respuesta. Una dirección de arte manual valora más la composición y la iteración. Un despliegue privado añade licencias, VRAM, colas y mantenimiento.
Empieza con una lista corta, no con un campeón:
| Trabajo prioritario | Primera ruta que probar | Por qué entra | Límite que debes verificar |
|---|---|---|---|
| Generación y edición por API | GPT Image 2 + Gemini 3.1 Flash Image | Ambos tienen rutas directas actuales para generar y editar | Contrato del endpoint, coste de referencias, límites y formato de salida |
| Acabado de alto valor en Google | Gemini 3 Pro Image | Es el nivel orientado a resultados complejos y 4K | 1K/2K y 4K tienen precios distintos |
| Exploración humana de estilo y composición | Midjourney V8.2 | La versión actual se centra en estética y personalización | La suscripción compra tiempo de GPU, no una tarifa API normal por imagen |
| Pesos abiertos, ejecución local o control fino | La variante FLUX.2 adecuada | La familia cubre rutas rápidas, controlables y premium | Licencia, VRAM, arranque en frío y operaciones cambian por variante |
| Carteles, gráficos y diseño con mucha información | Seedream 5.0 Pro | ByteDance destaca diseño, texto y visualización densa | Acceso, precio y producto dependen de la región |
| Creatividad web centrada en tipografía | Ideogram 3.0 | La documentación oficial aún lo identifica como versión más reciente | No adoptes un nombre posterior sin confirmación primaria |
La tabla solo decide qué merece una prueba. No demuestra qué modelo ganará en tu caso.

Modelo, producto, API y proveedor no son sinónimos
Guarda cuatro campos junto a cada resultado: model ID o instantánea, producto utilizado, API directa o vía de tercero, y plan facturado. La misma familia puede comportarse de forma diferente según la superficie.
Una suscripción de la aplicación Gemini no describe el precio de Gemini Developer API. Usar un modelo dentro de ChatGPT no demuestra que exista nivel gratuito en la API. Midjourney se evalúa como producto Web/Discord con tiempo de GPU, no como una fila equivalente a un endpoint directo estable. Sin esta información, una comparativa no se puede reproducir.
Los nombres vigentes que deben estar en la hoja de prueba
OpenAI: GPT Image 2
OpenAI presenta gpt-image-2 como su modelo insignia actual para generar y editar imágenes. La página incluye el alias móvil gpt-image-2, la instantánea fija gpt-image-2-2026-04-21 y endpoints Images de generación y edición.
Usa la instantánea si necesitas reproducir un flujo aprobado durante más tiempo. Usa el alias si prefieres recibir mejoras y puedes repetir la validación. Images y la herramienta de imagen de Responses pueden compartir modelo, pero sus entradas, eventos y campos de respuesta siguen siendo contratos distintos.
Google: Flash Lite, Flash y Pro
La línea estable actual incluye:
gemini-3.1-flash-lite-image, para bajo coste, baja latencia y volumen;gemini-3.1-flash-image(Nano Banana 2), para generación principal y edición conversacional;gemini-3-pro-image(Nano Banana Pro), para entregables de alto valor y control complejo.
La guía oficial de generación documenta para Flash Image salidas de 0,5K, 1K, 2K y 4K, Search grounding y flujos con referencias. Los límites de imágenes, objetos y personas no son idénticos entre los tres niveles.
Además, la tabla de deprecaciones marca los ID preview de imagen como cerrados el 25 de junio de 2026 y orienta los antiguos ID de Imagen 4 API hacia gemini-3.1-flash-image. No inicies una integración nueva copiando -preview de un tutorial antiguo.
Midjourney: V8.2 es la versión predeterminada
La documentación de versiones indica que V8.2 pasó a ser predeterminada el 24 de julio de 2026. V8.1/V8.2 permiten generación 2K HD y el producto ofrece personalización, Draft y edición. Una edición HD puede volver a SD antes de aplicar upscale.
La explicación de tiempo de GPU estima unos 0,8 minutos de GPU para un prompt SD de cuatro imágenes y 1,3 para HD. Variaciones, upscale, Fast/Relax y tiempo humano cambian el coste efectivo.
FLUX.2: primero variante y licencia
Black Forest Labs recomienda la familia FLUX.2, formada por [klein], [pro], [flex], [max] y [dev]. Cambian velocidad, referencias, parámetros, grounding, despliegue y licencia.
Decir simplemente «FLUX.2 es open source» no basta para una decisión comercial. Los pesos descargables de klein 4B, klein 9B y dev no comparten necesariamente las mismas condiciones. En una prueba local mide licencia, VRAM máxima, carga del modelo, colas, observabilidad, actualizaciones y tiempo de ingeniería.
Seedream 5.0 e Ideogram 3.0
ByteDance anunció Seedream 5.0 Pro el 8 de julio de 2026 y destaca alineación entre imagen y texto, estructura, renderizado de texto y visualización de información densa. Seedream 5.0 Lite es un modelo menor que reúne razonamiento, búsqueda opcional, edición y referencias. El propio proveedor reconoce margen de mejora en estructura, realismo y estética. Son motivos para probar, no una prueba independiente de superioridad.
La página oficial de Ideogram sigue llamando a 3.0 su modelo más reciente. Hasta que cambie esa fuente, «Ideogram 4» no debe entrar en una matriz de producción.
Cuatro formas de cobrar no caben en una sola columna
- OpenAI publica para GPT Image 2 estándar: 5 $/millón de tokens de texto de entrada, 8 $/millón de imagen de entrada, 2 $/millón de imagen en caché y 30 $/millón de imagen de salida.
- Google da equivalentes: Flash Lite 1K a 0,0336 $; Flash Image 0,5K/1K/2K/4K a 0,045/0,067/0,101/0,151 $; Pro 1K/2K a 0,134 $ y 4K a 0,24 $. Entrada, thinking y grounding pueden sumar coste.
- BFL parte de 0,014 $/imagen para FLUX.2 klein 4B, 0,03 $/MP para pro, 0,06 $/MP para flex y 0,07 $/MP para max.
- Midjourney vende tiempo de GPU dentro de una suscripción.
Normaliza con esta fórmula:
coste por imagen aceptada = coste de todas las generaciones y ediciones / imágenes que superan la aceptación
Añade referencias de entrada, reintentos, minutos de retoque, fallos y espera en cola.
Una prueba justa con texto en español
Selecciona 12–20 trabajos próximos: tus sujetos principales, una composición con español exacto, cifras, nombre de marca y letra pequeña, una edición local que conserve todo lo demás, varias referencias, proporciones reales y resolución final.
Ejecuta cada candidato al menos tres veces con condiciones equivalentes y puntúa la mediana, no la mejor imagen. Registra aceptación al primer intento, errores tipográficos, conservación de edición, fidelidad de referencias, reintentos medios, latencia P50/P95, tipos de fallo y coste por imagen aceptada.
Para API comprueba aparte ID estable, límites, retry, política de contenidos, MIME y campos de respuesta. Para local, licencia, arranque en frío, VRAM, throughput y horas de operación.

Decisión final: un modelo por defecto y una reserva
Para generación y edición programables, prueba GPT Image 2 y Gemini 3.1 Flash Image en paralelo. Añade Gemini 3 Pro Image para finales de alto valor en Google, Midjourney V8.2 cuando una persona dirija la estética y una variante concreta de FLUX.2 cuando manden el despliegue y la licencia. Seedream 5.0 Pro merece una prueba con diseños densos y texto chino; Ideogram 3.0, con tipografía.
Elige un modelo por defecto y una reserva a partir de tus datos. Cuando cambie una versión o un precio, repite la misma batería. Ese proceso envejece mejor que cualquier etiqueta de «mejor generador de 2026».



