AIFreeAPI Logo

Grok Image 2, Gemini 3 Image o GPT Image 2: qué probar primero

A
9 min readGeneración de imágenes con IA

No hay un ganador universal: descarta primero la ruta que no cumple tus requisitos y compara después el coste por imagen que realmente aceptarías.

Tres rutas de generación de imágenes convergen en una mesa de evaluación

Antes de comparar Grok, Gemini y GPT conviene identificar las rutas reales. Las API actuales usan grok-imagine-image-2.0, gemini-3-pro-image y gpt-image-2. «Grok Image 2» y «Gemini 3 Image» son abreviaturas habituales, pero no son identificadores que debas copiar a una petición.

La elección tampoco se reduce a tres imágenes bonitas. Cada proveedor separa de manera distinta la aplicación de consumo, la API directa y las herramientas de imagen dentro de una conversación. Cambian los controles, el precio, la forma de editar y hasta qué modelo se coloca en el campo model. La pregunta útil es: ¿qué ruta merece tu primera prueba para este trabajo concreto?

La respuesta corta es condicional. Empieza por xAI si necesitas un contrato directo sencillo de 1K o 2K cuyo precio por salida sea fácil de presupuestar. Empieza por Google si el trabajo exige 4K, muchas referencias cualificadas o grounding con Google Search. Empieza por OpenAI si necesitas máscaras, tamaños flexibles, Batch o si la imagen ya forma parte de una arquitectura OpenAI. Son razones para ordenar una prueba, no resultados de una comparativa de calidad.

Primero identifica el producto que vas a pagar

Nombre que suele ver el lectorIdentidad de API directaNo debe confundirse con
Grok Imagine Image 2.0 / Quality Modegrok-imagine-image-2.0la experiencia y la cuota de la aplicación Grok
Gemini 3 Pro Image / Nano Banana Progemini-3-pro-imageGemini app, Google AI Studio o el antiguo ID preview
GPT Image 2gpt-image-2ChatGPT Images 2.0 o el modelo principal de una petición Responses

xAI documenta la generación mediante Images API y un endpoint separado para edición. También ofrece una herramienta image_generation en Responses, pero esa superficie no expone exactamente los mismos controles explícitos de tamaño y formato. La ficha oficial de Grok Imagine Image 2.0 es el punto de partida para el ID y sus capacidades.

Google mantiene gemini-3-pro-image como ID estable. El anterior gemini-3-pro-image-preview ya cerró en Developer API, de modo que conservarlo en código o tutoriales antiguos provoca una comparación de disponibilidad equivocada. La ficha del modelo de Google y su guía de generación de imágenes describen la ruta de desarrollador; no definen las cuotas de la aplicación Gemini.

OpenAI separa la Images API de la herramienta de generación dentro de Responses. En la primera puedes usar gpt-image-2 directamente. En Responses se elige un modelo principal compatible y se invoca la herramienta de imagen; por tanto, también se factura el trabajo del modelo principal. La guía oficial de Image Generation explica ambas rutas. Si tu objetivo es implementar la API directa, continúa con la guía específica de GPT Image 2.

Restricciones que pueden decidir antes que el estilo

No gastes primero para descubrir una incompatibilidad que ya estaba publicada. Convierte los requisitos no negociables —resolución, transparencia, referencias, máscara, formato y método de integración— en filtros.

xAI: contrato acotado y precio por salida

grok-imagine-image-2.0 ofrece 1K y 2K, relaciones de aspecto enumeradas y calidades low y medium. La API directa permite generación y edición, con respuesta por URL temporal o Base64. Si necesitas descargar desde una URL, hazlo mientras siga vigente; no la trates como almacenamiento permanente.

Hay una discrepancia oficial en el número de imágenes fuente: la guía de edición múltiple habla de hasta tres, mientras que el anuncio de Image 2.0 menciona hasta cinco. Para una integración conservadora, diseña la petición directa alrededor de tres y valida cualquier capacidad superior en tu propia cuenta. Tampoco hay un contrato 4K documentado para este modelo.

Google: 4K, grounding y referencias con sublímites

gemini-3-pro-image admite 1K, 2K y 4K, generación y edición, trabajo multivuelta, thinking activado por defecto y grounding con Google Search. Las imágenes generadas incorporan SynthID. La documentación permite hasta catorce referencias totales, pero no significa catorce referencias con la misma fidelidad: existen límites más estrechos para objetos, personajes y estilo.

Esto puede darle prioridad cuando el encargo requiere alta resolución o contexto actualizado mediante Search. También añade variables que debes registrar: referencias efectivamente usadas, coste de grounding, tokens de entrada y thinking. La Developer API no ofrece free tier para este modelo; no extrapoles a ella una prueba gratuita vista en AI Studio o en Gemini app.

OpenAI: dimensiones flexibles, máscaras y dos superficies

gpt-image-2 ofrece generación y edición, imágenes de referencia, máscaras y Batch. Admite low, medium, high y auto, además de dimensiones flexibles sujetas a límites de píxeles, pasos de 16 píxeles, longitud del lado mayor y proporción máxima de 3:1. Las salidas por encima de 3.686.400 píxeles son experimentales: decir simplemente «tiene 4K» oculta una condición importante.

La API directa no genera fondo transparente. Si necesitas un PNG con canal alfa para iconos, pegatinas o recortes de producto, tendrás que cambiar de requisito, añadir posprocesado o descartar esta ruta. OpenAI también reconoce límites en texto exacto, consistencia repetida de personajes o marcas y colocación de composiciones estructuradas; son límites documentados, no una medición que demuestre que otro proveedor lo hace mejor.

Qué ruta probar primero según el trabajo

Si tu requisito principal es...Primera prueba razonableQué debes confirmar
1K/2K y presupuesto previsible por salidagrok-imagine-image-2.0calidad, resolución, número de imágenes de entrada y descarga de la salida
4K, Search grounding o un conjunto amplio de referenciasgemini-3-pro-imagesublímites de fidelidad, coste de tokens/grounding y salida realmente entregada
edición con máscara, tamaño flexible, Batch o ecosistema OpenAIgpt-image-2dimensiones válidas, coste en tokens y si usar Images o Responses
fondo transparente directoninguna por defecto entre estas tresla API de GPT Image 2 no lo admite; verifica el contrato actual de las otras rutas
máxima calidad visual para tu marcalas tres, en condiciones comparablestexto, identidad, composición, reparaciones y aprobación humana

La tabla sirve para reducir el orden de prueba, no para coronar un modelo. Una campaña con tipografía pequeña, una ficha de producto con geometría exacta y una ilustración editorial sin referencias pueden elegir rutas distintas. Incluso dentro del mismo equipo, el mejor primer intento puede cambiar si el activo termina en una aplicación de consumo, en un proceso manual o en un backend con observabilidad y reintentos.

Filtro de requisitos no negociables antes de comparar la calidad visual
Filtro de requisitos no negociables antes de comparar la calidad visual

Si solo estás comparando Google y OpenAI como ecosistemas de producto, la comparativa de generación de imágenes de Gemini y OpenAI desarrolla esa decisión sin mezclarla con la ruta de xAI.

El precio de catálogo no es el coste por imagen aceptada

Las tres tarifas no comparten unidad. A 14 de agosto de 2026, la tarifa de xAI publica precio por salida: $0.04 para 1K low, $0.06 para 2K low o 1K medium, y $0.08 para 2K medium, más $0.01 por cada imagen de entrada. Son importes de API directa, no el precio de una suscripción Grok.

Google publica $0.134 por salida estándar de 1K o 2K y $0.24 por salida 4K para Gemini 3 Pro Image. A eso pueden añadirse entrada, texto/thinking, grounding y otras modalidades. La tabla oficial de precios de Gemini API también deja claro que no hay free tier en Developer API.

OpenAI no tiene una cifra fija por imagen: sus tarifas estándar son $8 por millón de tokens de imagen de entrada, $2 por millón de tokens de entrada almacenados en caché y $30 por millón de tokens de imagen de salida; el texto se factura aparte. Dimensiones, calidad, prompt y referencias cambian el total. Consulta la tarifa oficial de Image Generation y su calculadora en vez de convertir un ejemplo en precio universal.

Para decidir, usa esta relación:

Coste por imagen aceptada = (coste API total + coste del tiempo de reparación) / número de imágenes aprobadas.

Flujo desde distintas unidades de facturación hasta el coste por imagen aceptada
Flujo desde distintas unidades de facturación hasta el coste por imagen aceptada

En el numerador deben entrar tanto la factura API como el tiempo de corregir texto, recomponer elementos, recortar fondos y revisar marca. Una salida barata que exige cuatro reintentos puede costar más que otra con tarifa inicial superior. Y una ruta algo más cara puede ganar si evita integrar un segundo sistema; eso es ahorro operativo, no superioridad visual.

Una prueba pequeña que sí permite decidir

Usar la misma frase como prompt no basta. Cada API expresa resolución, calidad, referencias y edición de forma distinta. La comparación justa conserva el mismo encargo y la misma regla de aceptación, y registra las diferencias de contrato.

  1. Define antes de generar qué invalida una salida: texto incorrecto, identidad alterada, producto deformado, composición rota, tamaño insuficiente o demasiados minutos de retoque.
  2. Usa el mismo encargo, las mismas imágenes fuente y el mismo destino final. No mejores las instrucciones de un modelo después de ver sus fallos sin dar el mismo ciclo de revisión a los demás.
  3. Configura una calidad y un tamaño comparables. Si una ruta no puede ofrecer el requisito, anótala como descartada en lugar de esconder la diferencia.
  4. Guarda proveedor, superficie, ID exacto, fecha, parámetros, referencias, latencia, errores, reintentos, coste y minutos de reparación.
  5. Evalúa a tamaño de uso real. El texto que parece legible en una miniatura puede fallar en un anuncio; un detalle atractivo puede perderse al recortar.

No hace falta una batería enorme. Elige unos pocos casos que representen tu trabajo: por ejemplo, una pieza con texto crítico, una edición localizada y un activo con referencias de producto o personaje. Decide con la tasa de aprobación y el coste por aprobado, no con la mejor imagen aislada.

Entonces, ¿cuál elegir?

Elige primero grok-imagine-image-2.0 si sus límites de 1K/2K encajan y quieres presupuestar rápidamente un flujo directo de generación o edición. Elige primero gemini-3-pro-image si 4K, Search grounding o varias referencias cualificadas son parte central del encargo. Elige primero gpt-image-2 si necesitas máscaras, dimensiones flexibles, Batch o integración natural con OpenAI.

Si ninguna restricción elimina una opción, todavía no tienes un ganador: tienes tres candidatos. La calidad, la velocidad, la fidelidad del texto y la consistencia deben medirse con tus activos y tu umbral de reparación. Los contratos publicados sirven para diseñar la prueba, pero no demuestran un vencedor universal sin resultados comparables obtenidos con tus propios materiales.