AIFreeAPI Logo

Modelos de texto Gemini en 2026: Flash, Flash-Lite o Pro

E
8 min readGuías de API

Para una integración nueva, toma Gemini 3.7 Flash estable como referencia, separa las tareas masivas verificables en Flash-Lite y prueba Pro Preview solo cuando aporte una mejora medible en trabajos difíciles.

Comparativa de modelos de texto Gemini en agosto de 2026 por estado, precio, thinking, uso y retirada

A 25 de agosto de 2026, gemini-3.7-flash es el punto de partida razonable para una integración nueva con Gemini Developer API. Es una versión estable (GA) y cubre código, flujos agénticos y procesos de varios pasos. Para clasificación, extracción, traducción o enrutamiento a gran escala con una respuesta que puedas validar, conviene evaluar primero gemini-3.5-flash-lite.

gemini-3.1-pro-preview no debería convertirse en la opción predeterminada solo por llamarse Pro. Una vista previa puede cambiar su comportamiento, sus límites o su contrato. Tiene sentido probarla en un subconjunto de tareas complejas donde 3.7 Flash falle y el coste de ese fallo sea relevante.

Esta comparación se limita a modelos generales que admiten texto, imágenes, vídeo, audio y PDF como entrada y devuelven texto. La generación de imágenes, Live API, TTS, embeddings y los planes de la aplicación Gemini son superficies distintas.

Una decisión inicial por tipo de trabajo

SituaciónPrimer modelo que evaluaríaCondición antes de adoptarlo
Servicio nuevo, código o varias herramientasgemini-3.7-flashÉxito al primer intento, llamadas correctas y latencia P95
Sistema estable sobre 3.6gemini-3.6-flash y prueba paralela de 3.7Mantener respaldo y reversión
Extracción, clasificación, traducción o routinggemini-3.5-flash-liteValidación con JSON Schema, etiquetas o campos obligatorios
Pipeline barato basado en 3.1 Litegemini-3.1-flash-liteEs más barato hoy, pero necesita una ruta de migración
Razonamiento complejo, código difícil o custom tools3.7 frente a gemini-3.1-pro-previewLa mejora debe compensar el precio y el riesgo Preview
Producción con cualquier modelo 2.5Empezar la migración a 3.xLa fecha de retirada más temprana es el 16 de octubre de 2026

No hace falta enviar todas las solicitudes al mismo endpoint. Una política útil dirige las tareas estructuradas y verificables a Flash-Lite, y eleva a 3.7 Flash las entradas ambiguas, los fallos o los procesos con varios pasos. Así, el modelo es una decisión de routing, no una apuesta permanente por un nombre.

Política para enrutar tareas verificables a Flash-Lite, elevar casos complejos a 3.7 y medir el coste por resultado aceptado
Política para enrutar tareas verificables a Flash-Lite, elevar casos complejos a 3.7 y medir el coste por resultado aceptado

Qué cambia entre los modelos vigentes

La lista oficial de modelos marca 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite y 3.1 Flash-Lite como estables. 3.1 Pro y 3 Flash continúan en Preview.

Gemini 3.7 Flash: referencia para proyectos nuevos

La ficha de 3.7 Flash indica 1.048.576 tokens de entrada y 65.536 de salida. Admite caché de contexto, ejecución de código, function calling, salida estructurada, Grounding y URL Context.

Google la posiciona para programación, agentes y trabajo fiable de varios pasos, pero esa descripción del proveedor no es un benchmark independiente. Antes de adoptarla, mide con tus propios casos la tasa de éxito al primer intento, la precisión de las llamadas a herramientas, la latencia P95 y los tokens totales por resultado aceptado.

3.6 y 3.5 Flash: ambas estables, con funciones distintas

gemini-3.6-flash puede seguir como respaldo estable para un sistema existente. Hasta finales de 2026 comparte el precio promocional estándar de 3.7. gemini-3.5-flash también es GA y publica los mismos límites de entrada y salida, pero el resumen actual la clasifica como legacy y su tarifa estándar es superior.

Si 3.5 sostiene un requisito de calidad existente, conservarla durante una transición puede ser válido. En un proyecto nuevo, compara el resultado y el coste de cambio en lugar de elegir por número de versión.

Flash-Lite: volumen cuando el resultado se puede comprobar

Gemini 3.5 Flash-Lite está orientada a baja latencia, alto rendimiento, análisis de documentos, extracción sencilla y subtareas de agentes. Compartir la ventana de 1M/65k con Flash no significa compartir su calidad de razonamiento.

Funciona mejor cuando hay un conjunto fijo de etiquetas, un esquema o campos obligatorios que permiten aceptar o rechazar la respuesta. Si un modelo barato necesita más reintentos o llama mal a una herramienta, el coste por tarea aceptada puede dejar de ser bajo.

gemini-3.1-flash-lite tiene una tarifa publicada menor, pero pertenece a una generación anterior. La tabla de retiradas ya señala 3.5 Flash-Lite como sustituta, de modo que un sistema nuevo y duradero debería prever el siguiente cambio.

3.1 Pro Preview: una excepción que hay que demostrar

3.1 Pro Preview se orienta a tareas complejas, software engineering y uso preciso de herramientas, con un ID separado para custom tools. Sin embargo, su estado Preview implica una clase de riesgo distinta de GA. Compárala con 3.7 solo en los casos donde un error de Flash tenga un impacto real y cuantificable.

Precios estándar de la API

La página oficial de precios publica estas tarifas para inferencia estándar de pago, en dólares por millón de tokens. La salida incluye los thinking tokens. Batch, Flex y Priority tienen precios diferentes.

ModeloEntradaSalida con thinkingEstado o condición
3.7 Flash$0.75$3.75GA; promoción hasta el 31-12-2026, después se anuncia $1.50 / $7.50
3.6 Flash$0.75$3.75GA; mismo final de promoción
3.5 Flash$1.50$9.00GA, legacy
3.5 Flash-Lite$0.30$2.50GA
3.1 Flash-Lite$0.25$1.50GA; entrada de texto, imagen o vídeo
3.1 Pro Preview$2.00 / $4.00$12.00 / $18.00prompt hasta 200k tokens / por encima de 200k

Calcula el coste de una tarea aceptada: entrada + salida con thinking + herramientas + reintentos + caché. En la misma hoja de evaluación registra éxito, P95, tokens y reintentos. Una tarifa de entrada baja por sí sola no demuestra un coste final bajo.

El nivel gratuito no está disponible de la misma forma para todos los modelos, proyectos o regiones. La página de precios advierte que el contenido enviado en free tier puede utilizarse para mejorar productos de Google, mientras que indica lo contrario para paid tier. Si hay datos sensibles, comprueba también esta condición.

Fijar el thinking level para comparar

La documentación de thinking establece que 3.7 Flash usa medium por defecto y admite low, medium y high. 3.6 Flash y 3.5 Flash-Lite también admiten minimal. 3.1 Pro Preview usa high por defecto.

Si cambias de modelo y de thinking level a la vez, no sabrás qué produjo la diferencia. Empieza con low o minimal en extracción y sube el nivel para código difícil o tool use cuando sea necesario, vigilando la salida facturada y los timeouts.

La guía de migración a 3.7 pide eliminar temperature, top_p y top_k, sustituir thinking_budget por thinking_level y revisar las reglas de function responses. Cambiar solo el ID no es una migración completa.

Migrar desde Gemini 2.5 sin un corte brusco

El calendario oficial de retiradas indica que 2.0 Flash y Flash-Lite dejaron de funcionar el 1 de junio de 2026. Para 2.5 Pro, 2.5 Flash y 2.5 Flash-Lite, la fecha de retirada más temprana es el 16 de octubre de 2026. Google la presenta como earliest shutdown y puede comunicar la fecha exacta más adelante.

Localiza el ID en código, variables de entorno, colas y paneles. Prepara un conjunto fijo con solicitudes normales, documentos largos, tool failures y salida estructurada. Actualiza los parámetros de 3.x y las thought signatures. Haz que el modelo se pueda cambiar por configuración, empieza con un canary pequeño y conserva un modelo de respaldo y un procedimiento de reversión.

Plan de migración de Gemini 2.5 a 3.x con cambios de parámetros, fechas de retirada, canary, respaldo y reversión
Plan de migración de Gemini 2.5 a 3.x con cambios de parámetros, fechas de retirada, canary, respaldo y reversión

Para un proyecto nuevo, usa 3.7 Flash como referencia, separa en Flash-Lite las operaciones repetibles que puedas validar y reserva Pro Preview para unas pocas solicitudes realmente difíciles. La elección debe ser una política operativa que incluya estabilidad, coste por resultado aceptado, impacto del fallo y siguiente migración, no una clasificación por nombre.