AIFreeAPI Logo

Límites de Gemini API por nivel: valores activos y diagnóstico del error 429

A
8 min readGuías de API

El nivel de uso no asigna un único RPM a todos los modelos. La capacidad efectiva depende de la cuenta de facturación, el proyecto, el modelo, la ruta y los límites activos de AI Studio.

Límites de Gemini API por nivel con proyecto, facturación, RPM, TPM, RPD, Priority, Batch y diagnóstico 429

Los niveles Free, Tier 1, Tier 2 y Tier 3 de Gemini API no forman una tabla permanente de RPM para todos los modelos. El nivel de uso influye, pero también importan el proyecto, la cuenta de facturación, el modelo y versión, el estado de la cuenta y si la solicitud es normal, Priority o Batch.

Google remite a AI Studio para consultar los límites que se aplican ahora y advierte de que los valores especificados no están garantizados. Por eso un 429 RESOURCE_EXHAUSTED debe investigarse con el proyecto y el modelo que realmente fallaron, no con una cifra copiada de otro año o de otra cuenta.

Comprueba que la clave y el panel pertenecen al mismo proyecto

Antes de interpretar el 429, anota la clave utilizada, el proyecto propietario, la cuenta de facturación vinculada, el identificador completo del modelo, la versión de la API, el endpoint y la hora del error.

Después revisa AI Studio:

  1. En Projects o API keys, confirma la relación entre clave y proyecto, la cuenta de facturación y el nivel de uso heredado.
  2. En Dashboard > Rate Limit, selecciona el mismo modelo que utilizó la solicitud.
  3. En Usage, revisa el consumo del mismo proyecto y periodo.
  4. Distingue tráfico interactivo normal, Priority inference y Batch API.

Las claves no tienen una cuota propia. Todas las claves de un proyecto comparten el uso y los límites del proyecto. Los proyectos asociados a una cuenta de facturación de Google Cloud heredan el nivel y el tope de esa cuenta. Crear más claves dentro del mismo proyecto no multiplica la capacidad.

Condiciones actuales de Free y Tier 1–3

A 2 de septiembre de 2026, la guía de facturación de Gemini API publica estas condiciones. El tope mensual y el límite de gasto de diez minutos no son el RPM de un modelo.

Nivel de usoCondición actualTope mensual de la cuentaGasto máximo en una ventana móvil de 10 minutos
FreeProyecto activo o prueba gratuitaNo aplicableNo aplicable
Tier 1Configurar y vincular una cuenta de facturación activa$250$10
Tier 2Haber pagado $100 y esperar 3 días desde el primer pago completado correctamente$2.000$200
Tier 3Haber pagado $1.000 y esperar 30 días desde el primer pago completado correctamente$20.000–$100.000+$200

Para Tier 2 y Tier 3, Google tiene en cuenta el gasto acumulado en servicios de Google Cloud de los proyectos vinculados a la cuenta de facturación, no solo el uso de una clave de Gemini API.

La subida de nivel es automática cuando se cumplen los requisitos, sujeta al procesamiento y la revisión. Free → Tier 1 suele aplicarse al instante; los niveles posteriores, normalmente en diez minutos. La confirmación debe hacerse en Projects, no deducirse solo de un cargo completado.

El límite de gasto se evalúa en una ventana móvil de diez minutos y su aplicación depende del historial de facturación y del estado de la cuenta. Una ráfaga de solicitudes costosas puede producir 429 aunque el recuento de solicitudes y los tokens de entrada estén por debajo de sus límites activos.

RPM, TPM y RPD se evalúan por separado

La documentación de límites de frecuencia describe tres dimensiones habituales:

  • RPM: solicitudes por minuto. Las ráfagas y la concurrencia pueden agotarlo.
  • TPM de entrada: tokens de entrada por minuto. Un contexto largo puede agotarlo con pocas llamadas.
  • RPD: solicitudes por día. Se reinicia a medianoche, hora del Pacífico.

Algunos modelos añaden IPM para imágenes o TPD para tokens diarios. Cada dimensión aplicable se evalúa por separado. Tener RPM libre no descarta TPM, RPD, IPM, TPD ni el límite de gasto.

Si AI Studio muestra RPM y TPM de entrada, una estimación útil es:

solicitudes por minuto ≈ min(RPM activo, floor(TPM activo / tokens de entrada medios por solicitud))

No es una cuota nueva, sino una fórmula de capacidad. Si el servicio pasa de preguntas cortas a documentos largos, el TPM puede convertirse en el cuello de botella sin cambiar el nivel ni el RPM. Conviene reservar margen porque Google no garantiza que el límite indicado sea capacidad continua al 100%.

Priority y Batch tienen controles propios

Priority inference mantiene límites específicos. Google indica un valor predeterminado de 0,3 veces el límite estándar de la misma combinación de modelo y nivel. Su consumo también cuenta en el tráfico interactivo global, por lo que no se debe aplicar sin más el límite de solicitudes normales.

Batch API usa límites separados de las llamadas fuera de Batch. Google publica actualmente 100 solicitudes Batch simultáneas, 2 GB por archivo de entrada, 20 GB de almacenamiento y un máximo de tokens en cola que cambia por modelo y nivel. Consulta la tabla Batch vigente en vez de guardar una matriz que quedará obsoleta.

Comprobación de proyecto y panel, niveles, límites activos, Priority, Batch, 429, reintentos y registro operativo
Comprobación de proyecto y panel, niveles, límites activos, Priority, Batch, 429, reintentos y registro operativo

Relaciona el patrón del 429 con una acción

Lo que observasControl probableAcción adecuada
429 justo después de aumentar concurrenciaRPMCola compartida por proyecto, suavizar la ráfaga y reintentar con un máximo de intentos
Pocas llamadas con entradas muy largasTPM de entradaEliminar contexto repetido, reducir entradas grandes en paralelo y recuperar solo lo necesario
El servicio se detiene tras uso sostenido diarioRPD o TPDEsperar el reinicio indicado o evaluar un nivel de pago adecuado
Solicitudes caras concentradas en diez minutosLímite de gastoEsperar a que avance la ventana, reducir coste de entrada/salida o solicitar aumento
Solo falla PriorityLímite PriorityConsultar su valor; volver al tráfico estándar solo si encaja con la latencia requerida
No se puede encolar un trabajo BatchConcurrencia Batch o tokens en colaEsperar trabajos activos, reducir el lote o consultar la tabla del modelo
Usage parece bajo y el 429 continúaProyecto/modelo incorrecto, nivel pendiente o capacidad variableVerificar clave, proyecto, identificador del modelo y nivel; adjuntar esos datos a una solicitud de aumento

Subir de nivel no arregla que el proceso consulte otro proyecto, use una versión preliminar del modelo con límites más estrictos o haga que todos los procesos reintenten a la vez.

Ruta de diagnóstico del error 429 en Gemini API con niveles, límites independientes y acciones recomendadas
Ruta de diagnóstico del error 429 en Gemini API con niveles, límites independientes y acciones recomendadas

Reintenta solo errores transitorios

La guía oficial de solución de problemas recomienda una espera exponencial con variación aleatoria (jitter) y un máximo de intentos para errores transitorios como 429 y 503. Algunos SDK oficiales ya incluyen reintentos, por lo que hay que comprobar su comportamiento antes de añadir otra capa.

La espera da tiempo a que se libere una ventana; no aumenta RPM, TPM, RPD ni capacidad de gasto. Un limitador y una cola comunes para el proyecto evitan que las claves o procesos creen otra ráfaga sincronizada.

No trates 400 o 403 como si fueran 429 temporales. Suelen señalar formato, versión de modelo/API, autenticación o permisos. La guía de errores de Gemini API los separa.

Conserva un estado que se pueda volver a calcular

Para planificar producción, registra fecha, cuenta de facturación, proyecto, nivel, identificador completo del modelo, tipo de solicitud, RPM/TPM/RPD activos o valores propios del modelo, entrada media, concurrencia y gasto máximo en diez minutos. Así se puede repetir el cálculo cuando cambie el modelo o el panel.

Si la decisión es solo si la cuota gratis sirve para un prototipo, consulta la guía de cuota gratuita. Esta página sirve para diagnosticar capacidad efectiva y 429 en cualquier nivel.

El nivel representa los requisitos de acceso; AI Studio, el estado actual del proyecto; la solicitud fallida, la unidad de diagnóstico. Separarlos evita depender de una tabla que ya no describe la cuenta real.