Los niveles Free, Tier 1, Tier 2 y Tier 3 de Gemini API no forman una tabla permanente de RPM para todos los modelos. El nivel de uso influye, pero también importan el proyecto, la cuenta de facturación, el modelo y versión, el estado de la cuenta y si la solicitud es normal, Priority o Batch.
Google remite a AI Studio para consultar los límites que se aplican ahora y advierte de que los valores especificados no están garantizados. Por eso un 429 RESOURCE_EXHAUSTED debe investigarse con el proyecto y el modelo que realmente fallaron, no con una cifra copiada de otro año o de otra cuenta.
Comprueba que la clave y el panel pertenecen al mismo proyecto
Antes de interpretar el 429, anota la clave utilizada, el proyecto propietario, la cuenta de facturación vinculada, el identificador completo del modelo, la versión de la API, el endpoint y la hora del error.
Después revisa AI Studio:
- En Projects o API keys, confirma la relación entre clave y proyecto, la cuenta de facturación y el nivel de uso heredado.
- En Dashboard > Rate Limit, selecciona el mismo modelo que utilizó la solicitud.
- En Usage, revisa el consumo del mismo proyecto y periodo.
- Distingue tráfico interactivo normal, Priority inference y Batch API.
Las claves no tienen una cuota propia. Todas las claves de un proyecto comparten el uso y los límites del proyecto. Los proyectos asociados a una cuenta de facturación de Google Cloud heredan el nivel y el tope de esa cuenta. Crear más claves dentro del mismo proyecto no multiplica la capacidad.
Condiciones actuales de Free y Tier 1–3
A 2 de septiembre de 2026, la guía de facturación de Gemini API publica estas condiciones. El tope mensual y el límite de gasto de diez minutos no son el RPM de un modelo.
| Nivel de uso | Condición actual | Tope mensual de la cuenta | Gasto máximo en una ventana móvil de 10 minutos |
|---|---|---|---|
| Free | Proyecto activo o prueba gratuita | No aplicable | No aplicable |
| Tier 1 | Configurar y vincular una cuenta de facturación activa | $250 | $10 |
| Tier 2 | Haber pagado $100 y esperar 3 días desde el primer pago completado correctamente | $2.000 | $200 |
| Tier 3 | Haber pagado $1.000 y esperar 30 días desde el primer pago completado correctamente | $20.000–$100.000+ | $200 |
Para Tier 2 y Tier 3, Google tiene en cuenta el gasto acumulado en servicios de Google Cloud de los proyectos vinculados a la cuenta de facturación, no solo el uso de una clave de Gemini API.
La subida de nivel es automática cuando se cumplen los requisitos, sujeta al procesamiento y la revisión. Free → Tier 1 suele aplicarse al instante; los niveles posteriores, normalmente en diez minutos. La confirmación debe hacerse en Projects, no deducirse solo de un cargo completado.
El límite de gasto se evalúa en una ventana móvil de diez minutos y su aplicación depende del historial de facturación y del estado de la cuenta. Una ráfaga de solicitudes costosas puede producir 429 aunque el recuento de solicitudes y los tokens de entrada estén por debajo de sus límites activos.
RPM, TPM y RPD se evalúan por separado
La documentación de límites de frecuencia describe tres dimensiones habituales:
- RPM: solicitudes por minuto. Las ráfagas y la concurrencia pueden agotarlo.
- TPM de entrada: tokens de entrada por minuto. Un contexto largo puede agotarlo con pocas llamadas.
- RPD: solicitudes por día. Se reinicia a medianoche, hora del Pacífico.
Algunos modelos añaden IPM para imágenes o TPD para tokens diarios. Cada dimensión aplicable se evalúa por separado. Tener RPM libre no descarta TPM, RPD, IPM, TPD ni el límite de gasto.
Si AI Studio muestra RPM y TPM de entrada, una estimación útil es:
solicitudes por minuto ≈ min(RPM activo, floor(TPM activo / tokens de entrada medios por solicitud))
No es una cuota nueva, sino una fórmula de capacidad. Si el servicio pasa de preguntas cortas a documentos largos, el TPM puede convertirse en el cuello de botella sin cambiar el nivel ni el RPM. Conviene reservar margen porque Google no garantiza que el límite indicado sea capacidad continua al 100%.
Priority y Batch tienen controles propios
Priority inference mantiene límites específicos. Google indica un valor predeterminado de 0,3 veces el límite estándar de la misma combinación de modelo y nivel. Su consumo también cuenta en el tráfico interactivo global, por lo que no se debe aplicar sin más el límite de solicitudes normales.
Batch API usa límites separados de las llamadas fuera de Batch. Google publica actualmente 100 solicitudes Batch simultáneas, 2 GB por archivo de entrada, 20 GB de almacenamiento y un máximo de tokens en cola que cambia por modelo y nivel. Consulta la tabla Batch vigente en vez de guardar una matriz que quedará obsoleta.

Relaciona el patrón del 429 con una acción
| Lo que observas | Control probable | Acción adecuada |
|---|---|---|
| 429 justo después de aumentar concurrencia | RPM | Cola compartida por proyecto, suavizar la ráfaga y reintentar con un máximo de intentos |
| Pocas llamadas con entradas muy largas | TPM de entrada | Eliminar contexto repetido, reducir entradas grandes en paralelo y recuperar solo lo necesario |
| El servicio se detiene tras uso sostenido diario | RPD o TPD | Esperar el reinicio indicado o evaluar un nivel de pago adecuado |
| Solicitudes caras concentradas en diez minutos | Límite de gasto | Esperar a que avance la ventana, reducir coste de entrada/salida o solicitar aumento |
| Solo falla Priority | Límite Priority | Consultar su valor; volver al tráfico estándar solo si encaja con la latencia requerida |
| No se puede encolar un trabajo Batch | Concurrencia Batch o tokens en cola | Esperar trabajos activos, reducir el lote o consultar la tabla del modelo |
| Usage parece bajo y el 429 continúa | Proyecto/modelo incorrecto, nivel pendiente o capacidad variable | Verificar clave, proyecto, identificador del modelo y nivel; adjuntar esos datos a una solicitud de aumento |
Subir de nivel no arregla que el proceso consulte otro proyecto, use una versión preliminar del modelo con límites más estrictos o haga que todos los procesos reintenten a la vez.

Reintenta solo errores transitorios
La guía oficial de solución de problemas recomienda una espera exponencial con variación aleatoria (jitter) y un máximo de intentos para errores transitorios como 429 y 503. Algunos SDK oficiales ya incluyen reintentos, por lo que hay que comprobar su comportamiento antes de añadir otra capa.
La espera da tiempo a que se libere una ventana; no aumenta RPM, TPM, RPD ni capacidad de gasto. Un limitador y una cola comunes para el proyecto evitan que las claves o procesos creen otra ráfaga sincronizada.
No trates 400 o 403 como si fueran 429 temporales. Suelen señalar formato, versión de modelo/API, autenticación o permisos. La guía de errores de Gemini API los separa.
Conserva un estado que se pueda volver a calcular
Para planificar producción, registra fecha, cuenta de facturación, proyecto, nivel, identificador completo del modelo, tipo de solicitud, RPM/TPM/RPD activos o valores propios del modelo, entrada media, concurrencia y gasto máximo en diez minutos. Así se puede repetir el cálculo cuando cambie el modelo o el panel.
Si la decisión es solo si la cuota gratis sirve para un prototipo, consulta la guía de cuota gratuita. Esta página sirve para diagnosticar capacidad efectiva y 429 en cualquier nivel.
El nivel representa los requisitos de acceso; AI Studio, el estado actual del proyecto; la solicitud fallida, la unidad de diagnóstico. Separarlos evita depender de una tabla que ya no describe la cuenta real.



