Ошибка 429 RESOURCE_EXHAUSTED не означает автоматически, что проект «исчерпал RPM своего уровня». Gemini API проверяет несколько ограничений независимо: число запросов, объём входных токенов, дневную квоту, специальные ограничения модели и, для некоторых платных аккаунтов, скорость расходов.
Уровень использования определяет, к какому классу лимитов может относиться платёжный аккаунт. Точные действующие значения для проекта и модели Google предлагает смотреть в AI Studio. Поэтому старые таблицы с универсальными «15 RPM на Free» или «300 RPM на Tier 1» нельзя использовать как текущий договор о ёмкости.
Начните с фактов о неудачном запросе
До изменения кода зафиксируйте:
- API key и проект, которому он принадлежит;
- связанный платёжный аккаунт и текущий уровень использования;
- полный идентификатор модели (model ID) и версию API;
- обычный это запрос, Priority inference или Batch API;
- время, текст ошибки и характер нагрузки перед сбоем.
Затем откройте AI Studio. На странице Projects или API keys подтвердите проект и tier. В Dashboard откройте Rate Limit для той же модели, а в Usage — использование того же проекта за нужный период. Сравнение другого ключа бесполезно, если он принадлежит другому проекту.
Ключи не получают отдельную квоту. Все ключи одного проекта расходуют общие лимиты проекта. Проекты, связанные с одним платёжным аккаунтом Google Cloud (Cloud Billing account), наследуют его уровень и общий предел расходов. Создание новых ключей не увеличивает пропускную способность.

Что сегодня означает Free, Tier 1, Tier 2 и Tier 3
По состоянию на 2 сентября 2026 года официальный раздел о биллинге Gemini API задаёт следующие условия. Они описывают квалификацию и предел платёжного аккаунта, но не гарантируют RPM конкретной модели.
| Уровень | Условие | Месячный предел аккаунта | Расход за скользящие 10 минут |
|---|---|---|---|
| Free | Активный проект или пробный доступ | Не применяется | Не применяется |
| Tier 1 | Подключён активный платёжный аккаунт | $250 | $10 |
| Tier 2 | Оплачено $100 и прошло 3 дня с первого успешного платежа | $2 000 | $200 |
| Tier 3 | Оплачено $1 000 и прошло 30 дней с первого успешного платежа | $20 000–$100 000+ | $200 |
Для Tier 2 и Tier 3 учитываются совокупные расходы на сервисы Google Cloud по проектам, привязанным к платёжному аккаунту, а не только использование одного ключа Gemini API. После выполнения условий повышение происходит автоматически с учётом времени обработки и проверки. Переход Free → Tier 1 обычно действует сразу, последующие — в течение десяти минут. Фактический результат проверяется на странице Projects.
Отдельно действует ограничение расходов в скользящем десятиминутном окне. Google отмечает, что его применение зависит также от истории платежей и состояния аккаунта. Превышение этого ограничения возвращает 429, даже если RPM и входные TPM ещё не исчерпаны.
Какие показатели ограничивают запросы
Текущая страница ограничений называет три обычных измерения:
- RPM — запросы в минуту. Ограничение чувствительно к коротким всплескам и параллельности.
- Входные TPM — входные токены в минуту. Длинный контекст может исчерпать TPM при небольшом числе запросов.
- RPD — запросы в сутки. Сброс происходит в полночь по тихоокеанскому времени.
У конкретной модели могут действовать IPM для изображений или TPD для токенов в сутки. Проверяется каждое применимое измерение. Остаток RPM ничего не говорит об остатке TPM, RPD, IPM, TPD или десятиминутного расхода.
Если AI Studio показывает RPM и входные TPM, верхнюю оценку можно получить так:
запросов в минуту ≈ min(активный RPM, floor(активный TPM / среднее число входных токенов))
Это расчёт для планирования, а не новая квота Google. Он показывает, почему добавление длинных документов сокращает фактическое число запросов без изменения tier. Оставляйте запас: Google прямо пишет, что указанные лимиты не гарантированы, а доступная ёмкость может меняться.
Priority и Batch нельзя считать по обычному RPM
Priority inference имеет собственные ограничения. Google указывает значение по умолчанию 0,3 от стандартного лимита той же модели и уровня; при этом Priority-трафик учитывается и в общем интерактивном трафике. Стандартный показатель из Dashboard нельзя без проверки переносить на Priority.
Batch API отделён от обычных запросов. Сейчас опубликованы предел 100 параллельных Batch-запросов, 2 ГБ на входной файл, 20 ГБ файлового хранилища и отдельное число токенов в очереди (enqueued tokens) для модели и уровня. Таблица моделей быстро меняется, поэтому используйте актуальный раздел Batch, а не сохранённую копию.
Выберите действие по признакам нагрузки
| Наблюдение | Вероятное ограничение | Что менять |
|---|---|---|
| 429 появляется после резкого всплеска | RPM | Общая очередь проекта, ограничение параллельности, ограниченная по числу попыток задержка |
| Запросов мало, но контекст большой | Входные TPM | Убрать повторяющийся контекст, сократить параллельные большие запросы, получать только нужные данные |
| Вызовы прекращаются после длительной работы в течение дня | RPD или TPD | Дождаться указанного сброса либо оценить подходящий платный уровень |
| Дорогие запросы сгруппированы в десять минут | Лимит скорости расходов | Дождаться окна, уменьшить контекст/вывод или запросить повышение лимита |
| Ошибка только у Priority | Лимит Priority | Проверить отдельное значение; обычный режим использовать только при подходящих требованиях к задержке |
| Batch-задача не ставится в очередь | Параллельные задания или enqueued tokens | Дождаться завершения, уменьшить пакет, проверить таблицу модели |
| На панели Usage низкие значения, но 429 сохраняется | Неверный проект/модель, уровень ещё не обновлён или ёмкость изменилась | Повторно проверить соответствие ключа проекту, model ID и tier; затем подать запрос на увеличение с этими данными |
Новый уровень не исправит выбор не того проекта, более строгую предварительную версию модели или одновременный повтор всех процессов.

Повторяйте только временные ошибки
В официальном руководстве по устранению неполадок Google рекомендует экспоненциальную задержку со случайным разбросом (jitter) и максимальным числом попыток для временных 429 и 503. Некоторые официальные SDK уже повторяют временные ошибки автоматически; проверьте это до добавления второго механизма.
Такая задержка помогает переждать окно, но не повышает RPM, TPM, RPD или предел расходов. Если процессы повторяют запрос одновременно, они создают новый всплеск. Ограничитель должен учитывать общую квоту проекта, а не работать отдельно для каждого ключа.
Ошибки 400 и 403 не следует повторять как 429: они обычно указывают на параметры, версию модели, аутентификацию или права. Отдельная инструкция по ошибкам Gemini API поможет разделить случаи.
Зафиксируйте состояние, а не вечную таблицу
Для решения о производственной нагрузке сохраните дату, платёжный аккаунт, проект, tier, полный model ID, вид запроса, действующие RPM/TPM/RPD или специальные значения, средний вход, параллельность и пиковый расход за десять минут. Эту запись можно пересчитать после изменения модели или условий.
Если задача ограничена бесплатной квотой прототипа, используйте руководство по бесплатной квоте. Эта статья нужна тогда, когда требуется оценить эффективную ёмкость и объяснить 429 на любом tier.
Уровень показывает квалификацию, AI Studio — текущее состояние проекта, а конкретный неудачный запрос — причину для диагностики. Такое разделение остаётся полезным после очередного изменения лимитов.



