AIFreeAPI Logo

Лимиты Gemini API по уровням: где смотреть значения и причину 429

A
5 min readРуководства по API

Сначала определите проект, модель и вид запроса, затем сравните фактическое использование с действующими лимитами в AI Studio. Таблица RPM из старой статьи не объясняет все ошибки 429.

Обзор уровней и лимитов Gemini API с причинами 429, расходами, Priority, Batch и правилами повторов

Ошибка 429 RESOURCE_EXHAUSTED не означает автоматически, что проект «исчерпал RPM своего уровня». Gemini API проверяет несколько ограничений независимо: число запросов, объём входных токенов, дневную квоту, специальные ограничения модели и, для некоторых платных аккаунтов, скорость расходов.

Уровень использования определяет, к какому классу лимитов может относиться платёжный аккаунт. Точные действующие значения для проекта и модели Google предлагает смотреть в AI Studio. Поэтому старые таблицы с универсальными «15 RPM на Free» или «300 RPM на Tier 1» нельзя использовать как текущий договор о ёмкости.

Начните с фактов о неудачном запросе

До изменения кода зафиксируйте:

  • API key и проект, которому он принадлежит;
  • связанный платёжный аккаунт и текущий уровень использования;
  • полный идентификатор модели (model ID) и версию API;
  • обычный это запрос, Priority inference или Batch API;
  • время, текст ошибки и характер нагрузки перед сбоем.

Затем откройте AI Studio. На странице Projects или API keys подтвердите проект и tier. В Dashboard откройте Rate Limit для той же модели, а в Usage — использование того же проекта за нужный период. Сравнение другого ключа бесполезно, если он принадлежит другому проекту.

Ключи не получают отдельную квоту. Все ключи одного проекта расходуют общие лимиты проекта. Проекты, связанные с одним платёжным аккаунтом Google Cloud (Cloud Billing account), наследуют его уровень и общий предел расходов. Создание новых ключей не увеличивает пропускную способность.

Пошаговая диагностика 429 в Gemini API от данных запроса и AI Studio до ограничения и правильного действия
Пошаговая диагностика 429 в Gemini API от данных запроса и AI Studio до ограничения и правильного действия

Что сегодня означает Free, Tier 1, Tier 2 и Tier 3

По состоянию на 2 сентября 2026 года официальный раздел о биллинге Gemini API задаёт следующие условия. Они описывают квалификацию и предел платёжного аккаунта, но не гарантируют RPM конкретной модели.

УровеньУсловиеМесячный предел аккаунтаРасход за скользящие 10 минут
FreeАктивный проект или пробный доступНе применяетсяНе применяется
Tier 1Подключён активный платёжный аккаунт$250$10
Tier 2Оплачено $100 и прошло 3 дня с первого успешного платежа$2 000$200
Tier 3Оплачено $1 000 и прошло 30 дней с первого успешного платежа$20 000–$100 000+$200

Для Tier 2 и Tier 3 учитываются совокупные расходы на сервисы Google Cloud по проектам, привязанным к платёжному аккаунту, а не только использование одного ключа Gemini API. После выполнения условий повышение происходит автоматически с учётом времени обработки и проверки. Переход Free → Tier 1 обычно действует сразу, последующие — в течение десяти минут. Фактический результат проверяется на странице Projects.

Отдельно действует ограничение расходов в скользящем десятиминутном окне. Google отмечает, что его применение зависит также от истории платежей и состояния аккаунта. Превышение этого ограничения возвращает 429, даже если RPM и входные TPM ещё не исчерпаны.

Какие показатели ограничивают запросы

Текущая страница ограничений называет три обычных измерения:

  • RPM — запросы в минуту. Ограничение чувствительно к коротким всплескам и параллельности.
  • Входные TPM — входные токены в минуту. Длинный контекст может исчерпать TPM при небольшом числе запросов.
  • RPD — запросы в сутки. Сброс происходит в полночь по тихоокеанскому времени.

У конкретной модели могут действовать IPM для изображений или TPD для токенов в сутки. Проверяется каждое применимое измерение. Остаток RPM ничего не говорит об остатке TPM, RPD, IPM, TPD или десятиминутного расхода.

Если AI Studio показывает RPM и входные TPM, верхнюю оценку можно получить так:

запросов в минуту ≈ min(активный RPM, floor(активный TPM / среднее число входных токенов))

Это расчёт для планирования, а не новая квота Google. Он показывает, почему добавление длинных документов сокращает фактическое число запросов без изменения tier. Оставляйте запас: Google прямо пишет, что указанные лимиты не гарантированы, а доступная ёмкость может меняться.

Priority и Batch нельзя считать по обычному RPM

Priority inference имеет собственные ограничения. Google указывает значение по умолчанию 0,3 от стандартного лимита той же модели и уровня; при этом Priority-трафик учитывается и в общем интерактивном трафике. Стандартный показатель из Dashboard нельзя без проверки переносить на Priority.

Batch API отделён от обычных запросов. Сейчас опубликованы предел 100 параллельных Batch-запросов, 2 ГБ на входной файл, 20 ГБ файлового хранилища и отдельное число токенов в очереди (enqueued tokens) для модели и уровня. Таблица моделей быстро меняется, поэтому используйте актуальный раздел Batch, а не сохранённую копию.

Выберите действие по признакам нагрузки

НаблюдениеВероятное ограничениеЧто менять
429 появляется после резкого всплескаRPMОбщая очередь проекта, ограничение параллельности, ограниченная по числу попыток задержка
Запросов мало, но контекст большойВходные TPMУбрать повторяющийся контекст, сократить параллельные большие запросы, получать только нужные данные
Вызовы прекращаются после длительной работы в течение дняRPD или TPDДождаться указанного сброса либо оценить подходящий платный уровень
Дорогие запросы сгруппированы в десять минутЛимит скорости расходовДождаться окна, уменьшить контекст/вывод или запросить повышение лимита
Ошибка только у PriorityЛимит PriorityПроверить отдельное значение; обычный режим использовать только при подходящих требованиях к задержке
Batch-задача не ставится в очередьПараллельные задания или enqueued tokensДождаться завершения, уменьшить пакет, проверить таблицу модели
На панели Usage низкие значения, но 429 сохраняетсяНеверный проект/модель, уровень ещё не обновлён или ёмкость измениласьПовторно проверить соответствие ключа проекту, model ID и tier; затем подать запрос на увеличение с этими данными

Новый уровень не исправит выбор не того проекта, более строгую предварительную версию модели или одновременный повтор всех процессов.

Независимые ограничения Gemini API, их взаимодействие, текущие значения AI Studio и выбор действия при 429
Независимые ограничения Gemini API, их взаимодействие, текущие значения AI Studio и выбор действия при 429

Повторяйте только временные ошибки

В официальном руководстве по устранению неполадок Google рекомендует экспоненциальную задержку со случайным разбросом (jitter) и максимальным числом попыток для временных 429 и 503. Некоторые официальные SDK уже повторяют временные ошибки автоматически; проверьте это до добавления второго механизма.

Такая задержка помогает переждать окно, но не повышает RPM, TPM, RPD или предел расходов. Если процессы повторяют запрос одновременно, они создают новый всплеск. Ограничитель должен учитывать общую квоту проекта, а не работать отдельно для каждого ключа.

Ошибки 400 и 403 не следует повторять как 429: они обычно указывают на параметры, версию модели, аутентификацию или права. Отдельная инструкция по ошибкам Gemini API поможет разделить случаи.

Зафиксируйте состояние, а не вечную таблицу

Для решения о производственной нагрузке сохраните дату, платёжный аккаунт, проект, tier, полный model ID, вид запроса, действующие RPM/TPM/RPD или специальные значения, средний вход, параллельность и пиковый расход за десять минут. Эту запись можно пересчитать после изменения модели или условий.

Если задача ограничена бесплатной квотой прототипа, используйте руководство по бесплатной квоте. Эта статья нужна тогда, когда требуется оценить эффективную ёмкость и объяснить 429 на любом tier.

Уровень показывает квалификацию, AI Studio — текущее состояние проекта, а конкретный неудачный запрос — причину для диагностики. Такое разделение остаётся полезным после очередного изменения лимитов.