AIFreeAPI Logo

Модели Gemini для текста в 2026 году: Flash, Flash-Lite или Pro

К
4 min readРуководства по API

Для нового проекта начните со стабильной Gemini 3.7 Flash, проверяемые массовые задачи отдайте Flash-Lite, а 3.1 Pro Preview испытывайте только там, где её выигрыш оправдывает риск Preview.

Карта актуальных текстовых моделей Gemini 3.x с их статусами, ценами и назначением на август 2026 года

На 25 августа 2026 года разумный базовый выбор для новой интеграции Gemini Developer API — gemini-3.7-flash. Это новейшая стабильная Flash-модель для программирования, агентных сценариев и многошагового выполнения. Для классификации, извлечения данных, перевода и других массовых задач с проверяемым результатом сначала оцените gemini-3.5-flash-lite. gemini-3.1-pro-preview стоит подключать не из-за слова Pro, а только после измеримого выигрыша на сложных задачах.

Речь идёт о моделях общего назначения, принимающих текст, изображения, видео, аудио и PDF и возвращающих текст. Генерация изображений, Live API, TTS, embeddings и подписки приложения Gemini — другие поверхности.

Карта выбора

СитуацияПервая модель для проверкиГлавная оговорка
Новый сервис, код, несколько инструментовgemini-3.7-flashGA и актуальный универсальный вариант
Стабильная система на 3.6gemini-3.6-flash плюс параллельный тест 3.73.6 остаётся полезным резервом
Извлечение, классификация, перевод, маршрутизацияgemini-3.5-flash-liteРезультат должен быть проверяемым
Старый дешёвый конвейер на 3.1 Litegemini-3.1-flash-lite с планом переходаТекущая цена ниже, но поколение старше
Сложные рассуждения, код, custom tools3.7 против gemini-3.1-pro-previewPro — Preview, её преимущество надо доказать
Любая основная модель 2.5Начать миграциюСамая ранняя дата отключения — 16 октября 2026 года

Полезная архитектура не обязана выбирать один endpoint навсегда. Простые запросы со схемой проверки можно отправлять Flash-Lite, а неоднозначные, неудачные или многошаговые — повышать до 3.7 Flash.

Политика маршрутизации проверяемых задач в Flash-Lite и сложных запросов в Gemini 3.7 Flash
Политика маршрутизации проверяемых задач в Flash-Lite и сложных запросов в Gemini 3.7 Flash

Чем различаются актуальные модели

Официальный список помечает 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite и 3.1 Flash-Lite как стабильные. 3.1 Pro и 3 Flash остаются Preview.

3.7 Flash — кандидат по умолчанию

Страница 3.7 Flash указывает 1 048 576 входных и 65 536 выходных токенов. Поддерживаются caching, code execution, function calling, structured output, grounding и URL context. Google позиционирует модель для кода и агентных циклов, но это описание поставщика, а не независимый тест.

В продакшене сравнивайте долю успешных ответов с первой попытки, точность tool calls, P95 задержки и общее число токенов на принятый результат.

3.6 и 3.5 Flash — стабильные, но с разной ролью

gemini-3.6-flash — подходящий GA-резерв для существующих систем. До конца 2026 года её стандартная промоцена совпадает с 3.7. gemini-3.5-flash также GA и имеет те же опубликованные пределы контекста, но в текущем обзоре названа legacy-моделью и по стандартному тарифу стоит дороже 3.7/3.6.

Flash-Lite экономит на ограниченных задачах

Gemini 3.5 Flash-Lite рассчитана на низкую задержку, большой поток, разбор документов, простое извлечение и подзадачи агентов. Одинаковое окно 1M/65k не означает одинаковую способность рассуждать.

Flash-Lite особенно уместна, когда есть JSON Schema, фиксированный набор меток или обязательные поля. Если ответ требует повторной попытки или неверно вызывает инструмент, низкая цена токена быстро перестаёт быть экономией.

gemini-3.1-flash-lite сегодня дешевле, но старше. В таблице вывода из эксплуатации Google уже указывает 3.5 Flash-Lite как замену, поэтому новая долгоживущая система должна учитывать будущую миграцию.

3.1 Pro Preview — для доказанного исключения

3.1 Pro Preview ориентирована на сложные задачи, software engineering и точное использование инструментов; есть отдельный ID gemini-3.1-pro-preview-customtools. Но Preview может изменить поведение, лимиты или контракт. Сравнивайте её с 3.7 только на задачах, где ошибка Flash действительно дорога.

Стандартные цены API

По официальной странице цен суммы ниже указаны в долларах за 1 млн токенов стандартного платного inference. Выход включает thinking tokens; Batch, Flex и Priority считаются отдельно.

МодельВходВыход с thinkingСтатус
3.7 Flash$0.75$3.75GA; промоцена до 31.12.2026, затем заявлено $1.50 / $7.50
3.6 Flash$0.75$3.75GA; тот же срок акции
3.5 Flash$1.50$9.00GA, legacy
3.5 Flash-Lite$0.30$2.50GA
3.1 Flash-Lite$0.25 для текста/изображений/видео$1.50GA, старшее поколение
3.1 Pro Preview$2.00 до 200k prompt; $4.00 выше$12.00; $18.00Preview

Считайте не цену входа, а стоимость принятой задачи: вход + thinking/выход + инструменты + повторы + хранение cache. Фиксируйте success rate, P95, токены и повторы вместе.

Бесплатный уровень доступен не одинаково для всех моделей, проектов и регионов. Страница цен предупреждает, что данные free tier могут использоваться для улучшения продуктов Google; для paid tier указано обратное.

Thinking level — часть конфигурации теста

Документация thinking указывает: 3.7 Flash по умолчанию использует medium; доступны low, medium и high. 3.6 Flash и 3.5 Flash-Lite также поддерживают minimal. 3.1 Pro Preview по умолчанию использует high.

При сравнении зафиксируйте уровень. Иначе меняются одновременно модель и бюджет рассуждений. Для извлечения начните с low/minimal, для сложного кода и tool use повышайте уровень, контролируя billed output и таймауты. Руководство по 3.7 требует убрать temperature, top_p и top_k, заменить thinking_budget на thinking_level и проверить правила function responses.

Миграция с 2.5

Официальный график сообщает, что 2.0 Flash и Flash-Lite отключены 1 июня 2026 года. Для 2.5 Pro, 2.5 Flash и 2.5 Flash-Lite указана самая ранняя дата отключения 16 октября 2026 года; точная дата может быть уточнена.

Проверьте ID в коде, переменных окружения, очередях и конфигурации. Соберите фиксированный набор нормальных, длинных, tool-failure и structured-output примеров. Обновите параметры 3.x и thought signatures. Переключайте модель конфигурацией, начните с canary и сохраните rollback. После запуска сравнивайте качество, задержку и стоимость принятой задачи.

Для нового проекта используйте 3.7 Flash как базу, Flash-Lite — для повторяемых проверяемых операций, а Pro Preview — для небольшого набора действительно трудных запросов. Это превращает выбор модели в управляемую политику с резервом, а не в ставку на одно название.

Практический чек-лист выбора Gemini 3.x по качеству, задержке, стоимости принятой задачи и готовности к миграции
Практический чек-лист выбора Gemini 3.x по качеству, задержке, стоимости принятой задачи и готовности к миграции