AIFreeAPI Logo

Gemini 3.5 Transcribe: как выбрать API для записи и прямого эфира

A
4 min readAPI Guides

Для готового аудиофайла нужен gemini-3.5-transcribe, для микрофона — gemini-3.5-transcribe-live. Режим и дополнительные метки выбираются по назначению текста, а не по названию модели.

Русская схема выбора Gemini 3.5 Transcribe: файл или live-поток, verbatim или smart, interim и final, ограничения, стоимость и границы данных

Gemini 3.5 Transcribe — не ещё один универсальный Gemini с аудиовходом, а отдельная модель распознавания речи. Для готовой записи Google даёт gemini-3.5-transcribe и Interactions API. Для микрофона или непрерывного потока — gemini-3.5-transcribe-live и двунаправленное соединение Live API.

Результат обеих моделей — текст. У Gemini 3.5 Live Translate другая задача: принять речь и вернуть перевод в виде речи. Подмена одного продукта другим приводит к неверному model ID, иной цене и неподходящему формату результата.

Модель представлена 26 августа 2026 года. В официальном анонсе доступ для разработчиков и предприятий назван public preview. Прототипировать уже можно, но для production нужны управляемая конфигурация модели, метрики ошибок и путь отката.

Выбор начинается не с качества, а с источника аудио

Готовый файл удобен тем, что сервис видит запись целиком и может вернуть итоговую расшифровку с дополнительной разметкой. Максимальная длительность сейчас — один час. Если включить определение говорящих или временные метки по словам, предел снижается до 30 минут.

Live-вариант нужен, когда текст должен появляться во время разговора. Текущий лимит — десять минут на сессию. В этом режиме нет word-level timestamps и speaker diarization, поэтому он подходит для субтитров и оперативного интерфейса, но не заменяет полностью размеченный протокол встречи.

Что требуетсяПодходящий путьЧто проверить заранее
Расшифровать MP3 или запись звонкаgemini-3.5-transcribeДлительность, язык, режим текста
Разделить участников и получить время каждого словата же модель, verbatimНе более 30 минут; 3+ говорящих — experimental
Показывать текст с микрофонаgemini-3.5-transcribe-liveПереподключение каждые 10 минут и финализация фраз
Получить чистый конспект из диктовкиsmart на выбранном endpointТекст будет отредактирован, а не сохранён дословно
Перевести речь и воспроизвести переводGemini 3.5 Live TranslateЭто отдельная speech-to-speech модель

Страница модели заявляет автоматическое распознавание более 85 языков и переключение языков между репликами. Для русского опубликован код ru-RU. Если язык известен, лучше передать его явно и сравнить качество с автоопределением на собственных записях.

Карта проверки маршрута Gemini 3.5 Transcribe от источника аудио и требуемого результата до API, model ID, режима, Python-настройки, live-состояний, качества и цены
Карта проверки маршрута Gemini 3.5 Transcribe от источника аудио и требуемого результата до API, model ID, режима, Python-настройки, live-состояний, качества и цены

Verbatim сохраняет запись, smart создаёт редакторскую версию

verbatim используется по умолчанию. Он оставляет «э-э», повторы, незаконченные фразы и исправления говорящего. Такой текст нужен, если важна проверяемость: интервью, контроль качества, юридическое согласование или синхронизация субтитров.

smart удаляет слова-паразиты, объединяет самоисправления, ставит пунктуацию и форматирует даты, числа, списки и абзацы. Это полезно для заметок и диктовки. Но результат уже не является точным протоколом: модель принимает редакторские решения.

Есть и техническая несовместимость. Руководство по транскрибации запрещает сочетать smart с timestamp_granularities и diarization_mode. Для сценария «архив + удобный конспект» безопаснее сначала получить verbatim с разметкой, а затем отдельно создать читаемую версию, сохранив связь с исходной записью.

Пример для записанного файла

Google рекомендует загрузить файл через Files API и передать URI в Interactions API. Ключ должен находиться в переменной окружения, а не в исходном коде или клиентском JavaScript.

python
from google import genai client = genai.Client() audio = client.files.upload(file="call.mp3") result = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio.uri, "mime_type": audio.mime_type, } ], generation_config={ "transcription_config": { "language_codes": ["ru-RU"], "custom_vocabulary": [ "Gemini", "Interactions API", "Сколково", ], "mode": {"type": "smart"}, } }, ) print(result.output_text)

custom_vocabulary помогает с фамилиями, брендами, кодами товаров и профессиональными сокращениями. Допустимо до 1 000 элементов, однако Google пишет, что обычно лучшие результаты получают со списком до 100 действительно важных терминов. Обычные слова только усложняют поддержку словаря.

Для протокола с говорящими и временем измените режим:

python
"mode": { "type": "verbatim", "timestamp_granularities": ["word"], "diarization_mode": "speaker", }

Полный текст находится в output_text, а детализация по словам — в annotations ответа. Документация указывает до восьми говорящих, но распределение для трёх и более помечено как experimental. Поэтому совещание с восемью участниками нельзя считать автоматически решённой задачей: нужна ручная выборка сложных фрагментов с перебиваниями и похожими голосами.

Live-текст имеет предварительное и финальное состояние

Документация Live API отделяет этот endpoint от голосового агента. Он принимает сырой 16-bit PCM и возвращает транскрипцию; рассуждение, инструменты и голосовой ответ не входят в контракт Transcribe Live.

В интерфейсе interim-текст можно показывать сразу, но нельзя считать окончательным. Новая порция аудио способна изменить последние слова. Сохранять в базу, запускать поиск, формировать задачу или отправлять уведомление следует только после final-события.

Продумайте границу десятиминутной сессии: зафиксируйте последний подтверждённый фрагмент, откройте новое соединение и удалите возможный дубль на стыке. Если после эфира нужен протокол с участниками и временем, параллельно сохраните аудио с законным согласием и обработайте его unary-моделью. Это улучшает итог, но добавляет требования к хранению и удалению данных.

Сколько стоит минута

На 27 августа 2026 года официальная страница цен показывает бесплатный уровень и следующие расчётные ставки платного standard tier:

МодельАудиовходТекстовый выходПримерная суммарная цена
Recorded Transcribe~$0.003/мин~$0.002/мин~$0.005/мин
Transcribe Live~$0.005/мин~$0.004/мин~$0.009/мин

Часовая запись даёт около $0.30 модельных расходов. Час live-аудио — около $0.54, хотя его придётся разделить на несколько сессий. Это оценка по токенам, а не фиксированный тариф: загрузка, хранение, повторы, постобработка и проверка человеком оплачиваются отдельно.

В таблице Google также указано, что данные бесплатного уровня могут использоваться для улучшения продуктов, а данные paid tier — нет. Для звонков клиентов, медицины, права и коммерческой тайны этого поля недостаточно: проверьте действующие условия, регион, согласие, срок хранения, доступ и процедуру удаления.

Схема безопасной проверки и эксплуатации Gemini 3.5 Transcribe с процессами доступа, согласия и удаления, состояниями live-сессии, метриками, стоимостью и планом отката
Схема безопасной проверки и эксплуатации Gemini 3.5 Transcribe с процессами доступа, согласия и удаления, состояниями live-сессии, метриками, стоимостью и планом отката

Проверяйте не средний WER, а ошибки, которые ломают ваш процесс

Google публикует средний WER 4.0% для streaming и 2.6% для non-streaming со ссылкой на измерения Artificial Analysis. Также заявлено ускорение time to final на 70% относительно Chirp 3 и отдельные результаты FLEURS. Это ориентиры производителя, а не наша проверка и не гарантия для русской речи в шумном офисе.

Соберите разрешённый тестовый набор: чистая и шумная запись, один и несколько участников, перебивания, фамилии, суммы, номера заказов, англоязычные термины и длинные паузы. Сравните verbatim и smart, автоопределение и ru-RU, пустой и точечный словарь. Отдельно измеряйте цифры, speaker attribution, задержку final, дубли после reconnect и стоимость принятой расшифровки.

Для проверяемого архива начните с recorded + verbatim. Для диктовки — со smart. Для субтитров — с live и полноценной обработкой состояний. Такая последовательность выбирает модель по контракту результата, а не по рекламному числу.