Gemini 3.5 Transcribe — не ещё один универсальный Gemini с аудиовходом, а отдельная модель распознавания речи. Для готовой записи Google даёт gemini-3.5-transcribe и Interactions API. Для микрофона или непрерывного потока — gemini-3.5-transcribe-live и двунаправленное соединение Live API.
Результат обеих моделей — текст. У Gemini 3.5 Live Translate другая задача: принять речь и вернуть перевод в виде речи. Подмена одного продукта другим приводит к неверному model ID, иной цене и неподходящему формату результата.
Модель представлена 26 августа 2026 года. В официальном анонсе доступ для разработчиков и предприятий назван public preview. Прототипировать уже можно, но для production нужны управляемая конфигурация модели, метрики ошибок и путь отката.
Выбор начинается не с качества, а с источника аудио
Готовый файл удобен тем, что сервис видит запись целиком и может вернуть итоговую расшифровку с дополнительной разметкой. Максимальная длительность сейчас — один час. Если включить определение говорящих или временные метки по словам, предел снижается до 30 минут.
Live-вариант нужен, когда текст должен появляться во время разговора. Текущий лимит — десять минут на сессию. В этом режиме нет word-level timestamps и speaker diarization, поэтому он подходит для субтитров и оперативного интерфейса, но не заменяет полностью размеченный протокол встречи.
| Что требуется | Подходящий путь | Что проверить заранее |
|---|---|---|
| Расшифровать MP3 или запись звонка | gemini-3.5-transcribe | Длительность, язык, режим текста |
| Разделить участников и получить время каждого слова | та же модель, verbatim | Не более 30 минут; 3+ говорящих — experimental |
| Показывать текст с микрофона | gemini-3.5-transcribe-live | Переподключение каждые 10 минут и финализация фраз |
| Получить чистый конспект из диктовки | smart на выбранном endpoint | Текст будет отредактирован, а не сохранён дословно |
| Перевести речь и воспроизвести перевод | Gemini 3.5 Live Translate | Это отдельная speech-to-speech модель |
Страница модели заявляет автоматическое распознавание более 85 языков и переключение языков между репликами. Для русского опубликован код ru-RU. Если язык известен, лучше передать его явно и сравнить качество с автоопределением на собственных записях.

Verbatim сохраняет запись, smart создаёт редакторскую версию
verbatim используется по умолчанию. Он оставляет «э-э», повторы, незаконченные фразы и исправления говорящего. Такой текст нужен, если важна проверяемость: интервью, контроль качества, юридическое согласование или синхронизация субтитров.
smart удаляет слова-паразиты, объединяет самоисправления, ставит пунктуацию и форматирует даты, числа, списки и абзацы. Это полезно для заметок и диктовки. Но результат уже не является точным протоколом: модель принимает редакторские решения.
Есть и техническая несовместимость. Руководство по транскрибации запрещает сочетать smart с timestamp_granularities и diarization_mode. Для сценария «архив + удобный конспект» безопаснее сначала получить verbatim с разметкой, а затем отдельно создать читаемую версию, сохранив связь с исходной записью.
Пример для записанного файла
Google рекомендует загрузить файл через Files API и передать URI в Interactions API. Ключ должен находиться в переменной окружения, а не в исходном коде или клиентском JavaScript.
pythonfrom google import genai client = genai.Client() audio = client.files.upload(file="call.mp3") result = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio.uri, "mime_type": audio.mime_type, } ], generation_config={ "transcription_config": { "language_codes": ["ru-RU"], "custom_vocabulary": [ "Gemini", "Interactions API", "Сколково", ], "mode": {"type": "smart"}, } }, ) print(result.output_text)
custom_vocabulary помогает с фамилиями, брендами, кодами товаров и профессиональными сокращениями. Допустимо до 1 000 элементов, однако Google пишет, что обычно лучшие результаты получают со списком до 100 действительно важных терминов. Обычные слова только усложняют поддержку словаря.
Для протокола с говорящими и временем измените режим:
python"mode": { "type": "verbatim", "timestamp_granularities": ["word"], "diarization_mode": "speaker", }
Полный текст находится в output_text, а детализация по словам — в annotations ответа. Документация указывает до восьми говорящих, но распределение для трёх и более помечено как experimental. Поэтому совещание с восемью участниками нельзя считать автоматически решённой задачей: нужна ручная выборка сложных фрагментов с перебиваниями и похожими голосами.
Live-текст имеет предварительное и финальное состояние
Документация Live API отделяет этот endpoint от голосового агента. Он принимает сырой 16-bit PCM и возвращает транскрипцию; рассуждение, инструменты и голосовой ответ не входят в контракт Transcribe Live.
В интерфейсе interim-текст можно показывать сразу, но нельзя считать окончательным. Новая порция аудио способна изменить последние слова. Сохранять в базу, запускать поиск, формировать задачу или отправлять уведомление следует только после final-события.
Продумайте границу десятиминутной сессии: зафиксируйте последний подтверждённый фрагмент, откройте новое соединение и удалите возможный дубль на стыке. Если после эфира нужен протокол с участниками и временем, параллельно сохраните аудио с законным согласием и обработайте его unary-моделью. Это улучшает итог, но добавляет требования к хранению и удалению данных.
Сколько стоит минута
На 27 августа 2026 года официальная страница цен показывает бесплатный уровень и следующие расчётные ставки платного standard tier:
| Модель | Аудиовход | Текстовый выход | Примерная суммарная цена |
|---|---|---|---|
| Recorded Transcribe | ~$0.003/мин | ~$0.002/мин | ~$0.005/мин |
| Transcribe Live | ~$0.005/мин | ~$0.004/мин | ~$0.009/мин |
Часовая запись даёт около $0.30 модельных расходов. Час live-аудио — около $0.54, хотя его придётся разделить на несколько сессий. Это оценка по токенам, а не фиксированный тариф: загрузка, хранение, повторы, постобработка и проверка человеком оплачиваются отдельно.
В таблице Google также указано, что данные бесплатного уровня могут использоваться для улучшения продуктов, а данные paid tier — нет. Для звонков клиентов, медицины, права и коммерческой тайны этого поля недостаточно: проверьте действующие условия, регион, согласие, срок хранения, доступ и процедуру удаления.

Проверяйте не средний WER, а ошибки, которые ломают ваш процесс
Google публикует средний WER 4.0% для streaming и 2.6% для non-streaming со ссылкой на измерения Artificial Analysis. Также заявлено ускорение time to final на 70% относительно Chirp 3 и отдельные результаты FLEURS. Это ориентиры производителя, а не наша проверка и не гарантия для русской речи в шумном офисе.
Соберите разрешённый тестовый набор: чистая и шумная запись, один и несколько участников, перебивания, фамилии, суммы, номера заказов, англоязычные термины и длинные паузы. Сравните verbatim и smart, автоопределение и ru-RU, пустой и точечный словарь. Отдельно измеряйте цифры, speaker attribution, задержку final, дубли после reconnect и стоимость принятой расшифровки.
Для проверяемого архива начните с recorded + verbatim. Для диктовки — со smart. Для субтитров — с live и полноценной обработкой состояний. Такая последовательность выбирает модель по контракту результата, а не по рекламному числу.



