Una grabación ya terminada se procesa con gemini-3.5-transcribe mediante Interactions API. Un micrófono o flujo que debe producir texto mientras alguien habla se conecta a gemini-3.5-transcribe-live mediante Live API. Comparten la tarea de voz a texto, pero no el mismo contrato.
Gemini 3.5 Live Translate es otro producto: recibe voz y devuelve voz traducida. Tampoco conviene confundir el endpoint dedicado con pedir a un modelo Gemini general que analice un audio, lo resuma o responda preguntas. Transcribe está orientado a un resultado específico y configurable: la transcripción.
Google anunció Gemini 3.5 Transcribe el 26 de agosto de 2026. El anuncio oficial describe el acceso de desarrolladores y empresas como public preview. Se puede evaluar hoy, pero una integración de producción necesita configuración reversible, observabilidad y una prueba propia antes de prometer estabilidad.
El origen del audio decide el endpoint
El modelo para grabaciones ve el archivo completo y puede devolver información por palabra. Admite hasta una hora por petición. Al activar diarización de hablantes o marcas de tiempo por palabra, el límite actual baja a 30 minutos.
El modelo Live devuelve texto incremental a través de una conexión bidireccional. Su límite actual es diez minutos por sesión. No incluye diarización ni marcas por palabra.
| Resultado necesario | Ruta | Límite que cambia la decisión |
|---|---|---|
| Transcribir un MP3, reunión o llamada | gemini-3.5-transcribe + Interactions API | Hasta 1 hora |
| Obtener hablante y tiempo por palabra | el mismo modelo en verbatim | Hasta 30 minutos; 3+ hablantes es experimental |
| Mostrar subtítulos desde un micrófono | gemini-3.5-transcribe-live + Live API | 10 minutos por sesión |
| Convertir un dictado en texto legible | modo smart | No se combina con hablantes ni tiempos |
| Escuchar una traducción en otro idioma | Gemini 3.5 Live Translate | Modelo speech-to-speech distinto |
La ficha del modelo indica detección automática de más de 85 idiomas y cambio de idioma entre intervenciones. Hay un detalle relevante para España: la lista publicada incluye es-419 y es-US, pero no es-ES. Esa ausencia no demuestra que el castellano de España falle, pero tampoco permite afirmar que Google publica soporte explícito para ese código. Si el audio procede de España, prueba autodetección con voces reales y revisa la lista antes de fijar un código.

Smart no es una transcripción literal con mejor puntuación
El modo verbatim, que es el predeterminado, conserva muletillas, repeticiones, frases inacabadas y autocorrecciones. Es la opción adecuada para entrevistas, control de calidad, revisión legal, alineación de subtítulos o cualquier proceso que deba volver al audio original.
El modo smart elimina disfluencias, resuelve correcciones dentro de la frase y aplica formato a fechas, importes, listas, párrafos y mayúsculas. Convierte una idea hablada en una copia más cómoda de leer, pero toma decisiones editoriales. No debe etiquetarse como registro palabra por palabra.
La guía de transcripción especifica que smart no es compatible con timestamp_granularities ni diarization_mode. Si necesitas un acta verificable y un resumen limpio, crea primero una base verbatim con anotaciones y genera después una segunda versión, manteniendo la referencia al audio.
Transcribir un archivo con Python
El flujo documentado carga el audio con Files API y pasa su URI a Interactions API. La clave se obtiene del entorno del servidor; no debe insertarse en código público ni enviarse al navegador.
pythonfrom google import genai client = genai.Client() audio = client.files.upload(file="entrevista.mp3") interaction = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio.uri, "mime_type": audio.mime_type, } ], generation_config={ "transcription_config": { "language_codes": [], "custom_vocabulary": [ "Gemini", "Interactions API", "Alcalá de Henares", ], "mode": {"type": "smart"}, } }, ) print(interaction.output_text)
El array vacío deja que el modelo detecte el idioma, una decisión prudente mientras no haya es-ES en la lista publicada. Para audio latinoamericano o de Estados Unidos, compara es-419 o es-US con autodetección según la voz real, no según la ubicación del servidor.
custom_vocabulary sirve para nombres propios, marcas, referencias de producto y siglas. El máximo es 1.000 términos, aunque Google afirma que normalmente obtiene mejores resultados con hasta 100 términos seleccionados. Incluye solo palabras cuyo error cambie el resultado.
Para obtener hablantes y tiempo por palabra, cambia a verbatim:
python"mode": { "type": "verbatim", "timestamp_granularities": ["word"], "diarization_mode": "speaker", }
El texto completo permanece en interaction.output_text. Los datos de inicio, fin y speaker se encuentran en las annotations de la respuesta, que deben recorrerse expresamente. La documentación admite hasta ocho hablantes, pero marca la atribución de tres o más como experimental. Una mesa redonda con voces solapadas sigue necesitando revisión específica.
En directo hay texto provisional y texto confirmado
La documentación de Live Transcription distingue este pipeline de un agente conversacional. Recibe audio raw PCM de 16 bits y devuelve texto. El contrato no incluye razonar, ejecutar herramientas ni responder con voz.
Los resultados interim cambian rápidamente mientras la persona habla. Son útiles para un subtítulo temporal, pero no para guardar un acta, abrir un ticket o enviar una alerta. Esas acciones deben partir del resultado final, porque el siguiente fragmento de audio puede corregir las últimas palabras.
También hay que diseñar el corte de diez minutos: guardar el último offset final, abrir una sesión nueva y eliminar solapamientos tras una reconexión. Si una reunión requiere subtítulos en vivo y un acta final con hablantes y tiempos, puede conservarse el audio con consentimiento y procesarlo después con el modelo de archivos. La mejora añade obligaciones de almacenamiento, acceso y borrado.

Precio por minuto y coste real
A 27 de agosto de 2026, la página de precios de Gemini Developer API muestra free tier y estas estimaciones del paid standard tier:
| Ruta | Entrada de audio | Salida de texto | Estimación combinada |
|---|---|---|---|
| Transcribe para archivos | ~$0.003/min | ~$0.002/min | ~$0.005/min |
| Transcribe Live | ~$0.005/min | ~$0.004/min | ~$0.009/min |
Una grabación de una hora representa aproximadamente $0.30 de uso del modelo. Una hora acumulada de Live ronda $0.54, dividida en varias sesiones con el límite actual. Carga, almacenamiento, reintentos, monitorización, postproceso y revisión humana no están incluidos.
La misma tabla indica que el contenido enviado en free tier se utiliza para mejorar productos de Google, mientras que el de paid tier no. En llamadas de clientes, salud, asuntos legales o información interna, revisa además términos vigentes, región, consentimiento, retención, control de acceso y borrado.
Convierte el WER publicado en una prueba útil
Google publica un WER medio de 4,0% para streaming y 2,6% para non-streaming, medido por Artificial Analysis. También informa de una mejora del 70% en time to final frente a Chirp 3 y de resultados multilingües FLEURS. Son cifras comunicadas por el proveedor, no una prueba realizada aquí ni una garantía para acentos de España o audio telefónico.
Crea un conjunto pequeño de grabaciones permitidas con sala limpia y ruido, una y varias voces, solapamiento, nombres, importes, códigos de pedido, cambio de idioma y pausas largas. Compara verbatim y smart, autodetección y códigos publicados, vocabulario vacío y dirigido. Mide por separado números, hablantes, latencia final, duplicados al reconectar y coste por transcripción aceptada.
Para un registro auditable, empieza con archivos + verbatim. Para dictado legible, prueba smart. Para subtítulos durante la conversación, valida Live y su gestión de estado. La salida que necesita el lector debe decidir la arquitectura antes que una cifra media de benchmark.



