AIFreeAPI Logo

Gemini 3.5 Transcribe: qué API usar para archivos y audio en directo

A
5 min readAPI Guides

Usa gemini-3.5-transcribe para una grabación terminada y gemini-3.5-transcribe-live para un flujo de micrófono. Después decide si necesitas fidelidad literal, texto limpio, hablantes o tiempos.

Guía visual de Gemini 3.5 Transcribe en español con rutas de archivo y directo, modos, Python, estados provisional y final, precios, códigos de idioma, datos y evaluación

Una grabación ya terminada se procesa con gemini-3.5-transcribe mediante Interactions API. Un micrófono o flujo que debe producir texto mientras alguien habla se conecta a gemini-3.5-transcribe-live mediante Live API. Comparten la tarea de voz a texto, pero no el mismo contrato.

Gemini 3.5 Live Translate es otro producto: recibe voz y devuelve voz traducida. Tampoco conviene confundir el endpoint dedicado con pedir a un modelo Gemini general que analice un audio, lo resuma o responda preguntas. Transcribe está orientado a un resultado específico y configurable: la transcripción.

Google anunció Gemini 3.5 Transcribe el 26 de agosto de 2026. El anuncio oficial describe el acceso de desarrolladores y empresas como public preview. Se puede evaluar hoy, pero una integración de producción necesita configuración reversible, observabilidad y una prueba propia antes de prometer estabilidad.

El origen del audio decide el endpoint

El modelo para grabaciones ve el archivo completo y puede devolver información por palabra. Admite hasta una hora por petición. Al activar diarización de hablantes o marcas de tiempo por palabra, el límite actual baja a 30 minutos.

El modelo Live devuelve texto incremental a través de una conexión bidireccional. Su límite actual es diez minutos por sesión. No incluye diarización ni marcas por palabra.

Resultado necesarioRutaLímite que cambia la decisión
Transcribir un MP3, reunión o llamadagemini-3.5-transcribe + Interactions APIHasta 1 hora
Obtener hablante y tiempo por palabrael mismo modelo en verbatimHasta 30 minutos; 3+ hablantes es experimental
Mostrar subtítulos desde un micrófonogemini-3.5-transcribe-live + Live API10 minutos por sesión
Convertir un dictado en texto legiblemodo smartNo se combina con hablantes ni tiempos
Escuchar una traducción en otro idiomaGemini 3.5 Live TranslateModelo speech-to-speech distinto

La ficha del modelo indica detección automática de más de 85 idiomas y cambio de idioma entre intervenciones. Hay un detalle relevante para España: la lista publicada incluye es-419 y es-US, pero no es-ES. Esa ausencia no demuestra que el castellano de España falle, pero tampoco permite afirmar que Google publica soporte explícito para ese código. Si el audio procede de España, prueba autodetección con voces reales y revisa la lista antes de fijar un código.

Checklist de implementación y validación de Gemini 3.5 Transcribe que conecta origen del audio, modo, parámetros, observabilidad, coste, códigos de español, pruebas mínimas y protección de datos
Checklist de implementación y validación de Gemini 3.5 Transcribe que conecta origen del audio, modo, parámetros, observabilidad, coste, códigos de español, pruebas mínimas y protección de datos

Smart no es una transcripción literal con mejor puntuación

El modo verbatim, que es el predeterminado, conserva muletillas, repeticiones, frases inacabadas y autocorrecciones. Es la opción adecuada para entrevistas, control de calidad, revisión legal, alineación de subtítulos o cualquier proceso que deba volver al audio original.

El modo smart elimina disfluencias, resuelve correcciones dentro de la frase y aplica formato a fechas, importes, listas, párrafos y mayúsculas. Convierte una idea hablada en una copia más cómoda de leer, pero toma decisiones editoriales. No debe etiquetarse como registro palabra por palabra.

La guía de transcripción especifica que smart no es compatible con timestamp_granularities ni diarization_mode. Si necesitas un acta verificable y un resumen limpio, crea primero una base verbatim con anotaciones y genera después una segunda versión, manteniendo la referencia al audio.

Transcribir un archivo con Python

El flujo documentado carga el audio con Files API y pasa su URI a Interactions API. La clave se obtiene del entorno del servidor; no debe insertarse en código público ni enviarse al navegador.

python
from google import genai client = genai.Client() audio = client.files.upload(file="entrevista.mp3") interaction = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio.uri, "mime_type": audio.mime_type, } ], generation_config={ "transcription_config": { "language_codes": [], "custom_vocabulary": [ "Gemini", "Interactions API", "Alcalá de Henares", ], "mode": {"type": "smart"}, } }, ) print(interaction.output_text)

El array vacío deja que el modelo detecte el idioma, una decisión prudente mientras no haya es-ES en la lista publicada. Para audio latinoamericano o de Estados Unidos, compara es-419 o es-US con autodetección según la voz real, no según la ubicación del servidor.

custom_vocabulary sirve para nombres propios, marcas, referencias de producto y siglas. El máximo es 1.000 términos, aunque Google afirma que normalmente obtiene mejores resultados con hasta 100 términos seleccionados. Incluye solo palabras cuyo error cambie el resultado.

Para obtener hablantes y tiempo por palabra, cambia a verbatim:

python
"mode": { "type": "verbatim", "timestamp_granularities": ["word"], "diarization_mode": "speaker", }

El texto completo permanece en interaction.output_text. Los datos de inicio, fin y speaker se encuentran en las annotations de la respuesta, que deben recorrerse expresamente. La documentación admite hasta ocho hablantes, pero marca la atribución de tres o más como experimental. Una mesa redonda con voces solapadas sigue necesitando revisión específica.

En directo hay texto provisional y texto confirmado

La documentación de Live Transcription distingue este pipeline de un agente conversacional. Recibe audio raw PCM de 16 bits y devuelve texto. El contrato no incluye razonar, ejecutar herramientas ni responder con voz.

Los resultados interim cambian rápidamente mientras la persona habla. Son útiles para un subtítulo temporal, pero no para guardar un acta, abrir un ticket o enviar una alerta. Esas acciones deben partir del resultado final, porque el siguiente fragmento de audio puede corregir las últimas palabras.

También hay que diseñar el corte de diez minutos: guardar el último offset final, abrir una sesión nueva y eliminar solapamientos tras una reconexión. Si una reunión requiere subtítulos en vivo y un acta final con hablantes y tiempos, puede conservarse el audio con consentimiento y procesarlo después con el modelo de archivos. La mejora añade obligaciones de almacenamiento, acceso y borrado.

Espacio de trabajo de un desarrollador evaluando Gemini 3.5 Transcribe con archivos y audio en directo, modos verbatim y smart, códigos de español, precios, límites, estados Live y un plan de pruebas
Espacio de trabajo de un desarrollador evaluando Gemini 3.5 Transcribe con archivos y audio en directo, modos verbatim y smart, códigos de español, precios, límites, estados Live y un plan de pruebas

Precio por minuto y coste real

A 27 de agosto de 2026, la página de precios de Gemini Developer API muestra free tier y estas estimaciones del paid standard tier:

RutaEntrada de audioSalida de textoEstimación combinada
Transcribe para archivos~$0.003/min~$0.002/min~$0.005/min
Transcribe Live~$0.005/min~$0.004/min~$0.009/min

Una grabación de una hora representa aproximadamente $0.30 de uso del modelo. Una hora acumulada de Live ronda $0.54, dividida en varias sesiones con el límite actual. Carga, almacenamiento, reintentos, monitorización, postproceso y revisión humana no están incluidos.

La misma tabla indica que el contenido enviado en free tier se utiliza para mejorar productos de Google, mientras que el de paid tier no. En llamadas de clientes, salud, asuntos legales o información interna, revisa además términos vigentes, región, consentimiento, retención, control de acceso y borrado.

Convierte el WER publicado en una prueba útil

Google publica un WER medio de 4,0% para streaming y 2,6% para non-streaming, medido por Artificial Analysis. También informa de una mejora del 70% en time to final frente a Chirp 3 y de resultados multilingües FLEURS. Son cifras comunicadas por el proveedor, no una prueba realizada aquí ni una garantía para acentos de España o audio telefónico.

Crea un conjunto pequeño de grabaciones permitidas con sala limpia y ruido, una y varias voces, solapamiento, nombres, importes, códigos de pedido, cambio de idioma y pausas largas. Compara verbatim y smart, autodetección y códigos publicados, vocabulario vacío y dirigido. Mide por separado números, hablantes, latencia final, duplicados al reconectar y coste por transcripción aceptada.

Para un registro auditable, empieza con archivos + verbatim. Para dictado legible, prueba smart. Para subtítulos durante la conversación, valida Live y su gestión de estado. La salida que necesita el lector debe decidir la arquitectura antes que una cifra media de benchmark.