AIFreeAPI Logo

Gemini 3.5 Transcribe 사용법: 녹음 파일과 실시간 전사 API 선택

A
4 min readAPI Guides

완성된 녹음은 gemini-3.5-transcribe, 마이크 스트림은 gemini-3.5-transcribe-live로 처리합니다. 필요한 결과가 원문, 정리본, 화자, 시간 중 무엇인지 먼저 정해야 합니다.

Gemini 3.5 Transcribe 녹음 파일과 실시간 전사 API, 모델 기능, JavaScript, 화자와 시간, Live 흐름, 요금, 데이터, 품질 평가를 정리한 한국어 가이드

이미 녹음된 회의, 인터뷰, 콜 로그는 gemini-3.5-transcribe로 처리하고, 말하는 동안 자막을 보여줘야 하는 마이크 스트림은 gemini-3.5-transcribe-live로 처리합니다. 두 모델은 모두 음성을 텍스트로 바꾸지만 API와 반환 가능한 부가 정보가 다릅니다.

Gemini 3.5 Live Translate와도 구분해야 합니다. Live Translate는 한 언어의 음성을 다른 언어의 음성으로 바꾸는 모델입니다. Transcribe는 텍스트를 반환합니다. 일반 Gemini 모델에 오디오를 넣어 요약하거나 질문하는 방식도 전용 전사 endpoint와 같은 계약이 아닙니다.

Google은 2026년 8월 26일 Gemini 3.5 Transcribe를 발표했고 개발자 제공 상태를 public preview로 설명합니다. 바로 평가할 수는 있지만, production에서는 모델 ID를 설정으로 분리하고 preview 변경에 대비한 롤백과 모니터링을 갖춰야 합니다.

어떤 오디오를 언제 받는지가 첫 번째 기준입니다

녹음 파일 모델은 Interactions API를 사용합니다. 현재 요청당 최대 1시간을 처리할 수 있으며 화자 분리 또는 단어 단위 타임스탬프를 켜면 최대 30분으로 줄어듭니다.

실시간 모델은 Live API의 양방향 연결로 오디오를 받아 증분 텍스트를 반환합니다. 현재 세션당 최대 10분입니다. 화자 분리와 단어 단위 타임스탬프는 지원하지 않습니다.

작업모델과 API주의할 제한
MP3, 회의 녹음, 콜 로그gemini-3.5-transcribe + Interactions API최대 1시간
화자와 단어 시간을 포함한 녹음같은 모델 + verbatim최대 30분, 3명 이상 화자 귀속은 experimental
마이크 자막과 실시간 음성 인식gemini-3.5-transcribe-live + Live API세션당 10분
말한 내용을 읽기 좋은 문서로 정리smart 모드화자/단어 시간과 함께 사용 불가
다른 언어의 음성으로 번역Gemini 3.5 Live Translate별도 speech-to-speech 제품

공식 모델 페이지는 85개 이상 언어 자동 감지와 발화 단위 코드 스위칭을 문서화합니다. 한국어 코드는 ko-KR입니다. 언어를 알고 있다면 명시한 경우와 자동 감지를 실제 음성에서 비교하고, 숫자와 고유명사 오류를 따로 확인하는 편이 좋습니다.

Gemini 3.5 Transcribe 한국어 선택 가이드로 녹음 전사, 실시간 자막, 음성 번역, 모델 제한, smart와 verbatim, JavaScript, Live 상태, 비용, 데이터와 평가를 비교
Gemini 3.5 Transcribe 한국어 선택 가이드로 녹음 전사, 실시간 자막, 음성 번역, 모델 제한, smart와 verbatim, JavaScript, Live 상태, 비용, 데이터와 평가를 비교

smart는 보기 좋은 글이고 verbatim은 발화 기록입니다

기본 verbatim은 “음”, “어” 같은 추임새, 반복, 중간 수정, 끝맺지 않은 문장을 보존합니다. 인터뷰 원본, 품질 감사, 법률 검토, 자막 동기화처럼 오디오로 돌아가 검증해야 하는 작업에 맞습니다.

smart는 추임새를 제거하고 “화요일—아니, 수요일 두 시” 같은 자기 수정을 최종 의도로 정리합니다. 날짜, 숫자, 목록, 문단과 문장 부호도 읽기 좋게 다듬습니다. 회의 메모와 음성 받아쓰기에는 유용하지만, 동일한 말을 그대로 옮긴 증거 사본은 아닙니다.

오디오 전사 가이드에 따르면 smart는 timestamp_granularities 또는 diarization_mode와 함께 쓸 수 없습니다. 원본성과 읽기 편한 결과가 모두 필요하면 먼저 verbatim + annotation으로 기준 기록을 만들고, 별도 단계에서 요약이나 정리본을 생성해야 합니다.

녹음 파일을 JavaScript로 전사하기

Google Gen AI SDK로 Files API에 파일을 올린 뒤 그 URI를 Interactions API에 전달합니다. API key는 서버 실행 환경에 두고 브라우저 코드나 저장소에 포함하지 않습니다.

js
import { GoogleGenAI } from "@google/genai"; const client = new GoogleGenAI({}); const file = await client.files.upload({ file: "./support-call.mp3", config: { mime_type: "audio/mp3" }, }); const response = await client.interactions.create({ model: "gemini-3.5-transcribe", input: [ { type: "audio", uri: file.uri, mime_type: file.mimeType, }, ], generation_config: { transcription_config: { language_codes: ["ko-KR"], custom_vocabulary: ["Gemini", "Interactions API", "판교테크노밸리"], mode: { type: "smart" }, }, }, }); console.log(response.output_text);

custom_vocabulary에는 사람 이름, 제품명, SKU, 업계 약어처럼 틀리면 업무 결과가 바뀌는 단어를 넣습니다. 최대 1,000개를 받을 수 있지만 Google은 보통 100개 이하의 집중된 목록에서 가장 좋은 결과를 얻는다고 안내합니다. 일반 단어 사전을 통째로 넣는 것은 평가와 유지보수를 어렵게 만듭니다.

화자와 시간 정보가 필요한 경우 smart 대신 다음 verbatim 설정을 사용합니다.

js
mode: { type: "verbatim", timestamp_granularities: ["word"], diarization_mode: "speaker", }

전체 문장은 response.output_text에 있고 각 단어의 시작/끝과 speaker는 interaction의 annotations에서 읽습니다. 일반 텍스트에 화자 라벨이 자동으로 붙는다고 가정하면 파서가 깨질 수 있습니다.

문서는 최대 8명의 diarization을 설명하지만 3명 이상 화자 귀속은 experimental이라고 표시합니다. 이 숫자는 8명 회의의 정확도를 보장하지 않습니다. 겹쳐 말하기, 비슷한 목소리, 먼 마이크가 포함된 샘플에서 화자 오류를 별도 지표로 봐야 합니다.

Gemini 3.5 Transcribe 구현 가이드로 모델 제한, mode 선택, JavaScript 파일 전사, Live 체크포인트, 분당 요금, 데이터 이용과 한국어 평가 기준을 제시
Gemini 3.5 Transcribe 구현 가이드로 모델 제한, mode 선택, JavaScript 파일 전사, Live 체크포인트, 분당 요금, 데이터 이용과 한국어 평가 기준을 제시

실시간 UI에서는 interim과 final을 구분해야 합니다

Live 전사 문서는 전사 파이프라인과 대화형 Live agent를 분리합니다. Transcribe Live는 raw 16-bit PCM 오디오를 받아 텍스트를 내보냅니다. 이 모델 계약에는 도구 호출, 추론, 음성 응답이 포함되지 않습니다.

interim 결과는 빠르게 바뀌므로 화면의 임시 자막으로만 사용합니다. 후속 오디오가 마지막 단어를 수정할 수 있습니다. 데이터베이스 저장, 검색 색인, 업무 생성, 알림 전송은 final 결과를 기준으로 해야 합니다.

10분 세션 경계에서는 마지막 final offset을 기록하고 새 연결을 열며, 재연결 앞뒤의 중복을 제거합니다. 현장 자막과 회의 후 화자/시간 기록을 모두 원한다면 동의를 받아 원본을 안전하게 보관하고 종료 후 unary 모델로 다시 처리할 수 있습니다. 다만 보관, 접근 권한, 삭제 책임이 늘어나는 설계입니다.

분당 요금은 싸지만 전체 워크플로 비용은 따로 계산합니다

2026년 8월 27일 Gemini Developer API 가격표는 free tier와 함께 paid standard tier의 다음 추정치를 제공합니다.

경로오디오 입력텍스트 출력blended estimate
Recorded Transcribe약 $0.003/분약 $0.002/분약 $0.005/분
Transcribe Live약 $0.005/분약 $0.004/분약 $0.009/분

1시간 녹음의 모델 요금은 약 $0.30입니다. live를 합계 1시간 사용하면 약 $0.54지만 현재는 여러 세션으로 나눠야 합니다. 업로드, 저장소, 재시도, 관측, 후처리, 사람 검수 비용은 이 수치에 들어 있지 않습니다.

같은 가격표는 free tier 제출 내용을 Google 제품 개선에 사용한다고 표시하고, paid tier는 사용하지 않는다고 표시합니다. 고객 통화, 의료, 법률, 사내 기밀을 처리할 때는 무료 여부보다 최신 약관, 지역 요구, 동의, 보존 기간, 접근 통제와 삭제 절차를 먼저 확인해야 합니다.

WER 숫자를 실제 한국어 업무의 합격 기준으로 바꾸기

Google의 출시 글은 Artificial Analysis가 측정한 평균 WER로 streaming 4.0%, non-streaming 2.6%를 제시합니다. Chirp 3 대비 time to final 70% 개선과 FLEURS 다국어 결과도 공개했습니다. 이는 공급자가 공개한 비교 근거이며 우리가 재현한 실험이나 한국어 콜센터 품질 보장은 아닙니다.

허용된 실제 음성으로 조용한 방/소음, 한 명/여러 명, 겹치는 말, 이름, 금액, 주문 번호, 영어 혼용, 긴 침묵을 포함한 작은 평가 세트를 만듭니다. verbatim과 smart, ko-KR과 자동 감지, 기본과 맞춤 어휘를 같은 파일로 비교합니다. 단어뿐 아니라 숫자, 화자 귀속, final 지연, reconnect 중복, 합격한 전사 한 건의 비용을 기록합니다.

감사 가능한 기록은 recorded + verbatim, 읽기 좋은 받아쓰기는 smart, 즉시 보이는 자막은 live에서 시작하면 됩니다. 이렇게 선택하면 벤치마크 평균보다 실제 출력 계약이 먼저 설계를 결정합니다.