Google, 스마트 받아쓰기와 두 가지 음성-텍스트 API를 갖춘 Gemini 3.5 Transcribe 출시
Gemini 3.5 Transcribe는 스마트 받아쓰기, 85개 이상의 언어, 라이브 스트리밍, 화자 레이블, 타임스탬프 및 유료 API 액세스를 추가합니다.
Google은 2026년 8월 26일, 라이브 음성 인터페이스와 녹음된 오디오를 위한 전용 음성-텍스트 모델인 Gemini 3.5 Transcribe를 공개했습니다. 공개 프리뷰로 출시된 이 모델은 85개 이상의 언어를 지원하며, 필러 단어를 제거하고 발화 중 수정 내용을 반영하며 비정형 음성을 읽기 쉬운 텍스트로 서식화하는 선택적 “스마트” 모드를 추가했습니다.
개발자는 두 개의 별도 Gemini API 엔드포인트를 통해 이 모델을 사용할 수 있습니다. gemini-3.5-transcribe-live는 Live API를 통해 실시간 오디오를 처리하며, gemini-3.5-transcribe는 Interactions API를 통해 업로드된 녹음을 처리합니다. Google은 또한 Gboard의 Rambler와 macOS용 Gemini 앱을 비롯한 일부 소비자 제품에 기반 전사 기술을 배포했습니다.
전사와 더 폭넓은 어시스턴트 동작의 구분은 중요합니다. Gemini 3.5 Transcribe 자체는 텍스트를 생성합니다. Google의 모델 레퍼런스에서는 함수 호출, 파일 검색, 이미지 생성, 코드 실행 및 사고 기능을 지원하지 않는 것으로 명시합니다. macOS 앱이 받아쓴 명령으로 파일을 요약하거나 이미지를 생성할 때는 음성이 전사된 뒤 다른 Gemini 모델과 제품 수준 도구가 해당 작업을 수행합니다.
1. 두 모델은 서로 다른 오디오 워크플로를 지원합니다
라이브 모델은 양방향 WebSocket 세션을 통해 연결되며, 오디오가 아직 들어오는 동안 점진적으로 텍스트를 출력합니다. Google은 지연 시간이 1초 미만이라고 설명하며, 이 엔드포인트가 긴 발화가 끝나기 전에 화면에 텍스트를 표시해야 하는 자막, 받아쓰기 인터페이스 및 음성 애플리케이션에 적합하다고 봅니다.
라이브 세션은 원시 16비트 PCM 오디오를 수용하며, Google의 구현 가이드는 16 kHz 모노 오디오를 지정하고 약 100밀리초 단위 청크를 권장합니다. 연속 라이브 전사 세션은 10분으로 제한됩니다. 더 긴 대화가 필요한 애플리케이션은 자체 인프라에서 세션 전환을 관리해야 합니다.
비스트리밍 모델은 사전 녹음된 오디오 파일을 수용하며 요청당 최대 한 시간을 처리할 수 있습니다. 단어 수준 타임스탬프나 화자 분리가 활성화되면 이 제한은 30분으로 줄어듭니다. 라이브 엔드포인트와 달리 개별 단어에 시작 및 종료 오프셋을 연결하고 녹음 내 화자를 식별할 수 있습니다.
Google의 출시 발표는 최대 세 명의 화자에 대한 화자 귀속을 설명합니다. API 레퍼런스는 최대 여덟 명까지 지원한다고 제시하지만, 세 명 이상의 화자가 포함된 귀속에는 실험적이라는 레이블을 붙입니다. 따라서 더 큰 회의를 처리하는 개발자는 여덟 명이라는 수치를 안정적인 귀속 품질의 보장이 아니라 기술적 상한으로 간주해야 합니다.
두 엔드포인트 모두 지원되는 언어를 자동으로 식별하며, 개발자가 사전에 단일 언어를 설정하지 않아도 세션 또는 문장 내에서 언어를 바꿀 수 있습니다. 언어를 알고 있다면 애플리케이션은 인식을 해당 언어 쪽으로 유도하기 위해 BCP-47 코드를 제공할 수 있습니다.
사용자 정의 어휘는 두 번째 조정 수단을 제공합니다. 개발자는 이름, 약어, 기술 용어 또는 기타 흔하지 않은 표현을 위해 최대 1,000개의 용어를 제공할 수 있습니다. Google은 일반적으로 100개 이하의 용어 목록에서 결과가 가장 좋다고 밝히며, 폭넓은 사전보다 표적화된 어휘가 바람직함을 시사합니다.
2. 스마트 전사는 표시 방식만이 아니라 출력 자체를 바꿉니다
Gemini 3.5 Transcribe에는 두 가지 출력 모드가 있습니다. 기본 VERBATIM 모드는 필러 단어, 반복, 잘못 시작한 발화 및 말로 한 자기 수정을 보존합니다. 반면 SMART 모드는 화자가 전달하려 했던 텍스트를 생성하려고 시도합니다.
스마트 모드에서 모델은 “um” 및 “uh” 같은 표현을 제거하고, 말을 더듬는 부분을 없애며, 문장 부호와 문장 첫 글자 대문자 표기를 적용할 수 있습니다. 또한 발화 중 수정을 반영합니다. 처음에 Tuesday라고 말했다가 날짜를 Wednesday로 수정한 화자의 경우, 전사본에는 Wednesday만 포함됩니다.
서식 시스템은 말로 나열한 내용을 문단, 글머리 기호 또는 번호 매기기 목록으로 변환할 수 있습니다. 또한 역 텍스트 정규화를 적용해, 발화된 수량을 간결한 문어 형태로 바꿉니다. 예를 들어 “twenty six million dollars”를 “$26M”으로 변환합니다.
이 동작은 스마트 모드를 메시지, 메모, 프롬프트 및 초안 작성에 유용하게 만듭니다. 그러나 이는 축어적 기록과 동등하지 않습니다. 모델이 의도적으로 발화 일부를 삭제하고 다시 작성하기 때문에, 법적 전사본, 연구 데이터, 인용문 또는 규정 준수 기록을 생성하는 조직은 축어 출력 모드를 사용하고 원본 오디오와 대조해 결과를 검토해야 합니다.
Google은 정리된 출력과 상세 주석 사이에도 기술적 분리를 적용합니다. 스마트 전사는 녹음 오디오 API에서 단어 수준 타임스탬프 또는 화자 분리와 결합할 수 없습니다. 이러한 기능에는 축어 모드가 필요합니다. 라이브 전사는 스마트 서식을 지원하지만 단어 수준 타임스탬프와 화자 분리를 모두 제공하지 않으며, 대신 발화 수준의 타임스탬프를 출력합니다.
3. 독립 테스트에서 이 모델은 가장 정확한 호스팅 시스템 중 하나로 평가됩니다
Google은 Gemini 3.5 Transcribe를 현재까지 가장 정밀한 음성-텍스트 모델이라고 부르며 Chirp 3의 후속 모델로 포지셔닝합니다. 다국어 FLEURS 벤치마크에서 Google은 주요 언어와 로캘 일부를 대상으로 스트리밍 전사에서 5.50%, 비스트리밍 처리에서 5.04%의 단어 오류율을 보고했습니다.
단어 오류율은 기준 전사본 대비 치환, 삭제 및 삽입을 측정하며, 점수가 낮을수록 오류가 적음을 의미합니다. 이 수치는 벤치마크에 특정된 것으로, 모든 억양, 마이크 또는 음향 환경에 대한 보편적 오류율로 해석해서는 안 됩니다.
Google은 별도로 Artificial Analysis가 스트리밍에서 평균 4.0%, 비스트리밍 사용에서 2.6%의 오류율을 측정했다고 밝혔습니다. 또한 Chirp 3와 비교해 최종 전사본 생성에 필요한 시간이 70% 감소했다고 보고합니다.
Artificial Analysis의 공개 비스트리밍 리더보드는 2.6% 결과를 확인합니다. 게시 시점에 이 리더보드는 나열된 시스템 중 Gemini 3.5 Transcribe를 정확도 5위에 배치했으며, 그보다 높은 모델들의 결과는 1.7%에서 2.4% 사이였습니다. 이 테스트는 단일 깨끗한 음성 코퍼스에 의존하지 않고 대화, 의회 및 기업 실적 데이터세트에서 약 여덟 시간의 오디오를 결합합니다.
같은 독립 표는 약 82.5의 처리 속도 계수를 보고하며, 이는 해당 벤치마크 조건에서 서비스가 초당 약 82.5초의 오디오를 처리했다는 의미입니다. Artificial Analysis는 1,000분당 $5의 비용을 추정했으며, 이는 Google의 대략적인 비스트리밍 API 혼합 가격과 일치합니다.
이 측정치는 모델이 경쟁력이 있다는 Google의 주장을 뒷받침하지만, 사용 가능한 서비스 중 일관되게 가장 정확하다는 점까지 뒷받침하지는 않습니다. 실제 운영 평가에는 여전히 대표성 있는 녹음이 필요하며, 특히 코드 스위칭, 전문 어휘, 겹치는 화자 또는 잡음이 있는 채널이 전사본의 사용 가능 여부를 결정하는 경우에 그렇습니다.
4. 가격은 녹음된 오디오 분당 약 0.5센트부터 시작합니다
Google의 유료 Gemini Developer API 가격표는 비스트리밍 오디오 입력을 토큰 100만 개당 $2, 분당 $0.003으로 추정해 제시합니다. 텍스트 출력은 토큰 100만 개당 $12이며, 분당 추가 $0.002으로 추정됩니다. 따라서 Google은 녹음된 오디오 1분당 약 $0.005의 혼합 추정치를 제시합니다.
라이브 전사는 더 비쌉니다. 오디오 입력 가격은 토큰 100만 개당 $3.50, 즉 분당 약 $0.005이며, 출력되는 텍스트는 토큰 100만 개당 $21, 분당 $0.004으로 추정됩니다. Google은 라이브 1분당 약 $0.009의 실질적 결합 가격을 계산합니다.
두 변형 모두 무료 API 등급을 제공합니다. Google의 가격표는 무료 등급 콘텐츠가 제품 개선에 사용될 수 있는 반면, 유료 등급 콘텐츠는 명시된 조건에 따라 그 목적으로 사용되지 않는다고도 밝힙니다. 기밀 녹음을 처리하는 팀은 배포 전에 적용되는 서비스 등급, 지역별 가용성 및 데이터 거버넌스 조건을 평가해야 합니다.
두 전사 모델 모두 배치, flex 또는 priority 추론을 지원하지 않습니다. Google Search 그라운딩도 사용할 수 없습니다. 이는 전사를 프롬프트 가능한 하나의 기능으로 추가한 범용 Gemini 모델이 아니라 특화된 오디오-텍스트 서비스입니다.
5. Google은 전사를 받아쓰기와 에이전트 인터페이스에 통합하고 있습니다
소비자용으로 Gemini 3.5 Transcribe는 일부 국가와 언어에서 macOS용 Gemini 앱 및 Android의 Rambler를 통해 영어로 제공됩니다. Rambler는 받아쓴 텍스트를 정리하고, 철자 오류를 수정하며, 편집하고, 음성 지시를 통해 문체를 바꿀 수 있습니다.
Google Antigravity에서 전사는 허용된 화면 컨텍스트와 채팅 기록을 사용해 파일명, 활성 문서 및 에이전트 출력 처리 방식을 개선할 수 있습니다. Google AI Studio도 개발자가 애플리케이션을 만드는 동안 받아쓸 수 있도록 Build 모드에서 이 모델을 제공합니다.
Gemini macOS 앱은 전사를 화면 컨텍스트 및 다른 Gemini 모델과 결합합니다. 말로 한 요청은 로컬 파일 요약, 애플리케이션 간 텍스트 재사용, 검색 또는 이미지 생성을 포함하는 워크플로를 트리거할 수 있습니다. 이러한 작업은 통합 기능입니다. 전용 전사 모델이 음성을 텍스트로 변환하면 주변 애플리케이션이 결과 명령을 라우팅합니다.
Google은 임의의 웹 필드에 대한 말하기-입력 지원이 Chrome에 추가될 예정이라고 밝혔지만, 이는 현재 제공되는 출시 범위에는 포함되지 않습니다. 기업용 액세스는 Gemini Enterprise Agent Platform을 통해 공개 프리뷰로 제공되며, Gemini Enterprise for Customer Experience 지원은 별도로 계획되어 있습니다.
따라서 이번 출시는 인식 정확도 이상의 변화를 가져옵니다. Google은 이제 소비자 받아쓰기, 개발 환경, 기업 오디오 처리 및 실시간 음성 인터페이스 전반에 하나의 전사 계층을 제공합니다. 개발자는 정리된 출력 또는 축어 출력을 선택할 수 있지만, 라이브 엔드포인트의 낮은 지연 시간과 녹음 오디오 엔드포인트의 화자 레이블 및 단어 수준 타이밍 사이에서도 선택해야 합니다.
자주 묻는 질문
Gemini 3.5 Transcribe는 정식 출시되었나요?
아니요. Google은 개발자 및 기업 서비스를 공개 프리뷰로 분류합니다.
이 모델은 몇 개의 언어를 지원하나요?
발화 또는 세션 내 언어 변경을 포함해 85개 이상의 언어를 자동으로 감지하고 전사합니다.
라이브 모델은 화자를 식별할 수 있나요?
아니요. 화자 분리와 단어 수준 타임스탬프는 축어 모드의 사전 녹음 오디오에서만 사용할 수 있습니다.
스마트 전사는 화자의 정확한 단어를 보존하나요?
아니요. 필러를 제거하고, 수정 내용을 반영하며, 텍스트를 재구성하고, 서식을 바꿀 수 있습니다. 정확한 문구가 중요할 때는 축어 모드를 사용하세요.
API 비용은 얼마인가요?
Google은 유료 등급에서 비스트리밍 전사는 분당 약 $0.005, 라이브 전사는 분당 $0.009으로 추정합니다.
참고 자료
Share