구글이 음성을 단순히 받아 적는 데서 한 걸음 더 나아간 음성 텍스트 변환 모델 Gemini 3.5 Transcribe를 공개했다. 이 모델은 말한 내용을 한 단어씩 그대로 옮기기보다, 중간에 끊기거나 정정하는 자연스러운 발화를 읽기 좋고 구조화된 글로 다듬는 데 초점을 맞춘다. 구글은 이를 지금까지 선보인 음성 텍스트 변환 모델 가운데 가장 정밀한 모델이라고 설명하며, 기존 Chirp 3의 후속 모델로 내세웠다.
1
12
이 변화는 받아쓰기와 메모 작성에는 유용하지만, 동시에 중요한 의미를 갖는다. ‘음…’ 같은 말버릇을 지우고 화자의 의도를 추정해 문장을 정리하는 시스템은 더 좋은 글을 만들어줄 수 있는 반면, 화자가 실제로 사용한 표현을 그대로 보존하지는 않을 수 있다.
Gemini 3.5 Transcribe가 달라진 점
Gemini 3.5 Transcribe의 핵심은 구글이 말하는 ‘지능형 전사’다. 일반적인 음성 인식 모델이라면 머뭇거림이나 중간에 포기한 문장도 모두 기록하려 하지만, 이 모델은 불필요한 말버릇을 정리하고 화자의 자기 정정을 반영하며 문장부호와 서식을 자동으로 적용할 수 있다. 음성 명령으로 텍스트를 수정하거나, 정리되지 않은 말을 읽기 쉬운 문장으로 바꾸는 작업도 지원한다.
1
8
12
따라서 일상적인 음성 입력에 특히 적합하다. 사용자가 메모하듯 단편적인 문장을 말하면, 결과물은 그대로 옮긴 받아쓰기보다 메시지나 문서, 웹 양식에 바로 사용할 수 있는 초안에 가까워진다.
배경 소음과 전문 용어, 특수한 어휘를 처리하도록 설계된 점도 특징이다. 사용자는 맞춤 어휘를 제공해 사람 이름이나 제품명, 특정 업계 용어가 원하는 철자로 인식되도록 조정할 수 있다. 모델은 85개 이상의 언어를 자동으로 감지한다.
1
7
사전 녹음된 오디오를 처리할 때는 타임스탬프와 최대 3명의 화자를 구분하는 화자 분리 기능도 제공된다. 이를 활용하면 개발자가 녹취문의 각 부분을 발화자별로 연결할 수 있다.
1
Chirp 3보다 얼마나 정확하고 빨라졌나
구글은 Gemini 3.5 Transcribe가 이전 모델인 Chirp 3보다 크게 개선됐다고 설명한다. Artificial Analysis 측정치를 인용한 보도에 따르면 비스트리밍 음성의 단어 오류율은 2.6%, 스트리밍 음성은 4.0%였으며, 최종 녹취 결과가 나올 때까지 걸리는 시간은 70% 줄었다.
3
4
9
다만 이 수치를 모든 환경에 적용되는 성능 보증으로 받아들여서는 안 된다. 단어 오류율(WER)은 언어와 억양, 녹음 품질, 배경 소음, 평가 데이터셋에 따라 달라진다. 구글이 공개한 FLEURS 벤치마크에서는 스트리밍 모드 단어 오류율 5.50%가 제시됐는데, 시험 조건이 다르기 때문에 외부 기관의 측정치와 직접 비교하기는 어렵다.
1
그럼에도 방향성은 분명하다. 구글은 실시간 대화에서는 지연 시간을 낮추고, 녹음 파일이나 받아쓰기에서는 최종 결과를 더 깔끔하게 만드는 두 가지 목표를 동시에 겨냥하고 있다.
개발자를 위한 두 가지 처리 방식
애플리케이션의 용도에 따라 Gemini 3.5 Transcribe를 사용하는 경로도 나뉜다.
실시간 음성 변환
실시간 방식은 오디오 스트림을 계속 입력받으면서 빠르게 응답해야 하는 애플리케이션을 위한 것이다. 구글의 Live API는 지연 시간이 짧은 양방향 음성 상호작용을 지원하고, 사용자의 음성 입력과 모델의 음성 출력을 텍스트로 변환할 수 있다.
12
20
이 방식은 음성 비서, 실시간 자막, 대화형 인터페이스처럼 사용자가 말하는 동안 텍스트가 필요한 서비스에 활용될 수 있다. Gemini API 문서는 Gemini 애플리케이션의 상호작용 방식을 단일 응답형(unary), 스트리밍형, 실시간형으로 구분한다.
24
사전 녹음 음성 변환
이미 녹음된 오디오를 처리할 때는 파일을 업로드하거나 파일을 참조한 뒤 Gemini API의 상호작용 흐름으로 요청을 보낼 수 있다. 이 방식은 즉각적인 응답보다 타임스탬프, 서식, 맞춤 어휘, 화자 구분이 중요한 녹취·기록 작업에 적합하다.
1
12
18
구글은 새로운 Gemini 애플리케이션의 기본 인터페이스로 Interactions API를 권장하고 있으며, Live API는 지속적인 저지연 음성·시각 경험을 위한 용도로 안내하고 있다.
19
20
이미 적용된 구글 제품
Gemini 3.5 Transcribe는 아직 연구실 단계에만 머물러 있는 모델이 아니다. 보도에 따르면 Android용 Gboard의 음성 입력 기능인 Rambler와 macOS용 Gemini 앱에 이미 사용되고 있다.
2
13
26
구글은 Chrome에도 음성 텍스트 변환 기능을 곧 도입할 예정이다. 지원이 시작되면 전용 앱을 열지 않아도 메시지, 게시물, 웹 양식, 프롬프트 등 웹페이지의 텍스트 입력창에 직접 받아쓰기할 수 있게 된다.
1
8
13
이번 모델은 Gemini 3.5 Live 및 Gemini 3.5 Live Experimental과 함께 구글의 새로운 Gemini Audio 제품군을 구성한다. 이 가운데 Transcribe는 음성을 텍스트로 바꾸는 데 집중하고, Live 계열 모델은 상호작용형 음성 경험을 목표로 한다.
12
26
가장 중요한 쟁점: 다듬어진 글인가, 정확한 기록인가
Gemini 3.5 Transcribe의 가장 강력한 기능은 동시에 가장 큰 한계이기도 하다. 군더더기 표현을 삭제하고 자기 정정을 하나의 문장으로 통합하면 결과는 훨씬 읽기 쉬워지지만, 오디오와 녹취문 사이의 거리는 그만큼 커진다.
완성도 높은 결과물은 의미 있는 망설임이나 발화 중단을 생략할 수 있고, 처음에 잘못 말한 표현 대신 정정된 문장만 남길 수 있다. 화자 특유의 말투와 문장 습관도 매끄럽게 다듬어질 수 있다. 메시지나 메모, 웹 양식에 내용을 입력할 때는 바람직한 변화일 수 있지만, 말한 그대로가 중요한 상황에서는 문제가 된다.
인터뷰, 법률·의료 기록, 연구 자료, 접근성 관련 문서, 직접 인용문을 만들 때는 원본 오디오를 반드시 보관하고 중요한 부분을 확인하는 것이 좋다. 명확한 ‘축어록’ 모드를 제공하지 않는 구현이라면 Gemini 3.5 Transcribe는 중립적인 녹음기라기보다, 음성을 이해해 다시 써주는 지능형 전사 시스템으로 보는 편이 정확하다.
이번 발표가 의미하는 것
구글은 이번 발표를 통해 음성 인식을 ‘말한 내용을 받아 적는 기술’에서 ‘말한 내용을 글쓰기 초안으로 바꾸는 기술’에 가깝게 끌어갔다. Gemini 3.5 Transcribe는 전사, 정리, 서식 적용, 언어 감지, 맞춤 어휘, 화자 정보를 결합하고 실시간 음성과 사전 녹음 음성에 각각 다른 처리 경로를 제공한다.
1
12
개발자 입장에서는 음성이 인식된 뒤 별도로 수행해야 했던 후처리 작업을 줄일 수 있다. 사용자에게는 기계가 알아듣도록 완벽하게 말해야 한다는 부담을 덜고, 대략적인 초안을 편집자에게 건네듯 음성으로 입력하는 경험을 제공할 수 있다.
결국 핵심 질문은 모델이 더 깔끔한 글을 만들 수 있느냐가 아니다. 각각의 애플리케이션이 필요한 것이 깔끔한 글인지, 아니면 실제 발화를 한 글자도 놓치지 않는 정확한 기록인지가 더 중요하다.