구글이 2026년 9월 23일 발표한 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 입력한 글을 음성으로 바꾸는 텍스트 음성 변환(TTS) 모델이다. 이름은 비슷하지만 제작 목적은 다르다. Flash TTS는 목소리의 개성과 연출, Flash-Lite TTS는 대량 제작과 비용 효율에 무게를 둔다.
4
27
어떤 모델을 선택해야 할까?
드라마 대사나 게임 캐릭터처럼 목소리 자체가 중요한 작업이라면 Flash TTS가 구글이 제시한 선택지다. 인물의 역할, 억양, 목소리 특징을 자연어로 설명해 새로운 음성을 만들고, 대본의 장면과 대사에 맞춰 말하는 방식도 지시할 수 있다.
4
30
반면 Flash-Lite TTS는 대량 더빙, 오디오 콘텐츠 제작, 음성 에이전트처럼 많은 분량의 음성이 필요한 작업을 겨냥한다. 비용 효율을 앞세우지만 말투와 속도를 조절할 수 있어, 단조로운 낭독에만 쓰는 모델이라는 뜻은 아니다.
27
30
2,000개 이상의 목소리, 대사별 연출
구글은 바로 사용할 수 있는 음성 2,000개 이상을 제공하고, 글로 원하는 목소리를 묘사해 새 음성을 만들 수도 있다고 밝혔다. 화자가 번갈아 말하는 대화를 구성하거나 대사마다 톤·억양·속도를 달리 지시하는 기능도 소개했다.
4
28
29
구글이 설명한 음성 제작 범위는 100개 이상의 언어와 방언이다. 외부 모델 목록에는 Flash TTS 130개, Flash-Lite TTS 101개 언어라는 수치도 제시돼 있다. 다만 이 숫자가 모든 언어에서 모든 음성과 기능을 동일하게 사용할 수 있다는 보장은 아니다.
27
17
18
새 캐릭터의 목소리를 만드는 것과 기존 인물의 목소리를 복제하는 것은 다르다. 출시 관련 보도에 따르면 Flash TTS의 음성 복제에는 약 30초 길이의 참고 음성과 동의 확인 절차가 필요하다.
22
23
복제 음성의 안전장치와 성능 수치
구글은 음성 복제에 동의 확인을 적용한다고 밝혔다. 출시 보도는 생성 음성에 AI 생성 여부를 식별하기 위한 SynthID 워터마크가 삽입되고, 복제 음성에는 출처 정보를 담는 C2PA 자격 증명이 적용된다고 전했다. 이런 조치가 모든 오용 가능성을 없앤다는 의미는 아니다.
23
34
출시 당시 발표된 평가에서 Flash TTS는 Hume AI의 Voice Design Benchmark 71.4점으로 1위를 기록했다. 다른 보도에는 억양 모델링 평가 60.8점도 제시됐다. 구글은 두 모델이 Hume AI의 Overall Quality Index에서도 상위 두 자리를 차지했다고 밝혔다. 이는 발표된 벤치마크 결과로, 개별 서비스에서의 성능을 보장하는 독립적인 검증 결과로 받아들여서는 안 된다.
19
21
어디에서 쓸 수 있나?
구글에 따르면 두 모델은 발표 당일 Google AI Studio와 Gemini API에서 출시를 시작했다. Gemini API 출시 기록에는 TTS 모델과 음성 목록을 다루는 Voices 엔드포인트가 정식 제공 항목으로 올라와 있다. 일반 사용자 대상 제품으로는 Gemini Notebook에 Flash TTS, Google Vids에 Flash-Lite TTS가 예고됐으며, Gemini Enterprise 지원은 추후 제공될 예정이다. 제품별 출시 소식이 곧 모든 음성 기능의 동시 제공을 뜻하지는 않는다.
29
32
초기 연동 관련 보도에는 Agora, LiveKit, Pipecat, Vercel 등의 플랫폼과 Figma, HeyGen, Wondercraft 등의 활용 사례가 언급됐다. 다만 이 목록만으로 각 서비스에서 두 모델의 모든 기능을 같은 시점에 쓸 수 있다고 판단할 수는 없다.
37