구글이 실시간 음성 에이전트와 라이브 대화를 겨냥한 네이티브 오디오-투-오디오 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 공개했다. 전자는 대규모 운영, 비용 효율, 자연스러운 대화와 시각 맥락 활용에 초점을 맞췄고, 후자는 더 복잡한 다단계 작업을 위해 백그라운드 추론을 강화한 모델이다.
10
2
핵심 변화: 답을 찾는 동안에도 대화는 멈추지 않는다
이번 발표에서 가장 눈에 띄는 기능은 Gemini 3.8 Live Extended Thinking에 들어간 백그라운드 추론이다. 구글에 따르면 이 모델은 오디오 응답을 스트리밍하는 동시에 뒤에서 계획을 수립하고 비동기 도구를 호출할 수 있다. 시간이 걸리는 도구 실행을 기다리는 동안에는 자연스러운 대화용 연결 표현을 사용해 상호작용을 이어갈 수도 있다.
1
2
이는 단순한 ‘빠른 응답’과는 다르다. 구글이 제시한 구조에서는 음성 생성, 백그라운드 계획, 비동기 도구 작업이 병렬로 진행될 수 있다. 예를 들어 에이전트가 다음 처리 절차를 설명하면서 재고·고객 정보·장애 로그 같은 외부 데이터 조회 결과를 기다리거나, 여러 단계의 작업을 이어서 수행하는 방식이다. 다만 실제 사용자 경험은 도구의 신뢰성, 대화 설계, 그리고 기다리는 동안 모델이 하는 말이 실질적으로 유용한지에 따라 달라질 것이다.
1
2
두 모델은 어떻게 다른가
Gemini 3.8 Live는 추론 과정에서 생길 수 있는 지연을 줄여야 하는 저지연·고처리량 음성 대화에 적합한 모델로 소개됐다. 자연스러운 대화와 함께 시각적 그라운딩(카메라 영상이나 화면 등 시각 맥락을 함께 해석하는 기능)을 결합한 것이 특징이다.
10
45
반면 Gemini 3.8 Live Extended Thinking은 복잡한 데이터 평가, 다단계 계획, 수 초가 걸릴 수 있는 도구 실행이 필요한 실시간 음성 상호작용을 겨냥한다. 즉, 고객 응대량이 많은 단순·반복 대화에는 Live, 진단·조사·업무 처리처럼 사고 과정과 도구 연동의 비중이 큰 작업에는 Extended Thinking을 선택하는 구도다.
1
2
구글 측 관계자는 Gemini 3.8 Live가 97개 언어를 지원하고 대화 중 언어를 전환할 수 있다고 밝혔다. 다만 실제 도입 전에는 한국어를 포함한 대상 언어의 음성 품질, 억양·사투리 인식 성능, 지역별 제공 여부를 해당 서비스 환경에서 직접 검증할 필요가 있다.
16
벤치마크 점수는 참고 자료일 뿐
출시 관련 보도에 따르면 Speech-to-Speech Quality Index에서 Gemini 3.8 Live는 76.0점, Gemini 3.8 Live Extended Thinking은 82.6점을 기록했다. 비교 대상인 OpenAI의 GPT-Live-1은 medium effort 설정에서 81.5점으로 제시됐다.
25
해당 비교만 놓고 보면 Extended Thinking의 점수가 가장 높다. 그러나 이것만으로 특정 모델이 모든 음성 에이전트 환경에서 우수하다고 결론 내리기는 어렵다. 실제 서비스에서는 끼어들기 발화 처리, 억양과 다국어 음성 인식, 도구 호출 정확도, 부하 상황의 지연, 안전성, 장애 복구, 작업 해결 건당 총비용까지 함께 평가해야 한다. 이 수치는 구매 결정을 위한 하나의 신호이지, 독립 검증된 종합 성능 판정은 아니다.
25
가격: 일반 Gemini 모델이 아니라 Live API 요금표를 봐야 한다
구글의 공식 가격표는 두 신규 모델을 Live API 항목으로 묶는다. 유료 표준 등급 기준 오디오 입력은 100만 토큰당 3달러 또는 분당 0.005달러, 오디오 출력은 100만 토큰당 12달러 또는 분당 0.018달러다. 텍스트 입력은 100만 토큰당 0.75달러, 사고 토큰을 포함한 텍스트 출력은 100만 토큰당 4.50달러로 표시된다.
37
여기서 중요한 점은 Gemini 3.8 Flash 등 다른 Gemini 모델의 토큰 가격을 Live 모델 가격으로 그대로 적용하면 안 된다는 것이다. 음성 에이전트의 실제 비용은 입력·출력 음성 비중, 텍스트, 이미지·영상 맥락, 연결 도구의 사용 방식에 따라 달라질 수 있다. 예산을 잡을 때는 최신 Live API 가격표와 모델 문서를 기준으로 실제 세션을 측정하는 편이 안전하다.
37
개발자·기업·일반 사용자 제공 범위
Google DeepMind의 공개 표에 따르면 두 모델은 모두 일반 제공(GA) 상태다. Gemini 앱, Google AI Studio, Gemini API, Google Enterprise Agent Platform에서 두 모델을 이용할 수 있는 것으로 안내된다. Google Search Live에는 Extended Thinking이, Google Workspace에는 Gemini 3.8 Live가 각각 표시돼 있다.
54
개발자에게는 같은 네이티브 오디오-투-오디오 계열 안에서 저지연 대화형 모델과 고추론 모델 중 하나를 고를 수 있는 선택지가 생긴 셈이다. 기업 도입에서는 모델 자체의 제공 여부뿐 아니라 사용할 제품 경로, 데이터 통제 방식, 적용 지역, 기존 시스템과의 통합 방법을 함께 확인해야 한다.
54
음성 에이전트 경쟁에서 달라지는 점
구글의 경쟁 포인트는 음성 대화, 시각 맥락, 백그라운드 추론, 비동기 도구를 하나의 모델 계열에서 통합한다는 데 있다. 원칙적으로는 음성 인식(STT), 텍스트 모델, 도구 오케스트레이션, 음성 합성(TTS)을 별도로 조립해야 하는 부담을 줄이고, 작업 처리 중에도 대화 흐름을 유지하는 데 도움이 될 수 있다.
1
10
GPT-Live-1은 특히 양방향 동시 대화 방식 등을 검토하는 팀에게 여전히 중요한 비교 대상이다. 다만 공개된 벤치마크 하나로 플랫폼 선택을 끝내기에는 범위가 좁다. 실제 업무 통화와 유사한 시나리오를 구성해 발화 끼어들기 처리, 도구 호출 정확도, 다국어 성능, 안전 통제, 장애 복구, 지연 시간, 완료된 업무 한 건당 비용을 측정하는 검증이 필요하다.
25
아직 명확하지 않은 부분: SynthID 오디오 워터마크
제공된 출시 자료만으로는 Gemini 3.8 Live 및 Extended Thinking의 오디오 출력에 적용되는 SynthID 워터마크 정책을 구체적으로 확인하기 어렵다. 구글은 Gemini 앱과 웹 경험에서 생성된 텍스트의 워터마킹·식별로 SynthID 적용 범위를 확장했다고 밝혔지만, 이것이 두 Live 모델의 모든 오디오 스트림에 워터마크가 삽입된다는 뜻은 아니다. 탐지 방식과 적용 범위, 출시 조건 역시 이 자료만으로는 확인되지 않는다.
59
음성 AI를 실제 서비스에 투입하려는 조직이라면 아키텍처를 확정하기 전에 최신 모델 문서, 가격, 플랫폼별 제공 상태, 적용 서비스 약관을 다시 확인해야 한다. 특히 음성 데이터와 외부 도구가 결합되는 환경에서는 모델 성능뿐 아니라 운영·보안·데이터 관리 요건이 도입 성패를 좌우할 수 있다.
37
54