OpenAI는 2026년 9월 10일 GPT Live 1을 API에 정식 출시했다. 이 모델은 듣기와 말하기를 동시에 수행하고, 별도 백엔드가 추론·도구 사용을 맡을 수 있다.[1][16] 기존의 음성 인식(STT)→언어 모델→음성 합성(TTS) 순차 파이프라인과 달리, 대화 중 멈춤·끼어듦·짧은 호응을 실시간으로 처리하도록 설계됐다.[1][9][15] 음성 세션은 분당 0.05달러이며 초 단위로 과금된다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI는 2026년 9월 10일 GPT-Live-1을 API에서 정식 출시했다. 날짜는 9월 11일이 아니다. 개발자는 이 모델을 이용해 사용자의 발화가 완전히 끝난 뒤에만 응답하는 방식이 아니라, 듣기와 말하기가 동시에 이뤄지는 음성 에이전트를 만들 수 있다.1
16
기존 음성 에이전트는 대개 음성 인식(STT)으로 발화를 텍스트로 바꾸고, 언어 모델이 답을 생성한 뒤, 음성 합성(TTS)으로 다시 읽어 주는 순차형 구조를 쓴다. GPT-Live-1은 이 가운데 실시간 대화 구간을 위한 통합 음성 계층으로 제시됐다.1
핵심 차이는 발화 차례를 다루는 방식이다. OpenAI에 따르면 GPT-Live-1은 말하면서도 계속 듣고, 침묵이나 말의 속도 변화, 끼어듦을 파악해 지금 답할지 더 들을지를 판단할 수 있다. 짧은 맞장구나 호응처럼 자연스러운 대화에서 흔한 신호도 오류로만 취급하지 않도록 설계된 것이다.1
9
15
다만 음성 모델이 모든 일을 직접 처리해야 하는 것은 아니다. 대화는 GPT-Live-1이 이어 가는 동안, 별도의 백엔드 모델이나 에이전트가 복잡한 추론 또는 도구 호출을 수행할 수 있다. OpenAI 모델을 연결하는 Responses 위임과 개발자 자체 백엔드를 연결하는 클라이언트 위임을 지원한다.1
16
GPT-Live-1은 사용자와 직접 대화하는 전면의 음성 계층 역할을 한다. 더 깊은 추론, 정보 검색, 업무 흐름 실행, 외부 도구 호출 등은 백엔드가 맡을 수 있다. OpenAI의 제품 노트에서는 난도가 높은 검색·추론 작업의 선택지로 GPT-6 Astra를 언급했으며, API 개발자는 클라이언트 위임을 통해 자체 백엔드도 연결할 수 있다.4
16
개발 관점에서 보면 역할은 다음처럼 나뉜다.
OpenAI는 이번 API 출시에서 향상된 지시 이행 능력, 맞춤형 음성, 전화망 연동 지원도 함께 강조했다.13
GPT-Live-1 음성 세션 요금은 분당 0.05달러다. 과금은 초 단위로 이뤄지며, 다음 1분으로 올림 계산하지 않는다.16
18
이 금액은 어디까지나 음성 세션의 가격이다. 백엔드 모델 사용량과 도구 사용량은 별도 청구되므로, 실제 운영 비용을 산정할 때는 통화 시간뿐 아니라 뒤에서 실행되는 추론·검색·도구 작업 비용까지 함께 계산해야 한다.16
18
OpenAI는 GPT-Live-1이 자사 Full Duplex Bench에서 GPT-Realtime-2.1보다 30%포인트 개선됐다고 밝혔다. 또한 중간 수준의 추론 설정을 적용한 GPT-6 Astra와 조합했을 때 Tau3에서 1위를 기록했다고 설명했다.1
하지만 제공된 자료만으로는 질문에 포함된 구체적인 턴테이킹 지연시간 수치나 Tau3 통과율의 정확한 비교 수치를 독립적으로 확인할 수 없다. 따라서 이 수치들은 여기서 검증된 정보로 받아들이기 어렵다.
OpenAI는 자연스러운 발화 차례 처리가 실제 서비스에서 어떤 효과를 낼 수 있는지 보여 주는 사례도 소개했다.
이들은 각 기업이 보고한 운영 결과다. 독립적인 성능 검증이나 모든 서비스에 적용되는 보장으로 해석하기보다는, 실제 배포 사례로 보는 편이 적절하다.
제공된 근거는 ‘Presence’라는 관리형 제품을 통한 기업용 접근 관련 주장을 뒷받침하지 않는다. 이번 API 출시로 억양·방언·지원 언어가 구체적으로 확대됐다는 주장도 확인되지 않았다. 도입이나 구매 결정을 위해서는 최신 OpenAI 공식 문서를 별도로 확인할 필요가 있다.
GPT-Live-1의 변화는 단순히 음성 응답 속도를 높이는 데 그치지 않는다. 에이전트가 대화를 자연스럽게 이어 가는 동안, 별도 시스템이 느리거나 복잡한 추론과 도구 호출을 맡도록 음성 계층과 백엔드 계층을 분리한 것이 핵심이다. 음성 계층은 분당 0.05달러, 초 단위 과금으로 비교적 명확하지만, 전체 비용은 어떤 백엔드 모델과 도구를 붙이느냐에 따라 달라진다.1
16
18
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
OpenAI는 2026년 9월 10일 GPT Live 1을 API에 정식 출시했다. 이 모델은 듣기와 말하기를 동시에 수행하고, 별도 백엔드가 추론·도구 사용을 맡을 수 있다.[1][16]
OpenAI는 2026년 9월 10일 GPT Live 1을 API에 정식 출시했다. 이 모델은 듣기와 말하기를 동시에 수행하고, 별도 백엔드가 추론·도구 사용을 맡을 수 있다.[1][16] 기존의 음성 인식(STT)→언어 모델→음성 합성(TTS) 순차 파이프라인과 달리, 대화 중 멈춤·끼어듦·짧은 호응을 실시간으로 처리하도록 설계됐다.[1][9][15]
음성 세션은 분당 0.05달러이며 초 단위로 과금된다. 다만 백엔드 모델과 도구 사용료는 별도로 더해진다.[16][18]