GPT Live 1은 2026년 9월 10일 API에 출시된 OpenAI의 풀듀플렉스 음성 모델로, 프런트엔드 음성 레이어 가격은 분당 0.05달러다. 음성을 텍스트로 바꾸고, 언어 모델이 답한 뒤 다시 음성으로 합성하는 직렬 파이프라인과 달리, 말하면서도 계속 듣는 대화 흐름을 지향한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
OpenAI의 GPT-Live-1은 녹음된 발화를 한 차례씩 주고받는 느낌보다, 실제 통화에 가까운 상호 대화를 겨냥한 개발자용 음성 모델이다. 2026년 9월 10일부터 API로 제공되며, 프런트엔드 음성 레이어 이용료는 분당 0.05달러다. 다만 뒤에서 추론을 담당하는 모델, 도구 호출, 전화 인프라 등의 비용은 별도다. 3
5
일반적인 음성 에이전트는 보통 세 단계를 거친다. 음성 인식(STT)이 발화를 텍스트로 바꾸고, 언어 모델이 답변을 만들며, 음성 합성(TTS)이 이를 다시 말로 읽어 준다. 이 방식에서는 각 단계 사이의 전달과 조율이 필요해, 침묵·망설임·말 끊기·의도 변경을 자연스럽게 처리하기가 까다로울 수 있다. 3
GPT-Live-1은 들어오는 음성과 나가는 음성을 하나의 음성 모델 차원에서 다루는 풀듀플렉스 구조를 표방한다. 즉, 음성을 생성하는 동안에도 사용자의 말을 계속 들을 수 있다. 사용자가 답변 중간에 끼어들거나 짧게 “네”라고 맞장구칠 때, 이를 무조건 새 질문이나 새 차례로 취급하지 않도록 설계된 것이다. 주변 대화나 잠깐의 정적 역시 매번 응답해야 할 신호로 단정하지 않는 것이 목표다. 3
핵심은 단순한 음성 출력 속도보다 대화의 차례를 판단하는 능력이다. 상대가 생각을 정리하는 중인지, 말을 끊으려는지, 혹은 계속 듣고 있다는 신호만 보내는지를 구분하는 데 초점이 있다. OpenAI는 GPT-Live-1을 부드러운 인터럽트 처리를 갖춘 자연스럽고 표현력 있는 음성 대화를 위한 주력 모델로 소개한다. 2
3
GPT-Live-1이 모든 업무 판단을 직접 처리해야 하는 것은 아니다. 이 모델은 실시간 음성 대화를 유지하면서, 복잡한 추론·도구 호출·업무 실행은 별도로 선택한 백엔드 모델과 에이전트 프레임워크에 맡길 수 있다. 3
개발팀은 업무에 따라 구성을 달리할 수 있다.
이 구조에서 GPT-Live-1은 통화의 리듬과 실시간 상호작용을 담당하고, 백엔드는 추론·사내 데이터·업무 실행을 맡는다. 따라서 분당 0.05달러라는 음성 가격은 에이전트 전체 비용이 아니다. 백엔드 추론, 도구, 전화 서비스 등은 총비용에 추가될 수 있다. 3
5
OpenAI에 따르면 개발자는 시스템 프롬프트로 대화의 말투, 속도, 스타일을 유도할 수 있다. GPT-Live-1은 대화 기록과 응답 텍스트를 제공하고, 영숫자 인식 및 키워드 편향 기능을 지원한다. 명확한 발화 차례 구분이 필요한 제품을 위해 턴 감지 기능도 제공한다. 3
장시간 세션과 전화 기반 에이전트가 주요 적용 대상이다. 고객 지원, 식당 예약 같은 통화 업무에서 침묵과 배경 소음이 있어도 내부 처리 과정을 일일이 말로 설명하지 않도록 설계됐다고 OpenAI는 밝혔다. 3
제공된 자료만으로는 지원 언어의 확정 목록이나 특정 억양·방언을 세밀하게 제어하는 API 옵션을 확인할 수 없다. 실제 도입 전에는 최신 API 문서에서 해당 요건을 검증해야 한다.
OpenAI는 GPT-Live-1이 턴테이킹, 멈춤, 인터럽트, 맞장구, 배경 발화 등 상호작용형 음성 행동을 평가하는 Full Duplex Bench에서 GPT-Realtime-2.1보다 30%포인트 개선됐다고 발표했다. 3
또한 중간 수준의 추론 노력으로 GPT-6 Astra와 결합했을 때, 종단 간 음성 에이전트 역량을 측정하는 Tau3에서 1위를 차지했다고 밝혔다. Tau3의 고객 서비스 항목은 항공, 유통, 통신 분야의 음성 업무를 다룬다. 3
일부 보도는 턴테이킹 지연 시간과 Tau3 점수를 구체적인 수치로 제시하지만, 여기서 제공된 OpenAI 1차 자료에는 그 정확한 수치가 담겨 있지 않다. 따라서 확인 가능한 결론은 OpenAI가 상호작용 성능의 큰 향상과 GPT-Live-1·Astra 조합의 Tau3 1위를 보고했다는 수준이며, 모든 서비스가 동일한 벤치마크 결과를 재현한다는 뜻은 아니다. 3
7
OpenAI는 다음과 같은 초기 활용 사례를 제시했다.
이 사례들이 보여주는 공통점은 분명하다. 사용자가 망설이거나 말을 고쳐 하거나, 상대 말 중간에 짧게 반응하거나, 답변을 끊고 질문을 바꾸는 일이 흔한 업무일수록 풀듀플렉스의 가치가 커진다.
GPT-Live-1의 가격은 프런트엔드 음성 레이어 기준 분당 0.05달러다. 개발자는 원하는 백엔드 모델과 에이전트 구성 방식을 조합할 수 있지만, 백엔드 추론과 도구 사용료는 음성 레이어와 별도로 청구된다. 3
5
OpenAI는 GPT-Live-1을 기반으로 실시간 음성 상호작용을 구축하는 또 다른 방식으로 OpenAI Presence도 언급했다. 다만 제공된 자료는 Presence의 엔터프라이즈 이용 자격, 상업 조건, 호스팅 방식, 접근 절차를 구체적으로 설명하지 않는다. API 발표만으로 이런 조건을 추정해서는 안 된다. 3
도입 검토에서 중요한 질문은 ‘분당 0.05달러’만이 아니다. 매끄러운 대화 차례 처리가 해당 업무에서 얼마나 큰 가치를 만드는지, 그리고 신뢰성과 총비용을 균형 있게 맞추기 위해 어떤 백엔드 모델과 도구 경로를 택할지가 핵심이다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
GPT Live 1은 2026년 9월 10일 API에 출시된 OpenAI의 풀듀플렉스 음성 모델로, 프런트엔드 음성 레이어 가격은 분당 0.05달러다.
GPT Live 1은 2026년 9월 10일 API에 출시된 OpenAI의 풀듀플렉스 음성 모델로, 프런트엔드 음성 레이어 가격은 분당 0.05달러다. 음성을 텍스트로 바꾸고, 언어 모델이 답한 뒤 다시 음성으로 합성하는 직렬 파이프라인과 달리, 말하면서도 계속 듣는 대화 흐름을 지향한다. [3]
OpenAI는 GPT Realtime 2.1 대비 Full Duplex Bench 성능이 30%포인트 향상됐으며, GPT 6 Astra와 결합한 구성은 Tau3에서 1위를 기록했다고 밝혔다.