O GPT Live 1 chegou à API da OpenAI em 10 de setembro de 2026, por US$ 0,05 por minuto para a camada de voz em tempo real. A proposta full duplex permite que o sistema escute enquanto fala, lidando melhor com interrupções, confirmações curtas, pausas e ruído de fundo.
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
O GPT-Live-1 é o modelo de voz da OpenAI voltado a desenvolvedores que querem criar conversas mais próximas de uma troca ao vivo — e menos parecidas com uma sequência de mensagens gravadas. Disponível na API desde 10 de setembro de 2026, ele custa US$ 0,05 por minuto pela camada de voz de front-end. O modelo de raciocínio, as ferramentas e a infraestrutura conectados por trás dele são cobrados separadamente. 3
5
Muitos agentes de voz usam uma cadeia em três etapas: fala para texto (speech-to-text), um modelo de linguagem que produz a resposta em texto e, por fim, texto para fala (text-to-speech). Esse fluxo pode funcionar bem, mas cada etapa exige uma transição. A aplicação precisa coordenar pausas, mudanças de intenção e interrupções entre componentes diferentes. 3
O GPT-Live-1 é apresentado como um modelo único de voz que trabalha tanto com o áudio recebido quanto com o áudio que está sendo gerado. Na prática, o desenho full-duplex permite continuar ouvindo enquanto fala. A intenção é que ele consiga reagir a uma interrupção ou a um breve “aham” sem interpretar todo som, silêncio ou conversa ao fundo como uma nova solicitação obrigatória. 3
A diferença, portanto, não é apenas gerar áudio mais depressa. É ter mais controle sobre a dinâmica da conversa: perceber quando a pessoa ainda está formulando uma resposta, quando ela quer interromper e quando uma confirmação curta é apenas um sinal de que está acompanhando. A OpenAI classifica o GPT-Live-1 como sua principal opção para conversas de voz naturais e expressivas, com tratamento fluido de interrupções. 2
3
O GPT-Live-1 não precisa executar toda a lógica de negócio sozinho. Ele pode manter a interação de voz em tempo real enquanto encaminha raciocínio mais profundo, chamadas de ferramentas ou ações para um modelo de backend e um framework de agentes escolhidos pelo desenvolvedor. 3
Isso abre opções práticas de arquitetura:
O resultado é um sistema de duas partes: o GPT-Live-1 cuida da conversa falada, enquanto o backend fornece raciocínio, dados corporativos e execução de ações. A contrapartida é que os US$ 0,05 por minuto anunciados não correspondem ao custo completo de um agente: inferência do backend, ferramentas, telefonia e serviços relacionados podem elevar a conta. 3
5
Segundo a OpenAI, desenvolvedores podem orientar tom, ritmo e estilo de conversa por meio do system prompt. O GPT-Live-1 também entrega transcrições e texto das respostas, entende combinações alfanuméricas, oferece viés para palavras-chave e traz detecção de turno para produtos que ainda precisem de limites explícitos entre uma fala e outra. 3
O modelo é destinado a sessões mais longas e agentes por telefone, incluindo fluxos de suporte ao cliente e reservas. A OpenAI diz que ele consegue lidar com silêncio e ruído de fundo sem verbalizar cada etapa interna — um comportamento relevante em ligações reais e outros ambientes menos controlados. 3
O material fornecido não estabelece uma lista definitiva de idiomas compatíveis nem detalha controles específicos para sotaques e dialetos. Esses pontos devem ser confirmados na documentação atual da API antes de serem considerados requisitos de implantação.
A OpenAI afirma que o GPT-Live-1 superou o GPT-Realtime-2.1 em 30 pontos percentuais no Full Duplex Bench, avaliação focada em comportamento de voz interativo, como tomada de turno, pausas, interrupções, confirmações breves e fala ao fundo. 3
Quando combinado ao GPT-6 Astra com esforço de raciocínio médio, o GPT-Live-1 também ficou em primeiro lugar no Tau3, benchmark de agentes de voz de ponta em tarefas completas. A parte de atendimento ao cliente da avaliação abrange tarefas faladas nos setores aéreo, de varejo e de telecomunicações. 3
Há reportagens secundárias com números exatos de latência na tomada de turno e de pontuação no Tau3, mas o material primário fornecido não apresenta esses valores precisos. A conclusão mais segura é que a OpenAI reporta ganhos relevantes no comportamento interativo e o melhor resultado no Tau3 para a combinação GPT-Live-1 com Astra — não que toda implantação repetirá um número específico de benchmark. 3
7
A OpenAI destacou alguns usos iniciais de agentes de voz:
Esses casos ilustram onde o full-duplex tende a ter mais valor: conversas em que a pessoa hesita, se corrige, faz uma confirmação no meio da fala do agente ou interrompe sem querer reiniciar toda a interação.
O GPT-Live-1 custa US$ 0,05 por minuto pela camada de voz de front-end. Os desenvolvedores podem combiná-lo ao modelo de backend e ao framework de agentes de sua preferência, mas essas escolhas alteram o custo operacional total porque são cobradas à parte da camada de voz. 3
5
A OpenAI também cita o OpenAI Presence como outra forma de criar fluxos de voz usando o GPT-Live-1 para interação falada em tempo real. O material fornecido não define critérios de elegibilidade empresarial, condições comerciais, modelo de hospedagem ou processo de acesso ao Presence; portanto, esses detalhes não devem ser presumidos com base apenas no anúncio da API. 3
Para equipes que avaliam o modelo, a questão central vai além do valor por minuto: quanto uma troca de fala mais fluida agrega ao fluxo de trabalho, e qual combinação de backend e ferramentas oferece a confiabilidade necessária a um custo total aceitável?
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O GPT Live 1 chegou à API da OpenAI em 10 de setembro de 2026, por US$ 0,05 por minuto para a camada de voz em tempo real.
O GPT Live 1 chegou à API da OpenAI em 10 de setembro de 2026, por US$ 0,05 por minuto para a camada de voz em tempo real. A proposta full duplex permite que o sistema escute enquanto fala, lidando melhor com interrupções, confirmações curtas, pausas e ruído de fundo.
O preço da voz não representa o custo total: raciocínio de backend, ferramentas, telefonia e demais serviços são cobrados à parte.