Ambos substituem o antigo Modo de Voz Avançado do ChatGPT. Eles são construídos sobre uma arquitetura full-duplex que processa continuamente o áudio recebido enquanto gera respostas faladas, ao contrário da abordagem half-duplex anterior, onde o modelo precisava terminar de falar antes de poder ouvir o usuário HAT.
A OpenAI afirmou que os custos de inferência caíram o suficiente para tornar a economia do modo de voz viável, razão pela qual o modelo também está disponível para usuários gratuitos A. No lançamento, o GPT-Live usa o GPT-5.5 como motor de raciocínio OH.
A capacidade full-duplex muda a experiência do assistente de voz de três maneiras específicas, demonstradas pela OpenAI durante seu briefing de lançamento.
O modelo pode ser interrompido no meio de uma frase e para de falar para ouvir, em vez de continuar falando por cima do usuário. Ele também detecta quando o usuário faz uma pausa no meio do pensamento e espera, em vez de cortar a fala AT. O gerente de produto da OpenAI, Atty Eleti, disse durante o briefing: "Este é um modelo full-duplex" T.
O modelo também pode demonstrar que está prestando atenção com expressões como "hum-hum" ou "sim" enquanto o usuário ainda está falando, e permanece em silêncio quando você precisa de um momento para pensar OB.
Quando o GPT-Live encontra uma pergunta difícil, ele delega o raciocínio para os modelos de texto mais recentes da OpenAI (como o GPT-5.5) em paralelo, enquanto o GPT-Live permanece em conversa com o usuário AT. O líder de pesquisa Kundan Kumar explicou: "Quando o GPT-Live precisa pensar profundamente sobre uma pergunta, ele pode delegar o raciocínio e tarefas complexas para o GPT-5.5 em paralelo, enquanto o GPT-Live ainda permanece em conversa com o usuário" LT. Isso significa que os usuários não precisam esperar o modelo de voz raciocinar sobre tarefas pesadas — a transição da pesquisa para os resultados falados é quase instantânea T.
O GPT-Live pode complementar discussões com elementos visuais na tela — imagens, diagramas ou outros conteúdos gerados por IA — criando uma experiência multimodal que vai além do chat puramente por voz HAT. O The Verge relatou que o modelo complementará conversas sobre clima, ações e esportes com imagens geradas por IA T.
Em conjunto, esses recursos tornam as conversas mais próximas do diálogo humano natural. O Business Insider descreveu o assistente como alguém que "quer que você fale por cima dele" B. A manchete do The Verge dizia que o modelo é "melhor em calar a boca" T.
As duas pessoas-chave mencionadas nos briefings à imprensa e relatos da mídia são:
Relatos anteriores de janeiro de 2026 também mencionam o líder de infraestrutura Ben Newhouse e a gerente de produto Jackie Shannon como envolvidos na reestruturação da área de áudio com IA IX.
gpt-realtime-2.1 e gpt-realtime-2.1-mini) com latência p95 25% menor graças a um cache aprimorado C.Uma limitação observada no lançamento: o GPT-Live atualmente não oferece suporte a voz com recursos de vídeo T.
A OpenAI lançou o GPT-Live no meio de uma semana excepcionalmente movimentada na indústria de IA.
Ecosistema da própria OpenAI:
Concorrentes e notícias relacionadas: