Importante: a OpenAI não emitiu nenhum comunicado oficial. O nome final do modelo, o comportamento exato dos seus níveis e a data de lançamento ainda não foram confirmados pela empresa.
Os modos de voz atuais do ChatGPT — Voz Padrão e Modo de Voz Avançado — funcionam em um esquema de turnos. O modelo precisa esperar o usuário terminar de falar para poder responder. A arquitetura bidirecional (BiDi) do GPT-Bidi-1 permite que o modelo processe dois fluxos de áudio simultaneamente: o seu e o dele próprio.
As principais diferenças de comportamento observadas nas demonstrações:
O objetivo interno da OpenAI era diminuir a diferença entre o sistema de voz do ChatGPT — que estava atrás de seus modelos de texto (que já operam com raciocínio equivalente ao GPT-5.5) — e oferecer paridade de inteligência em conversas em tempo real.
O GPT-Bidi-1 é o primeiro modelo de voz da OpenAI a introduzir três níveis selecionáveis de inteligência e velocidade para o modo de voz:
| Nível | Descrição |
|---|---|
| High | Máxima profundidade de raciocínio, resposta mais lenta — ideal para análises complexas |
| Medium | Equilíbrio entre inteligência e velocidade |
| Instant | Resposta mais rápida possível, raciocínio reduzido — para interações casuais ou que exigem agilidade |
Esse sistema de níveis permite que o usuário ajuste a profundidade da interação versus a latência para cada tarefa, de forma parecida com os diferentes níveis de raciocínio oferecidos nos modelos de texto do ChatGPT. Por exemplo, uma consulta rápida sobre o clima usaria o modo Instant, enquanto uma sessão intensa de brainstorming exigiria o modo High.
Quando o GPT-Bidi-1 é selecionado, o ícone/indicador de onda de voz muda para amarelo, em vez da cor padrão atual. O modelo aparece no seletor de modelos das configurações como uma nova opção chamada "Bidi (Mais Recente)", ao lado dos modos Voz Padrão e Modo de Voz Avançado, sem substituí-los.
gpt-bidi-1. Contexto competitivo: O investimento em voz bidirecional é uma resposta direta aos avanços do Google (Gemini Live, que já lida com interrupções), da Anthropic e de agentes de voz em tempo real de startups. A OpenAI está correndo para equiparar a interação por voz à sua inteligência de texto, que já opera com raciocínio de nível GPT-5.5.