O Gemini 3.8 Live é voltado a escala, eficiência de custo, diálogo fluido e compreensão de contexto visual; o Extended Thinking mira tarefas complexas e em múltiplas etapas. No Extended Thinking, o agente pode continuar falando enquanto planeja, raciocina e espera chamadas assíncronas de ferramentas serem concluídas.
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
O Google apresentou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos nativos de áudio para áudio voltados a agentes de voz e conversas ao vivo em tempo real. O modelo padrão é posicionado para escala, eficiência de custo, diálogo fluido e compreensão visual; a versão Extended Thinking é destinada a tarefas mais difíceis, em múltiplas etapas, que se beneficiam de raciocínio em segundo plano. 10
2
O recurso que mais diferencia a linha é do Gemini 3.8 Live Extended Thinking. Segundo o Google, o modelo consegue raciocinar em segundo plano, planejar ações e chamar ferramentas assíncronas enquanto continua transmitindo uma resposta em áudio. Em vez de interromper toda a conversa até uma ferramenta retornar um resultado, ele pode usar expressões conversacionais naturais para manter a interação ativa. 1
2
Na prática, a proposta de “raciocínio simultâneo” vai além de reduzir o tempo de resposta. A fala, o planejamento em segundo plano e a atividade de ferramentas assíncronas podem ocorrer em paralelo. Assim, um agente de voz poderia explicar os próximos passos enquanto aguarda dados ou executa um processo com várias etapas. A qualidade dessa experiência, porém, dependerá da confiabilidade das ferramentas, do desenho do diálogo e de a fala continuar sendo útil — e não apenas preencher o silêncio. 1
2
O Google posiciona o Gemini 3.8 Live como opção para experiências conversacionais de alto volume e baixa latência, sem atrasos associados ao raciocínio. O modelo combina diálogo ao vivo com compreensão de contexto visual, permitindo que o agente use informações visuais junto da conversa. 10
45
Representantes do Google também afirmaram que o modelo oferece suporte a 97 idiomas e pode alternar entre idiomas durante uma conversa. Desenvolvedores devem validar qualidade linguística, disponibilidade regional e desempenho para sotaques e usos específicos antes de colocá-lo em produção. 16
A cobertura do lançamento informou resultados no Speech-to-Speech Quality Index de 76,0 para o Gemini 3.8 Live e 82,6 para o Gemini 3.8 Live Extended Thinking, ante 81,5 do GPT-Live-1, da OpenAI, usando esforço médio. 25
Nessa comparação reportada, o Extended Thinking ficou à frente dos outros dois. Mas esses números não devem ser lidos como uma medição independente e definitiva de qualidade em produção. Um agente de voz também precisa lidar com interrupções, fala multilíngue e sotaques, precisão no uso de ferramentas, latência sob carga, segurança, monitoramento e custo total por tarefa resolvida. Os dados são apenas um dos sinais para avaliação. 25
A tabela oficial do Google agrupa os dois novos modelos na Live API. Na faixa paga padrão, o preço informado é de US$ 3,00 por 1 milhão de tokens, ou US$ 0,005 por minuto, para áudio de entrada, e de US$ 12,00 por 1 milhão de tokens, ou US$ 0,018 por minuto, para áudio de saída. Para texto, a entrada custa US$ 0,75 por 1 milhão de tokens e a saída — incluindo tokens de raciocínio — custa US$ 4,50. 37
A distinção importa porque valores de tokens citados para o Gemini 3.8 Flash não são automaticamente aplicáveis aos modelos Live. Para projetar orçamento, a referência deve ser a tabela atual da Live API e a documentação do modelo. Depois, vale testar sessões reais: o custo de um agente de voz depende da combinação de áudio de entrada e saída, contexto visual, texto e ferramentas associadas. 37
O Google DeepMind lista os dois modelos como disponíveis de forma geral. A tabela publicada inclui, para ambos, o app Gemini, o Google AI Studio, a Gemini API e a Google Enterprise Agent Platform. O Google Search Live aparece para o Extended Thinking, enquanto o Google Workspace é listado para o Gemini 3.8 Live. 54
Para desenvolvedores, a escolha passa a ser entre um modelo de diálogo ao vivo padrão e outro com maior capacidade de raciocínio, ambos na mesma família nativa de áudio para áudio. Para empresas, não basta saber se o modelo está disponível: é preciso verificar qual produto será usado, quais controles de dados e regiões se aplicam e qual é o caminho de integração adequado ao projeto. 54
A proposta competitiva central é uma pilha mais integrada: interação falada, compreensão visual, raciocínio em segundo plano e ferramentas assíncronas na mesma família de modelos. Em tese, isso pode reduzir a necessidade de conectar, de forma personalizada, reconhecimento de fala, modelo de texto, orquestração de ferramentas e síntese de voz — preservando a continuidade da conversa enquanto a tarefa avança. 1
10
O GPT-Live-1, da OpenAI, continua sendo uma comparação relevante, especialmente para equipes que avaliam comportamento conversacional full-duplex. Ainda assim, o benchmark reportado é estreito demais para decidir uma plataforma. Uma avaliação consistente precisa usar conversas representativas e medir tratamento de interrupções, acerto nas chamadas de ferramentas, desempenho multilíngue, controles de segurança, recuperação de falhas, latência e custo por resultado concluído. 25
O material de lançamento fornecido não define uma política precisa de marca-d’água de áudio com SynthID para o Gemini 3.8 Live ou o Extended Thinking. O Google afirma ter ampliado o SynthID para marcar e identificar textos gerados pelo app Gemini e pela experiência na web, mas isso não confirma que todo fluxo de áudio desses modelos receba marca-d’água, nem detalha condições de detecção ou implementação. 59
A mesma cautela vale para afirmações sobre o ecossistema: integrações e suporte de parceiros podem mudar rapidamente. Antes de assumir um compromisso de arquitetura, equipes devem confirmar documentação atualizada, preços, disponibilidade na plataforma e termos de serviço aplicáveis. 37
54
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Gemini 3.8 Live é voltado a escala, eficiência de custo, diálogo fluido e compreensão de contexto visual; o Extended Thinking mira tarefas complexas e em múltiplas etapas.
O Gemini 3.8 Live é voltado a escala, eficiência de custo, diálogo fluido e compreensão de contexto visual; o Extended Thinking mira tarefas complexas e em múltiplas etapas. No Extended Thinking, o agente pode continuar falando enquanto planeja, raciocina e espera chamadas assíncronas de ferramentas serem concluídas.