Gemini 3.8 Live cible les agents vocaux à fort volume et à coût maîtrisé ; Gemini 3.8 Live Extended Thinking est conçu pour raisonner et appeler des outils asynchrones en continuant à parler. L’enjeu ne se limite pas à des réponses vocales plus rapides : Google promet une conversation qui reste active pendant que l’...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google présente Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles audio-à-audio natifs destinés aux agents vocaux et aux échanges en direct. Le premier vise le déploiement à grande échelle, l’efficacité économique, des dialogues fluides et la prise en compte d’un contexte visuel ; le second cible les tâches complexes, en plusieurs étapes, qui requièrent davantage de raisonnement en arrière-plan. 10
2
La fonctionnalité distinctive concerne Gemini 3.8 Live Extended Thinking. Selon Google, le modèle peut raisonner en arrière-plan, planifier et appeler des outils asynchrones tout en continuant à diffuser une réponse audio. Il peut recourir à des formulations conversationnelles naturelles pendant l’exécution d’un outil plus long, au lieu de bloquer tout l’échange jusqu’à l’arrivée du résultat. 1
2
Le « raisonnement simultané » ne désigne donc pas seulement une meilleure réactivité entre deux prises de parole. Dans l’architecture décrite par Google, la synthèse vocale, la planification en arrière-plan et l’activité d’outils asynchrones peuvent avancer en parallèle. Un agent vocal pourrait ainsi expliquer la suite d’une démarche tout en attendant des données ou en exécutant un processus à plusieurs étapes. L’intérêt concret dépendra toutefois de la fiabilité des outils, de la conception du dialogue et de la capacité de l’agent à dire quelque chose d’utile plutôt que de simplement combler les silences. 1
2
Google positionne Gemini 3.8 Live comme le choix adapté aux expériences conversationnelles à faible latence et à fort volume, sans délais liés au raisonnement. Le modèle associe dialogue en direct et ancrage visuel : un agent peut donc exploiter le contexte visuel en plus de la conversation. 10
45
Des représentants de Google indiquent aussi une prise en charge de 97 langues, avec la possibilité de passer d’une langue à l’autre au cours d’un même échange. Les développeurs devront néanmoins vérifier la qualité linguistique, la disponibilité régionale et les performances selon les accents et les cas d’usage visés. 16
Des articles publiés au lancement font état de scores de 76,0 pour Gemini 3.8 Live et de 82,6 pour Gemini 3.8 Live Extended Thinking au Speech-to-Speech Quality Index, contre 81,5 pour GPT-Live-1 d’OpenAI avec un niveau d’effort intermédiaire. 25
Dans cette comparaison rapportée, Extended Thinking obtient le score le plus élevé des trois. Cela ne constitue toutefois pas une mesure indépendante et exhaustive de la qualité en production. Un agent vocal doit aussi gérer les interruptions, la parole multilingue ou accentuée, la fiabilité des outils, la latence en charge, la sécurité, l’observabilité et le coût total par tâche réellement résolue. Ces chiffres sont un indicateur parmi d’autres, pas la preuve qu’un système sera le meilleur dans tous les centres de contact ou assistants. 25
La grille tarifaire officielle de Google regroupe les deux nouveaux modèles dans la Live API. En offre standard payante, elle affiche 3,00 $ par million de jetons, soit 0,005 $ par minute, pour l’audio en entrée, et 12,00 $ par million de jetons, soit 0,018 $ par minute, pour l’audio en sortie. Le texte en entrée est facturé 0,75 $ par million de jetons et le texte en sortie — y compris les jetons de raisonnement — 4,50 $ par million. 37
Cette distinction est importante : les prix parfois cités pour Gemini 3.8 Flash ne s’appliquent pas automatiquement aux modèles Live. Pour établir un budget, il faut s’appuyer sur la grille Live API et la documentation à jour, puis tester des sessions représentatives. Le coût d’un agent vocal dépend de sa combinaison d’audio entrant et sortant, de contexte visuel, de texte et d’outils associés. 37
Google DeepMind classe les deux modèles comme généralement disponibles. Sa table de disponibilité mentionne, pour les deux modèles, l’application Gemini, Google AI Studio, l’API Gemini et Google Enterprise Agent Platform. Elle répertorie Google Search Live pour Extended Thinking, et Google Workspace pour Gemini 3.8 Live. 54
Pour les développeurs, le choix se fait donc entre un modèle de dialogue en direct standard et un modèle davantage orienté raisonnement, au sein d’une même famille audio-à-audio. Pour les entreprises, il faut aussi vérifier le produit concerné, les contrôles de données, la région géographique et le chemin d’intégration correspondant au déploiement envisagé. 54
La proposition de Google repose sur une pile plus intégrée : interaction parlée, ancrage visuel, raisonnement en arrière-plan et outils asynchrones réunis dans une même famille de modèles. En théorie, cela peut réduire le travail d’assemblage entre reconnaissance vocale, modèle textuel, orchestration d’outils et synthèse vocale, tout en maintenant la continuité de l’échange pendant l’exécution d’une tâche. 1
10
GPT-Live-1 d’OpenAI reste un point de comparaison pertinent, notamment pour les équipes qui évaluent le comportement conversationnel en duplex intégral. Mais le benchmark évoqué est trop limité pour trancher un choix de plateforme. Une évaluation sérieuse devrait s’appuyer sur des appels représentatifs et mesurer la gestion des interruptions, la justesse des appels d’outils, les performances multilingues, les contrôles de sécurité, la récupération après incident, la latence et le coût par résultat obtenu. 25
Les documents de lancement fournis n’établissent pas de politique précise de filigrane audio SynthID pour Gemini 3.8 Live ou Extended Thinking. Google indique avoir étendu SynthID au filigranage et à l’identification de texte généré par l’application et l’expérience web Gemini, mais cette déclaration ne confirme pas que chaque flux audio issu de ces modèles Live soit filigrané, ni les modalités de détection ou de déploiement. 59
Même prudence pour les annonces liées à l’écosystème : les intégrations et la prise en charge par des partenaires peuvent évoluer vite. Avant de figer une architecture, les équipes ont intérêt à vérifier la documentation des modèles, les prix, la disponibilité des plateformes et les conditions de service applicables. 37
54
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Gemini 3.8 Live cible les agents vocaux à fort volume et à coût maîtrisé ; Gemini 3.8 Live Extended Thinking est conçu pour raisonner et appeler des outils asynchrones en continuant à parler.
Gemini 3.8 Live cible les agents vocaux à fort volume et à coût maîtrisé ; Gemini 3.8 Live Extended Thinking est conçu pour raisonner et appeler des outils asynchrones en continuant à parler. L’enjeu ne se limite pas à des réponses vocales plus rapides : Google promet une conversation qui reste active pendant que l’agent planifie, attend un outil ou traite un résultat.