Le modèle n’attend pas la fin d’une prise de parole. Il reçoit le flux audio et génère la traduction de manière incrémentale, en parallèle. Google explique qu’il reste « à peine quelques secondes derrière chaque locuteur », éliminant ainsi les pauses gênantes qui coupent le naturel d’une conversation .
Inutile de paramétrer manuellement la langue source. Le modèle identifie automatiquement la langue parlée, même dans des environnements où plusieurs langues se mélangent, ce qui le rend idéal pour des échanges dynamiques .
Un point crucial pour l’expérience utilisateur : la traduction ne sonne pas comme une voix de robot. Le modèle est conçu pour conserver l’intonation, le rythme et la hauteur de voix d’origine. Résultat, la voix traduite ressemble bien plus à celle du locuteur initial qu’à une voix de synthèse classique .
Avec ses 70 langues et plus, le modèle couvre des milliers de paires bidirectionnelles. Il est pensé pour les conversations à deux, où chacun peut entendre les paroles de l’autre traduites dans sa propre langue, de manière fluide .
Pour les développeurs, l’accès se fait via l’API Gemini Live. L’entrée audio doit être au format PCM 16 bits, little-endian, échantillonnée à 16 kHz. La sortie audio traduite est également en PCM 16 bits, mais à une fréquence d’échantillonnage supérieure de 24 kHz . La fenêtre de contexte du modèle accepte jusqu’à 128 000 tokens en entrée et 64 000 en sortie
.
Le chemin vers ce lancement public s’est fait par étapes, la famille de modèles Gemini 3.5 ayant été annoncée lors de la conférence Google I/O en mai 2026 .
gemini-3.1-flash-live-preview le 26 mars 2026 gemini-3.5-live-translate-preview est officiellement proposé aux développeurs via l’API Gemini Live et Google AI Studio, et au grand public via les applications Google Traduction sur Android et iOS Le modèle est accessible sur une large palette de produits Google, grand public comme professionnels, avec des niveaux d’accès différents.
C’est le moyen le plus simple pour le grand public. La fonction est en cours de déploiement mondial dans l’application Google Traduction. Il suffit d’appuyer sur le bouton « Traduction en direct » en bas à gauche de l’écran, tout en portant des écouteurs. Sur Android, un « mode écoute » mains libres est également déployé : il diffuse la traduction directement par le haut-parleur du téléphone, que l’on peut alors tenir contre l’oreille comme pour un appel classique .
Pour les développeurs, le modèle est disponible en aperçu public. Cela permet de l’intégrer dans des applications et services tiers via l’API Gemini Live, avec une configuration de traduction spécifique. Google AI Studio offre aussi un environnement « bac à sable » pour prototyper et tester .
L’accès est plus restreint côté entreprises. Pour l’instant, Gemini 3.5 Live Translate est lancé en aperçu privé auprès de certains clients Google Workspace à partir de juin 2026. Quand cette fonctionnalité sera activée, elle détectera automatiquement la langue d’un participant et la traduira dans la langue préférée de chaque interlocuteur, avec un support de plus de 70 langues et 2 000 paires linguistiques en réunion. Un déploiement plus large est prévu plus tard en 2026 . Cette fonction est réservée aux abonnés Google Workspace Business Standard et Plus, Enterprise Standard et Plus, ainsi qu’à Google AI Pro et Google AI Ultra
.
Des plateformes de communication en temps réel comme Agora, Fishjam, LiveKit, Pipecat ou Vision Agents travaillent déjà à l’intégration de l’API Gemini Live pour intégrer la traduction dans leurs propres flux média .
L’un des tests les plus concrets se passe chez Grab, la plateforme de VTC et de livraison en Asie du Sud-Est. Grab expérimente cette technologie pour offrir une traduction vocale en temps réel entre chauffeurs et passagers. Avec plus de 10 millions d’appels vocaux traités chaque mois, ce pilote s’attaque de front au défi d’un marché linguistiquement très fragmenté .
Le passage d’une traduction tour par tour à une traduction en continu est une rupture majeure dans l’expérience utilisateur. En intégrant ce modèle de manière profonde dans des produits aussi universels que Google Traduction et Meet, et en l’ouvrant aux développeurs, Google transforme la traduction vocale instantanée, qui passe d’une fonctionnalité de niche à une couche d’infrastructure standard pour la communication mondiale . Le pilote avec Grab illustre bien ce changement : la traduction, instantanée et naturelle, devient un outil utilitaire plutôt qu’un gadget
.
Tous les fichiers audio générés par l’IA sont filigranés avec la technologie SynthID de Google, afin de garantir la traçabilité de leur origine et d’en prévenir une éventuelle utilisation malveillante – une précaution indispensable à mesure que les voix de synthèse gagnent en réalisme .