Gemini 3.5 Transcribe est le nouveau modèle de reconnaissance vocale de Google et le successeur de Chirp 3. Le modèle cherche à produire un texte directement exploitable : il retire les mots de remplissage, intègre les autocorrections, applique une mise en forme, accepte un vocabulaire personnalisé et détecte automa...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.5 Transcribe, including how it improves on the previous Chirp 3 speech-to-text engine in accuracy an. Article summary: Google introduced Gemini 3.5 Transcribe as its most precise speech-to-text model, positioning it as a faster, more intelligent successor to Chirp 3 that converts spoken input into polished, structured text rather than a . Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Google présente Gemini 3.5 Transcribe comme son modèle de conversion de la parole en texte « le plus précis à ce jour ». Mais sa nouveauté ne tient pas seulement à la réduction du nombre d’erreurs : le système tente aussi de transformer une parole spontanée, hachée ou pleine de reprises en un texte propre et structuré. 1 12
Cette approche le destine particulièrement à la dictée de messages, de notes ou de réponses dans des formulaires. Elle implique toutefois un compromis important : plus le texte est retravaillé, moins il constitue forcément une retranscription exacte de ce qui a été dit.
Gemini 3.5 Transcribe repose sur ce que Google appelle la « transcription intelligente ». Le modèle peut supprimer les hésitations comme « euh », intégrer la correction apportée par un locuteur, ajouter la ponctuation et appliquer une mise en forme. Il peut également exécuter des consignes de modification à la voix et convertir des fragments désordonnés en une prose plus lisible. 1 8 12
En pratique, il n’est donc plus nécessaire de dicter comme à une machine en formulant chaque phrase parfaitement. L’utilisateur peut parler sous forme de brouillon, puis obtenir un résultat qui ressemble davantage à un message finalisé ou à un paragraphe prêt à être repris.
Google indique aussi que le modèle est conçu pour mieux gérer le bruit ambiant, la terminologie technique et le vocabulaire spécialisé. Un vocabulaire personnalisé peut être fourni afin d’améliorer l’orthographe de noms propres, de produits ou de termes propres à un domaine. Gemini 3.5 Transcribe détecte automatiquement plus de 85 langues. 1 7
Pour les fichiers audio préenregistrés, il peut fournir des horodatages et distinguer jusqu’à trois personnes, ce qui permet d’associer les passages transcrits aux différents interlocuteurs. 1
Google présente Gemini 3.5 Transcribe comme une amélioration majeure de son précédent modèle de transcription, Chirp 3. Des résultats attribués à Artificial Analysis font état d’un taux d’erreur de mots de 2,6 % pour l’audio hors streaming et de 4,0 % en streaming, ainsi que d’une réduction de 70 % du temps nécessaire pour obtenir la transcription finale. 3 4 9
Ces chiffres ne constituent pas une garantie valable pour toutes les situations. Le taux d’erreur varie selon la langue, l’accent, la qualité de l’enregistrement, le bruit de fond et le jeu de données utilisé pour l’évaluation. Les propres documents de Google citent notamment le benchmark FLEURS, avec un taux d’erreur de 5,50 % en mode streaming dans certaines langues et régions ; ces résultats ne sont pas directement comparables à toutes les mesures de tierce partie, car les conditions de test diffèrent. 1
L’objectif général est néanmoins clair : réduire le délai dans les échanges en direct tout en produisant un résultat final plus propre pour la dictée et les enregistrements.
Google distingue deux voies d’intégration selon le type d’application.
Le mode direct s’adresse aux services qui reçoivent un flux audio continu et doivent répondre rapidement. La Live API traite des flux de voix, de texte et d’images avec une faible latence, et peut fournir la transcription de la voix de l’utilisateur comme celle de la réponse du modèle. 12 20
Cette solution peut servir aux assistants vocaux, aux sous-titres en direct et aux interfaces conversationnelles. La documentation de l’API distingue par ailleurs les modes de requête unitaire, de streaming et d’interaction en temps réel. 24
Pour un enregistrement existant, les développeurs peuvent envoyer ou référencer un fichier audio dans le flux d’interaction de l’API Gemini. Ce mode convient mieux aux cas où les horodatages, le formatage, le vocabulaire personnalisé et l’identification des intervenants comptent davantage qu’une réponse immédiate. 1 12 18
Google recommande l’Interactions API comme interface standard pour les nouvelles applications Gemini. La Live API reste destinée aux expériences vocales et visuelles continues, nécessitant une faible latence. 19 20
Gemini 3.5 Transcribe n’est pas limité à une démonstration pour développeurs. Il alimente déjà Rambler, la fonction de dictée de Gboard sur Android, ainsi que l’application Gemini sur macOS. 2 13 26
Google prévoit également d’intégrer cette technologie à Chrome. Les utilisateurs pourraient alors dicter directement dans n’importe quel champ de texte sur le Web : messages, publications, formulaires ou consignes envoyées à un assistant. 1 8 13
Le modèle rejoint Gemini 3.5 Live et Gemini 3.5 Live Experimental au sein de l’offre audio regroupée sous le nom de « Gemini Audio ». Transcribe se concentre sur la conversion de la parole en texte, tandis que les modèles Live visent les interactions vocales. 12 26
La principale qualité de Gemini 3.5 Transcribe est aussi sa limite. Supprimer les hésitations et fusionner les corrections rend le résultat plus agréable à lire, mais modifie le lien entre l’enregistrement et le texte obtenu.
Une version finalisée peut effacer une hésitation significative, ne conserver que la formulation corrigée ou lisser la manière de parler d’une personne. C’est généralement utile pour rédiger un message ou prendre des notes. C’est beaucoup moins souhaitable lorsqu’il faut conserver les mots exacts.
Pour une interview, un document juridique ou médical, un travail de recherche, un relevé destiné à l’accessibilité ou une citation, mieux vaut donc conserver l’audio original et vérifier les passages importants. Sauf si une implémentation propose clairement un mode verbatim, Gemini 3.5 Transcribe doit être considéré comme un outil de transcription intelligente et de réécriture — pas comme un enregistreur neutre qui retranscrit chaque mot.
Avec Gemini 3.5 Transcribe, Google rapproche la reconnaissance vocale de l’écriture assistée. Le modèle combine transcription, nettoyage, mise en forme, détection des langues, vocabulaire personnalisé et identification des interlocuteurs, avec des parcours distincts pour l’audio en direct et les fichiers enregistrés. 1 12
Pour les développeurs, cela pourrait réduire le traitement à effectuer après la reconnaissance vocale. Pour les utilisateurs, la dictée pourrait davantage ressembler à la remise d’un brouillon à un éditeur qu’à une conversation avec un logiciel qui exige une élocution parfaite.
La question essentielle n’est donc plus seulement de savoir si le modèle produit un texte plus propre. Il faut surtout déterminer si l’application a besoin d’un texte propre — ou d’un compte rendu exact de ce qui a été dit.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Gemini 3.5 Transcribe est le nouveau modèle de reconnaissance vocale de Google et le successeur de Chirp 3.
Gemini 3.5 Transcribe est le nouveau modèle de reconnaissance vocale de Google et le successeur de Chirp 3. Le modèle cherche à produire un texte directement exploitable : il retire les mots de remplissage, intègre les autocorrections, applique une mise en forme, accepte un vocabulaire personnalisé et détecte automatiquemen...
Les développeurs disposent de flux distincts pour l’audio en temps réel et les fichiers enregistrés.