Gemini 3.7 Flash : le modèle « workhorse » de Google privilégie la vitesse à la course aux benchmarks
Gemini 3.7 Flash a été lancé le 13 août 2026 comme modèle polyvalent de Google pour le codage, le développement web et les agents. Son API coûte 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie jusqu’au 31 décembre 2026, avant de passer à 1,50 et 7,50 dollars le 1er janvier 2027.
Gemini 3.7 Flash a été lancé le 13 août 2026 comme modèle polyvalent de Google pour le codage, le développement web et les agents.
Son API coûte 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie jusqu’au 31 décembre 2026, avant de passer à 1,50 et 7,50 dollars le 1er janvier 2027.
Avec un score Intelligence Index de 56 et une génération mesurée à environ 340 tokens par seconde, Flash privilégie le débit et le coût total des boucles d’agents plutôt que la première place dans tous les benchmarks.
L’affirmation de Google selon laquelle il s’agit de son modèle à la croissance la plus rapide reste invérifiable : aucun volume d’utilisation, période de mesure ou comparateur n’est fourni dans les éléments disponibles.
What is Gemini 3.7 Flash, when did it launch, where is it available, and why does Google call it its fastest-growing model ever despite discGemini 3.7 Flash is positioned as Google’s fast, lower-cost workhorse for coding and agentic workflows.
Prompt IA
Create a landscape editorial hero image for this Studio Global article: What is Gemini 3.7 Flash, when did it launch, where is it available, and why does Google call it its fastest-growing model ever despite disc. Article summary: Gemini 3.7 Flash is Google’s production “workhorse” Gemini model for complex coding, web development, and tool-using agents. It launched on August 13, 2026, and is available through the Gemini API/AI Studio, Google Antig. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
openai.com
Gemini 3.7 Flash est le nouveau modèle de production « workhorse » de Google : un outil conçu pour le codage complexe, le développement web, l’utilisation d’outils et les workflows d’agents en plusieurs étapes. Il a été lancé le 13 août 2026 et est accessible via l’API Gemini, Google AI Studio, Google Antigravity et la Gemini Enterprise Agent Platform.
Son principal argument n’est pas de dominer chaque classement d’intelligence. Google défend plutôt un compromis entre capacités proches du haut de gamme, vitesse de génération très élevée et prix d’appel réduit. Une combinaison particulièrement intéressante pour les développeurs qui font tourner des agents en boucle — lecture de contexte, appel d’outils, vérification du résultat, correction et nouvelle tentative.
« Le modèle à la croissance la plus rapide » : une affirmation à nuancer
Google présente Gemini 3.7 Flash comme son modèle à la croissance la plus rapide. Mais les éléments disponibles ne permettent pas de vérifier cette affirmation. Google ne fournit ni base d’utilisateurs de référence, ni période de mesure, ni nombre de développeurs actifs, ni volume de tokens, ni modèle concurrent servant de comparaison.
La conclusion la plus solide est donc plus limitée : Google positionne Flash pour une adoption rapide auprès des développeurs. Son tarif de lancement bas et sa présence dans plusieurs produits de développement de Google vont dans ce sens. En revanche, le superlatif de croissance doit être considéré comme une déclaration de l’entreprise, et non comme une statistique indépendante établie.
Prix : une offre très basse au lancement, mais temporaire
Jusqu’au 31 décembre 2026, les tarifs d’appel de l’API Gemini 3.7 Flash sont les suivants :
Entrée : 0,75 dollar par million de tokens
Studio Global AI
Continuez vos recherches
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Quelle est la réponse courte à « Gemini 3.7 Flash : le modèle « workhorse » de Google privilégie la vitesse à la course aux benchmarks » ?
Gemini 3.7 Flash a été lancé le 13 août 2026 comme modèle polyvalent de Google pour le codage, le développement web et les agents.
Quels sont les points clés à valider en premier ?
Gemini 3.7 Flash a été lancé le 13 août 2026 comme modèle polyvalent de Google pour le codage, le développement web et les agents. Son API coûte 0,75 dollar par million de tokens en entrée et 3,75 dollars en sortie jusqu’au 31 décembre 2026, avant de passer à 1,50 et 7,50 dollars le 1er janvier 2027.
Que dois-je faire ensuite en pratique ?
Avec un score Intelligence Index de 56 et une génération mesurée à environ 340 tokens par seconde, Flash privilégie le débit et le coût total des boucles d’agents plutôt que la première place dans tous les benchmarks.
Sortie, tokens de réflexion compris : 3,75 dollars par million de tokens
À partir du 1er janvier 2027, les tarifs standards passeront à 1,50 dollar par million de tokens en entrée et 7,50 dollars en sortie : ils doubleront donc exactement. Les tarifs indiqués pour les usages remisés ou de type batch passeront également de 0,375/1,875 à 0,75/3,75 dollar par million de tokens en entrée et en sortie.
Cette date d’expiration est importante pour les équipes qui préparent une architecture durable. Un service qui semble exceptionnellement bon marché pendant la période de lancement doit être recalculé avec les tarifs de 2027 avant tout engagement à long terme.
Le prix par token ne suffit toutefois pas à estimer la facture d’un agent. Le coût réel dépend de la longueur du contexte, du nombre d’appels d’outils, des nouvelles tentatives, de la réutilisation du contexte, du niveau de raisonnement et du volume de sortie. Le coût annoncé pour une tâche de benchmark ne constitue donc pas une garantie de prix pour un workflow complet en production.
Vitesse et niveau d’intelligence
Selon les données indépendantes d’Artificial Analysis, Gemini 3.7 Flash obtient un score de 56 sur l’Intelligence Index. Il se place devant Claude Sonnet 5, à 55, mais juste derrière GPT-5.6 Terra, à 57, dans la comparaison citée.
La vitesse est sa différence la plus nette. Artificial Analysis a mesuré environ 340 tokens générés par seconde et un score moyen de temps par tâche de 1,7. L’organisme indique que Flash est environ 40 % plus rapide que GPT-5.6 Terra avec le niveau de raisonnement maximal.
Ces chiffres correspondent à des mesures de modèle ou de fournisseur et ne prédisent pas uniformément l’expérience de chaque application. Les conditions réseau, le routage du fournisseur, la taille du prompt, la latence des outils et les paramètres de raisonnement peuvent modifier le temps de réponse réellement observé.
Codage et workflows d’agents
Google annonce des progrès importants par rapport à Gemini 3.6 Flash dans l’ingénierie logicielle, le débogage, la résolution d’incidents, le développement web et les workflows agentiques. Les résultats de codage cités comprennent notamment :
43,6 % sur FrontierCode 1.1 Main, contre 34,4 % pour Gemini 3.6 Flash.
1 588 Elo sur Code Arena pour le développement web.
85,8 % sur Terminal-Bench 2.1, contre 80,4 % pour Claude Sonnet 5 et 87,4 % pour GPT-5.6 Terra dans la comparaison de Google.
Ces résultats décrivent un modèle solide pour le codage et les agents opérant dans un terminal, mais pas un vainqueur incontestable. GPT-5.6 Terra reste devant sur le résultat Terminal-Bench cité. L’avantage de Flash se situe plutôt du côté de la vitesse et du prix de lancement.
ARC-AGI : de bons résultats pour un coût par tâche réduit
Avec un niveau de raisonnement élevé, ARC Prize indique que Gemini 3.7 Flash atteint :
95,5 % sur ARC-AGI-1 Semi-Private, pour 0,12 dollar par tâche ;
84,6 % sur ARC-AGI-2 Semi-Private, pour 0,25 dollar par tâche.
Ces résultats sont élevés, en particulier au regard du coût annoncé par tâche. Ils doivent néanmoins être interprétés comme un signal de benchmark, et non comme une prévision directe de la fiabilité d’un agent logiciel. En production, un agent peut effectuer plusieurs appels au modèle, utiliser des outils externes, recommencer une action échouée et traiter un contexte beaucoup plus important qu’une tâche de test.
Comparaison avec les modèles concurrents
Modèle
Prix indiqué par million de tokens, entrée/sortie
Position selon les éléments disponibles
Gemini 3.7 Flash
0,75 / 3,75 dollar au lancement
Intelligence Index de 56 ; environ 340 tokens générés par seconde ; conçu pour le codage à haut débit et les workflows d’agents.
GPT-5.6 Terra
2 / 12 dollars
Score de 57 et meilleur résultat Terminal-Bench cité, mais tarifs plus élevés et vitesse inférieure selon les comparaisons disponibles.
Claude Sonnet 5
2 / 10 dollars
Concurrent proche pour le codage et les agents en production, avec un score Intelligence Index cité de 55.
Claude Opus 5
5 / 25 dollars
Modèle plus coûteux, positionné sur les tâches de codage agentique plus difficiles.
Qwen3.8-Max
2 / 6 dollars
Les résultats rapportés incluent 67,7 sur SWE-bench Pro et 86,6 sur Terminal-Bench 2.1 ; ses tarifs sont supérieurs au prix de lancement de Flash.
GLM-5.3
1,40 / 4,40 dollar
Proche de Flash sur le prix affiché, mais les éléments disponibles ne permettent pas une comparaison indépendante équivalente sur l’intelligence ou le coût par tâche.
Nemotron 3.5 Lightning
0,05 / 0,20 dollar en hébergement indiqué
Beaucoup moins cher au tarif nominal, mais les données disponibles sont insuffisantes pour une comparaison rigoureuse et équivalente avec Flash.
Ce tableau ne constitue pas un classement universel. Les modèles ont été évalués dans des tests différents et les sources ne fournissent pas de protocole contrôlé unique pour l’ensemble des concurrents. Les tarifs peuvent aussi correspondre à des conditions différentes d’hébergement, de remise ou de disponibilité.
Le pari stratégique de Google : le débit plutôt que le meilleur score
Les comparaisons disponibles suggèrent un choix de positionnement délibéré. Gemini 3.7 Flash est proche du haut du panier sur l’Intelligence Index cité, mais il n’obtient pas le meilleur score : GPT-5.6 Terra le devance légèrement avec 57 et arrive également en tête de la comparaison Terminal-Bench citée.
Google met donc l’accent sur l’équilibre entre intelligence, latence et coût. Un modèle suffisamment rapide pour le développement interactif et suffisamment abordable pour des appels répétés peut être plus utile à une plateforme d’agents qu’un modèle plus lent et plus cher, même si celui-ci gagne un benchmark précis.
Ce compromis compte pour les assistants de programmation, la résolution automatisée d’incidents, les agents de développement web et les workflows qui lisent plusieurs fois le contexte, appellent des outils, inspectent leurs résultats et réessaient. Dans cette logique, la vitesse et le coût d’une boucle complète peuvent peser davantage que quelques points sur un classement isolé.
La vague de sorties de modèles d’août 2026 accentue cette compétition. Qwen3.8-Max renforce la concurrence dans les agents et l’ingénierie logicielle, tandis que GLM-5.3 et Nemotron 3.5 Lightning exercent une pression sur les prix et l’efficacité. Claude Opus 5 et GPT-5.6 visent davantage les capacités de pointe, alors que Claude Sonnet 5 reste une alternative de production directe.
Verdict
Gemini 3.7 Flash doit être compris comme un modèle de travail à haut débit, et non comme le modèle incontestablement le plus intelligent. Son dossier repose sur un score Intelligence Index de 56, une génération d’environ 340 tokens par seconde, de bons résultats en codage et dans les agents de terminal, ainsi qu’un tarif de lancement exceptionnellement bas.
Pour les développeurs, la principale réserve est financière plutôt que technique : les tarifs de 0,75 dollar en entrée et 3,75 dollars en sortie expirent le 31 décembre 2026. Dès le lendemain, les tarifs standards de 1,50 et 7,50 dollars s’appliqueront.
L’affirmation de Google sur la croissance de Flash pourra être confirmée ou infirmée lorsque des chiffres d’usage seront disponibles. À ce stade, les éléments établissent surtout une stratégie claire : faire de l’inférence rapide et abordable le choix par défaut pour les applications qui misent sur le volume des appels et les boucles d’agents, plutôt que chercher à remporter chaque benchmark d’intelligence brute.
eesel.ai
Gemini 3.7 Flash review: benchmarks, real pricing, and the ...