Après une fronde causée par une surconsommation de jetons rendant l'outil inutilisable (quotas épuisés en 30 minutes, coûts 5,5x supérieurs au modèle précédent), Google a introduit le variant Gemini 3.5 Flash Low. Ce mode Low réduit la production de jetons d'environ 45 % par rapport au mode Medium, donnant aux dével...

Create a landscape editorial hero image for this Studio Global article: What prompted Google to introduce the "Low" thinking level in Gemini 3.5 Flash on Antigravity, and how does this change address developer fr. Article summary: Google introduced the **Gemini 3.5 Flash (Low)** thinking level in Antigravity in direct response to a firestorm of developer backlash triggered by the model's launch at I/O 2026 on May 19. The core problem: Gemini 3.5 F. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Product naming/UX confusion around Gemini CLI vs Antigravity CLI and broader interface design criticism (zachtratar, kchonyc, teortaxesTex). ## Gemini 3.5 Flash: the main technica" source context "[AINews] Google I/O 2026: Gemini 3.5 Flash, Omni (NanoBanana for ..." Reference image 2: visual subject "4M views • 6
Lorsque Google a lancé Gemini 3.5 Flash lors de la conférence I/O 2026 le 19 mai, il a été présenté comme le modèle le plus performant pour les agents et le codage . Ce qui a suivi a été une semaine de grogne intense des développeurs, de modifications de quotas en urgence et d’un pivot produit silencieux qui a totalement réécrit la façon de penser du modèle.
Le problème central : le comportement de réflexion par défaut de Gemini 3.5 Flash brûlait les jetons de manière si agressive que les utilisateurs payants d'Antigravity épuisaient leurs quotas en moins d’une heure . Bien que le prix par jeton soit compétitif sur le papier — 1,50 $ par million de jetons d'entrée et 9,00 $ par million de jetons de sortie — le coût total pour accomplir une tâche réelle racontait une tout autre histoire. Artificial Analysis a constaté que l'exécution d'une suite de tests standard coûtait 1 552 $ avec Gemini 3.5 Flash, contre 282 $ pour le précédent Gemini 3 Flash — une augmentation de 450 % (5,5x)
.
La frustration a éclaté quasi immédiatement. Le forum Antigravity, Reddit et X (anciennement Twitter) se sont remplis de plaintes concernant la consommation extrême des quotas . Les développeurs ayant souscrit au plan Pro d'Antigravity rapportaient que leurs forfaits, qui duraient auparavant une journée entière de travail, disparaissaient en 30 à 60 minutes après être passés à Gemini 3.5 Flash
.
Une analyse chiffrée publiée sur Reddit par l'utilisateur u/tadanada a explicitement dénoncé l'inflation des coûts, comparant une session de test à 1 552 $ pour Gemini 3.5 Flash contre 278 $ pour Gemini 3 Flash — une différence de 5,6 fois qui expliquait pourquoi les forfaits payants fondaient si vite .
La réponse de Google est venue en deux vagues :
high (élevé) à medium (moyen) Même l'augmentation de quota par 9x n'a pas entièrement résolu le problème. Certains développeurs ont signalé avoir atteint le verrouillage hebdomadaire de Flash en 30 minutes après avoir repris le travail suite à la réinitialisation .
Gemini 3.5 Flash Low représente une correction plus chirurgicale : au lieu de simplement donner plus de quota brut aux développeurs (un pansement sur l'offre), il leur offre un moyen d'utiliser moins de jetons par tâche (un contrôle sur la demande).
La documentation officielle de Google décrit le variant Low comme ayant été « considérablement amélioré pour les tâches de code et d'agent nécessitant moins d'étapes, offrant une qualité solide avec une latence et un coût moindres » . L'entreprise indique que le variant Low génère environ 45 % de jetons de sortie en moins que le variant désormais renommé Medium
.
Pour les développeurs, cela signifie qu'ils peuvent désormais définir explicitement thinking_level: "low".
Cela donne effectivement aux développeurs un cadran à quatre niveaux pour l'effort de raisonnement — minimal, low, medium, high — au lieu d'un choix binaire entre « réflexion activée » et « réflexion désactivée » .
L'un des plus grands pièges de l'API lors du lancement de Gemini 3.5 Flash a été la modification non annoncée du thinking_level par défaut, passé de high à medium. Les développeurs qui migraient depuis gemini-3-flash-preview sans définir explicitement un niveau de réflexion obtenaient silencieusement un comportement de raisonnement différent . Cela signifiait que même après la sortie du variant Low, de nombreux développeurs utilisaient encore plus de jetons que nécessaire pour des tâches simples, car ils n'avaient pas remarqué ce changement.
Le variant Low complète essentiellement la solution : il donne aux développeurs un niveau explicite, documenté et conçu pour le type de travail sensible aux coûts pour lequel la famille Flash avait été créée à l’origine.
Le déploiement de Gemini 3.5 Flash Low, combiné à l'augmentation des quotas par 9x et à l'ajustement du niveau de réflexion par défaut, a stabilisé l'expérience développeur sur Antigravity. Les développeurs peuvent désormais :
thinking_level: "low"Le variant Low n'est pas un remplacement des augmentations de quotas de Google — c'est un complément. Les développeurs qui utilisent à la fois le nouveau niveau de réflexion et les quotas étendus (9x) peuvent désormais mener des sessions de codage significatives sans atteindre les limites ou brûler leur budget mensuel Antigravity en un après-midi.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Après une fronde causée par une surconsommation de jetons rendant l'outil inutilisable (quotas épuisés en 30 minutes, coûts 5,5x supérieurs au modèle précédent), Google a introduit le variant Gemini 3.5 Flash Low.
Après une fronde causée par une surconsommation de jetons rendant l'outil inutilisable (quotas épuisés en 30 minutes, coûts 5,5x supérieurs au modèle précédent), Google a introduit le variant Gemini 3.5 Flash Low. Ce mode Low réduit la production de jetons d'environ 45 % par rapport au mode Medium, donnant aux développeurs un contrôle direct pour les tâches simples sans sacrifier les performances pour le code.
Cette mise à jour est intervenue en même temps que deux augmentations d'urgence des quotas (9x au total) et le changement silencieux du niveau de réflexion par défaut de « high » à « medium ».