La frustration a éclaté quasi immédiatement. Le forum Antigravity, Reddit et X (anciennement Twitter) se sont remplis de plaintes concernant la consommation extrême des quotas . Les développeurs ayant souscrit au plan Pro d'Antigravity rapportaient que leurs forfaits, qui duraient auparavant une journée entière de travail, disparaissaient en 30 à 60 minutes après être passés à Gemini 3.5 Flash .
Une analyse chiffrée publiée sur Reddit par l'utilisateur u/tadanada a explicitement dénoncé l'inflation des coûts, comparant une session de test à 1 552 $ pour Gemini 3.5 Flash contre 278 $ pour Gemini 3 Flash — une différence de 5,6 fois qui expliquait pourquoi les forfaits payants fondaient si vite .
La réponse de Google est venue en deux vagues :
high (élevé) à medium (moyen) .Même l'augmentation de quota par 9x n'a pas entièrement résolu le problème. Certains développeurs ont signalé avoir atteint le verrouillage hebdomadaire de Flash en 30 minutes après avoir repris le travail suite à la réinitialisation .
Gemini 3.5 Flash Low représente une correction plus chirurgicale : au lieu de simplement donner plus de quota brut aux développeurs (un pansement sur l'offre), il leur offre un moyen d'utiliser moins de jetons par tâche (un contrôle sur la demande).
La documentation officielle de Google décrit le variant Low comme ayant été « considérablement amélioré pour les tâches de code et d'agent nécessitant moins d'étapes, offrant une qualité solide avec une latence et un coût moindres » . L'entreprise indique que le variant Low génère environ 45 % de jetons de sortie en moins que le variant désormais renommé Medium .
Pour les développeurs, cela signifie qu'ils peuvent désormais définir explicitement thinking_level: "low" dans leurs appels API pour la génération de code simple, les complétions basiques ou les boucles d'agents légères, et réserver un budget de réflexion plus élevé pour les tâches de raisonnement vraiment complexes. Comme l'a noté NxCode dans son guide développeur, « low est le bon réglage pour la plupart des tâches de codage agentiques », car Google l'a spécifiquement optimisé pour les flux de travail de code et d'appel d'outils .
Cela donne effectivement aux développeurs un cadran à quatre niveaux pour l'effort de raisonnement — minimal, low, medium, high — au lieu d'un choix binaire entre « réflexion activée » et « réflexion désactivée » .
L'un des plus grands pièges de l'API lors du lancement de Gemini 3.5 Flash a été la modification non annoncée du thinking_level par défaut, passé de high à medium. Les développeurs qui migraient depuis gemini-3-flash-preview sans définir explicitement un niveau de réflexion obtenaient silencieusement un comportement de raisonnement différent . Cela signifiait que même après la sortie du variant Low, de nombreux développeurs utilisaient encore plus de jetons que nécessaire pour des tâches simples, car ils n'avaient pas remarqué ce changement.
Le variant Low complète essentiellement la solution : il donne aux développeurs un niveau explicite, documenté et conçu pour le type de travail sensible aux coûts pour lequel la famille Flash avait été créée à l’origine.
Le déploiement de Gemini 3.5 Flash Low, combiné à l'augmentation des quotas par 9x et à l'ajustement du niveau de réflexion par défaut, a stabilisé l'expérience développeur sur Antigravity. Les développeurs peuvent désormais :
thinking_level: "low" pour le codage quotidien, les layouts Bootstrap ou la logique PHP qui ne nécessitent pas de raisonnement profond .Le variant Low n'est pas un remplacement des augmentations de quotas de Google — c'est un complément. Les développeurs qui utilisent à la fois le nouveau niveau de réflexion et les quotas étendus (9x) peuvent désormais mener des sessions de codage significatives sans atteindre les limites ou brûler leur budget mensuel Antigravity en un après-midi.