Une analyse chiffrée publiée sur Reddit par l'utilisateur u/tadanada a explicitement dénoncé l'inflation des coûts, comparant une session de test à 1 552 $ pour Gemini 3.5 Flash contre 278 $ pour Gemini 3 Flash — une différence de 5,6 fois qui expliquait pourquoi les forfaits payants fondaient si vite .
La réponse de Google est venue en deux vagues :
high (élevé) à medium (moyen) Même l'augmentation de quota par 9x n'a pas entièrement résolu le problème. Certains développeurs ont signalé avoir atteint le verrouillage hebdomadaire de Flash en 30 minutes après avoir repris le travail suite à la réinitialisation .
Gemini 3.5 Flash Low représente une correction plus chirurgicale : au lieu de simplement donner plus de quota brut aux développeurs (un pansement sur l'offre), il leur offre un moyen d'utiliser moins de jetons par tâche (un contrôle sur la demande).
La documentation officielle de Google décrit le variant Low comme ayant été « considérablement amélioré pour les tâches de code et d'agent nécessitant moins d'étapes, offrant une qualité solide avec une latence et un coût moindres » . L'entreprise indique que le variant Low génère environ 45 % de jetons de sortie en moins que le variant désormais renommé Medium
.
Pour les développeurs, cela signifie qu'ils peuvent désormais définir explicitement thinking_level: "low".
Cela donne effectivement aux développeurs un cadran à quatre niveaux pour l'effort de raisonnement — minimal, low, medium, high — au lieu d'un choix binaire entre « réflexion activée » et « réflexion désactivée » .
L'un des plus grands pièges de l'API lors du lancement de Gemini 3.5 Flash a été la modification non annoncée du thinking_level par défaut, passé de high à medium. Les développeurs qui migraient depuis gemini-3-flash-preview sans définir explicitement un niveau de réflexion obtenaient silencieusement un comportement de raisonnement différent . Cela signifiait que même après la sortie du variant Low, de nombreux développeurs utilisaient encore plus de jetons que nécessaire pour des tâches simples, car ils n'avaient pas remarqué ce changement.
Le variant Low complète essentiellement la solution : il donne aux développeurs un niveau explicite, documenté et conçu pour le type de travail sensible aux coûts pour lequel la famille Flash avait été créée à l’origine.
Le déploiement de Gemini 3.5 Flash Low, combiné à l'augmentation des quotas par 9x et à l'ajustement du niveau de réflexion par défaut, a stabilisé l'expérience développeur sur Antigravity. Les développeurs peuvent désormais :
thinking_level: "low"Le variant Low n'est pas un remplacement des augmentations de quotas de Google — c'est un complément. Les développeurs qui utilisent à la fois le nouveau niveau de réflexion et les quotas étendus (9x) peuvent désormais mener des sessions de codage significatives sans atteindre les limites ou brûler leur budget mensuel Antigravity en un après-midi.