Gemini 3.5 Flash Low ist Googles Reaktion auf eine Entwickler Revolte: Das Standard Denkverhalten verbrauchte Kontingente in unter einer Stunde und ließ die Kosten für Aufgaben im Vergleich zum Vorgängermodell um das... Die Low Variante reduziert die Token Ausgabe im Vergleich zur jetzt in Medium umbenannten Variant...

Create a landscape editorial hero image for this Studio Global article: What prompted Google to introduce the "Low" thinking level in Gemini 3.5 Flash on Antigravity, and how does this change address developer fr. Article summary: Google introduced the **Gemini 3.5 Flash (Low)** thinking level in Antigravity in direct response to a firestorm of developer backlash triggered by the model's launch at I/O 2026 on May 19. The core problem: Gemini 3.5 F. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Product naming/UX confusion around Gemini CLI vs Antigravity CLI and broader interface design criticism (zachtratar, kchonyc, teortaxesTex). ## Gemini 3.5 Flash: the main technica" source context "[AINews] Google I/O 2026: Gemini 3.5 Flash, Omni (NanoBanana for ..." Reference image 2: visual subject "4M views • 6
Als Google Gemini 3.5 Flash am 19. Mai auf der Entwicklerkonferenz I/O 2026 vorstellte, wurde es als das bisher stärkste Modell für agentenbasierte Aufgaben und die Programmierung angepriesen . Was folgte, war eine Woche voller Frustration unter Entwicklern, hastiger Kontingentänderungen und ein stiller Produkt-Schwenk, der die Funktionsweise des Modells grundlegend umschrieb.
Das Kernproblem: Das standardmäßige Denkverhalten von Gemini 3.5 Flash verbrannte Token so aggressiv, dass zahlende Antigravity-Nutzer ihre Kontingente in weniger als einer Stunde aufgebraucht hatten . Obwohl die Preisgestaltung pro Token auf den ersten Blick wettbewerbsfähig aussah – 1,50 $ pro Million Eingabe-Token und 9,00 $ pro Million Ausgabe-Token – erzählten die tatsächlichen Kosten für die Aufgabenerledigung eine andere Geschichte. Eine Analyse von Artificial Analysis ergab, dass die Durchführung einer Standard-Benchmark-Suite 1.552 $ mit Gemini 3.5 Flash kostete, verglichen mit 282 $ für das vorherige Gemini 3 Flash – ein Anstieg um das 5,5-Fache
.
Die Frustration der Entwickler brach fast sofort aus. Die Foren von Antigravity, Reddit und X füllten sich mit Beschwerden über den extremen Verbrauch von Kontingenten . Entwickler, die für den Pro-Plan von Antigravity bezahlten, berichteten, dass ihre Kontingente, die zuvor für einen ganzen Arbeitstag ausreichten, nach der Umstellung auf Gemini 3.5 Flash innerhalb von 30 bis 60 Minuten aufgebraucht waren
.
Eine quantitative Analyse, die auf Reddit von u/tadanada veröffentlicht wurde, prangerte die Kosteninflation explizit an und verglich einen Benchmark-Durchlauf für 1.552 $ bei Gemini 3.5 Flash mit 278 $ bei Gemini 3 Flash – ein Kostenunterschied von 560 %, der erklärte, warum die kostenpflichtigen Pläne so schnell zusammenbrachen .
Googles Antwort erfolgte in zwei Wellen:
hoch auf mittel Selbst die 9-fache Erhöhung der Kontingente löste das Problem nicht vollständig. Einige Entwickler berichteten, dass sie ihre wöchentliche Flash-Sperre bereits nach 30 Minuten Arbeitszeit nach dem Kontingent-Reset erreichten .
Gemini 3.5 Flash Low stellt einen präziseren Eingriff dar: Anstatt den Entwicklern einfach nur mehr rohes Kontingent zu geben (ein angebotsseitiges Pflaster), erhielten sie eine Möglichkeit, weniger Token pro Aufgabe zu verbrauchen (eine nachfrageseitige Kontrolle).
Die offizielle Dokumentation von Google beschreibt die Low-Variante als „deutlich verbessert für Code- und agentenbasierte Aufgaben, die weniger Schritte erfordern, und bietet starke Qualität bei geringerer Latenz und niedrigeren Kosten“ . Das Unternehmen gibt an, dass die Low-Variante etwa 45 % weniger Ausgabe-Token generiert als die nun in Medium umbenannte Variante
.
Für Entwickler bedeutet dies, dass sie nun explizit thinking_level: "low".
Dies gibt Entwicklern effektiv eine vierstufige Steuerung für den Denkaufwand – minimal, niedrig, mittel, hoch – anstelle einer binären Wahl zwischen "Denken an" und "Denken aus" .
Eine der größten API-Fallen beim Start von Gemini 3.5 Flash war die nicht angekündigte Änderung des standardmäßigen thinking_level von hoch auf mittel. Entwickler, die direkt von gemini-3-flash-preview migrierten, ohne explizit ein Denkniveau festzulegen, erhielten stillschweigend ein anderes Denkverhalten . Dies bedeutete, dass selbst nach der Einführung der Low-Variante viele Entwickler für einfache Aufgaben immer noch mehr Token als nötig verbrauchten, weil sie nicht bemerkt hatten, dass der Standardwert sich verschoben hatte.
Die Low-Variante vervollständigt die Lösung im Grunde: Sie gibt Entwicklern ein explizites, dokumentiertes und zweckgebundenes Niveau für die Art von kostenkritischer Arbeit, für die die Flash-Familie ursprünglich entwickelt wurde.
Die Einführung von Gemini 3.5 Flash Low, kombiniert mit der 9-fachen Kontingenterhöhung und der Anpassung des Standard-Denkniveaus, hat die Erfahrung der Antigravity-Entwickler stabilisiert. Entwickler können jetzt:
thinking_level: "low"Die Low-Variante ist kein Ersatz für Googles Kontingenterhöhungen – sie ist eine Ergänzung. Entwickler, die sowohl das neue Denkniveau als auch die um das 9-Fache erweiterten Kontingente nutzen, können jetzt sinnvolle Programmiersitzungen durchführen, ohne an Grenzen zu stoßen oder ihre monatlichen Antigravity-Budgets an einem Nachmittag zu verbrauchen.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Gemini 3.5 Flash Low ist Googles Reaktion auf eine Entwickler Revolte: Das Standard Denkverhalten verbrauchte Kontingente in unter einer Stunde und ließ die Kosten für Aufgaben im Vergleich zum Vorgängermodell um das...
Gemini 3.5 Flash Low ist Googles Reaktion auf eine Entwickler Revolte: Das Standard Denkverhalten verbrauchte Kontingente in unter einer Stunde und ließ die Kosten für Aufgaben im Vergleich zum Vorgängermodell um das... Die Low Variante reduziert die Token Ausgabe im Vergleich zur jetzt in Medium umbenannten Variante um etwa 45 % und gibt Entwicklern eine direkte Kontrolle, um die Kosten für einfache Aufgaben zu senken, während kompl...
Diese Funktion kam zusammen mit zwei Notfall Erhöhungen des Kontingents um das Neunfache und einer stillen Änderung des Standard Denkniveaus von 'Hoch' auf 'Mittel' – alles innerhalb einer Woche nach dem Start auf der...