O Gemini 3.5 Flash Low é a resposta do Google à revolta dos desenvolvedores: o comportamento padrão de raciocínio estava queimando cotas em menos de uma hora e executando tarefas a um custo 5,5x maior que o do Flash a... A variante Low reduz a saída de tokens em cerca de 45% em comparação com a agora renomeada varia...

Create a landscape editorial hero image for this Studio Global article: What prompted Google to introduce the "Low" thinking level in Gemini 3.5 Flash on Antigravity, and how does this change address developer fr. Article summary: Google introduced the **Gemini 3.5 Flash (Low)** thinking level in Antigravity in direct response to a firestorm of developer backlash triggered by the model's launch at I/O 2026 on May 19. The core problem: Gemini 3.5 F. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Product naming/UX confusion around Gemini CLI vs Antigravity CLI and broader interface design criticism (zachtratar, kchonyc, teortaxesTex). ## Gemini 3.5 Flash: the main technica" source context "[AINews] Google I/O 2026: Gemini 3.5 Flash, Omni (NanoBanana for ..." Reference image 2: visual subject "4M views • 6
Quando o Google lançou o Gemini 3.5 Flash na conferência I/O 2026, em 19 de maio, ele foi apresentado como o modelo agêntico e de codificação mais poderoso da empresa . O que se seguiu foi uma semana de fúria dos desenvolvedores, mudanças emergenciais de cotas e uma discreta reviravolta que reescreveu a forma como o modelo pensa.
O comportamento padrão de raciocínio (thinking) do Gemini 3.5 Flash queimava tokens de forma tão agressiva que usuários pagantes do Antigravity estavam esgotando suas cotas em menos de uma hora . Embora o preço por token no papel parecesse competitivo — US$ 1,50 por milhão de tokens de entrada e US$ 9,00 por milhão de tokens de saída — o custo total para completar tarefas reais contava uma história bem diferente. A Artificial Analysis descobriu que rodar uma suíte de benchmarks padrão custava US$ 1.552 com o Gemini 3.5 Flash, contra US$ 282 do Gemini 3 Flash anterior — um aumento de 5,5 vezes
.
Para piorar, alguns desenvolvedores perceberam que o 3.5 Flash estava consumindo a cota de outros modelos do mesmo pool, como o Gemini 3.1 Pro e até o Claude, tornando toda a plataforma inutilizável momentaneamente . A piada nos fóruns era que o "Flash" no nome se referia à rapidez com que sua cota desaparecia
.
A frustração explodiu quase que imediatamente. O fórum do Antigravity, Reddit e X se encheram de reclamações sobre o consumo extremo de cota . Desenvolvedores que pagavam pelo plano Pro do Antigravity relataram que suas cotas, que antes duravam um dia inteiro de trabalho, desapareciam em 30 a 60 minutos após migrarem para o Gemini 3.5 Flash
.
Uma análise detalhada postada no Reddit pelo usuário u/tadanada explicitou a inflação de custos, comparando uma execução de benchmark de US$ 1.552 para o Gemini 3.5 Flash contra US$ 278 para o Gemini 3 Flash — uma diferença de 5,6x que explicava por que os planos pagos estavam colapsando tão rápido .
A resposta do Google veio em duas ondas:
high para medium Mesmo o aumento de 9x na cota não resolveu totalmente o problema. Alguns desenvolvedores relataram ter atingido o bloqueio semanal do Flash em apenas 30 minutos após o reset de cota .
O Gemini 3.5 Flash Low representa uma correção mais cirúrgica: em vez de apenas dar mais cota bruta aos desenvolvedores (um curativo no lado da oferta), ele deu a eles uma forma de usar menos tokens por tarefa (um controle no lado da demanda).
A documentação oficial do Google descreve a variante Low como tendo sido "significativamente aprimorada para tarefas de código e agentivas que exigem menos etapas, oferecendo forte qualidade com menor latência e custo" . A empresa afirma que a variante Low gera aproximadamente 45% menos tokens de saída do que a agora renomeada variante Medium
.
Na prática, isso significa que um desenvolvedor agora pode definir thinking_level: "low".
Isso efetivamente dá aos desenvolvedores um dial de quatro níveis para o esforço de raciocínio — minimal, low, medium, high — em vez de uma escolha binária entre "thinking ligado" e "thinking desligado" .
Uma das maiores armadilhas da API no lançamento do Gemini 3.5 Flash foi a mudança não anunciada do thinking_level padrão de high para medium. Desenvolvedores que migraram diretamente do gemini-3-flash-preview sem definir explicitamente um nível de raciocínio estavam, silenciosamente, obtendo um comportamento de raciocínio inferior . Isso significa que, mesmo após o lançamento da variante Low, muitos desenvolvedores ainda estavam usando mais tokens do que o necessário para tarefas simples porque não perceberam que o padrão havia mudado.
A variante Low essencialmente conclui a correção: ela dá aos desenvolvedores um nível explícito, documentado e criado especificamente para o tipo de trabalho sensível a custos para o qual a família Flash foi originalmente projetada.
A introdução do Gemini 3.5 Flash Low, combinada com os aumentos de cota de 9x e o ajuste do nível de raciocínio padrão, estabilizou a experiência do desenvolvedor no Antigravity. Os desenvolvedores agora podem:
thinking_level: "low"A variante Low não substitui os aumentos de cota do Google — ela os complementa. Desenvolvedores que usam tanto o novo nível de raciocínio quanto as cotas expandidas em 9x agora podem trabalhar em sessões de codificação significativas sem esbarrar em limites ou queimar seu orçamento mensal do Antigravity em uma tarde.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
O Gemini 3.5 Flash Low é a resposta do Google à revolta dos desenvolvedores: o comportamento padrão de raciocínio estava queimando cotas em menos de uma hora e executando tarefas a um custo 5,5x maior que o do Flash a...
O Gemini 3.5 Flash Low é a resposta do Google à revolta dos desenvolvedores: o comportamento padrão de raciocínio estava queimando cotas em menos de uma hora e executando tarefas a um custo 5,5x maior que o do Flash a... A variante Low reduz a saída de tokens em cerca de 45% em comparação com a agora renomeada variante Medium, dando aos desenvolvedores um controle direto para tarefas simples e economizando o raciocínio profundo para p...
Este recurso chegou junto com dois aumentos emergenciais de cota de 9x e uma mudança silenciosa do nível de raciocínio padrão de 'high' para 'medium' — tudo em uma semana após o lançamento no I/O 2026 [12][17].