제미나이 3.5 플래시 런칭 직후, 과도한 사고 모드 토큰 소비로 유료 플랜 사용자 할당량이 1시간도 안 돼 소진되는 심각한 워크플로 문제가 발생했다. 이에 구글은 일주일 만에 긴급 할당량을 두 차례(총 9배) 인상하고, 기본 사고 수준을 'high'에서 'medium'으로 조용히 조정했으며, 토큰 소비를 약 45% 줄여주는 새로운 '로우(Low)' 사고 수준 모델을 추가로 출시했다.

Create a landscape editorial hero image for this Studio Global article: What prompted Google to introduce the "Low" thinking level in Gemini 3.5 Flash on Antigravity, and how does this change address developer fr. Article summary: Google introduced the **Gemini 3.5 Flash (Low)** thinking level in Antigravity in direct response to a firestorm of developer backlash triggered by the model's launch at I/O 2026 on May 19. The core problem: Gemini 3.5 F. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "Product naming/UX confusion around Gemini CLI vs Antigravity CLI and broader interface design criticism (zachtratar, kchonyc, teortaxesTex). ## Gemini 3.5 Flash: the main technica" source context "[AINews] Google I/O 2026: Gemini 3.5 Flash, Omni (NanoBanana for ..." Reference image 2: visual subject "4M views • 6
2026년 5월 19일, 구글은 I/O 2026에서 자사의 가장 강력한 에이전트 및 코딩 모델이라고 자랑하며 제미나이 3.5 플래시(Gemini 3.5 Flash)를 공개했습니다 . 그러나 그 뒤를 이은 것은 개발자들의 분노, 긴급 할당량 변경, 그리고 모델의 사고 방식을 다시 짜는 조용한 정책 전환이었습니다.
핵심 문제는 이것입니다. 제미나이 3.5 플래시의 기본 사고 모드가 토큰을 너무 공격적으로 소비해서, 유료 사용자들의 할당량이 채 1시간도 안 되어 바닥나는 현상이 발생한 것입니다 . API 토큰 가격 자체는 100만 입력 토큰당 약 2,050원($1.50), 출력 토큰당 약 12,300원($9.00)으로 표면적으로는 경쟁력 있어 보였습니다. 하지만 실제 작업을 완료하는 총비용은 전혀 다른 이야기를 들려주었습니다. 인공지능 분석 기관 'Artificial Analysis'가 표준 벤치마크를 실행한 결과, 제미나이 3.5 플래시로 완료하는 데 든 비용은 무려 212만 원($1,552) 이었습니다. 이전 모델인 제미나이 3 플래시의 38만 5천 원($282)과 비교하면 5.5배나 증가한 금액입니다
.
개발자들의 불만은 거의 즉각적으로 폭발했습니다. 안티그래비티(Antigravity, 구글의 AI 기반 코딩 도구) 포럼, 레딧(Reddit), X(구 트위터)에는 극단적인 할당량 소비에 대한 불만이 쏟아졌습니다 . 유료 플랜을 사용하는 개발자들은 이전에는 하루 종일 작업할 수 있었던 할당량이 제미나이 3.5 플래시로 전환한 후 30분에서 1시간 만에 사라져 버렸다고 보고했습니다
.
레딧 사용자 u/tadanada는 이러한 비용 급증을 정량화한 분석을 게시하며 제미나이 3.5 플래시의 벤치마크 완료 비용이 1,552달러인데 반해, 제미나이 3 플래시는 278달러라고 지적했습니다. 이 5.6배의 차이는 유료 플랜이 왜 그렇게 빨리 소진되는지를 명확히 설명해 주었습니다 .
구글의 대응은 두 단계로 이루어졌습니다.
하지만 9배나 늘린 할당량조차 완전한 해결책은 아니었습니다. 일부 개발자들은 할당량 초기화 후 작업을 재개한 지 30분 만에 다시 주간 플래시 사용 제한에 걸렸다고 보고했습니다 .
제미나이 3.5 플래시 로우는 더 근본적인 해결책을 제시합니다. 개발자에게 단순히 더 많은 원재료 할당량(공급 측면의 임시방편)을 주는 대신, 작업당 더 적은 토큰을 사용할 수 있는 방법(수요 측면의 제어)을 제공한 것입니다.
구글의 공식 문서에 따르면, 로우 변종은 "더 적은 단계가 필요한 코드 및 에이전트 작업에 맞춰 대폭 개선되어, 낮은 지연 시간과 비용으로도 강력한 품질을 제공" 합니다 . 구글은 로우 변종이 현재 '미디엄'으로 이름이 변경된 기존 변종보다 약 45% 더 적은 출력 토큰을 생성한다고 밝혔습니다
.
이제 개발자들은 간단한 코드 생성, 단순 완료, 가벼운 에이전트 루프에는 API 호출 시 명시적으로 thinking_level: "low".
이로써 개발자는 '사고 모드 켜기/끄기'라는 이분법적 선택이 아니라 최소, 로우, 미디엄, 하이의 4단계 추론 강도 조절 다이얼을 손에 쥐게 된 셈입니다 .
제미나이 3.5 플래시 출시 당시 API에는 거의 알려지지 않은 큰 함정이 하나 있었습니다. 바로 기본 thinking_level이 high에서 medium으로 변경된 것입니다. gemini-3-flash-preview에서 별도 설정 없이 그대로 마이그레이션한 개발자들은 자신도 모르는 사이에 과거와는 다른, 다소 약화된 추론 결과를 받고 있었습니다 . 따라서 로우 변종이 출시된 후에도, 많은 개발자들은 기본값이 바뀌었다는 사실을 눈치채지 못해 간단한 작업에 여전히 필요 이상의 토큰을 소비하고 있었던 것입니다.
로우 변종은 본질적으로 이 문제의 마무리 수정입니다. 이는 플래시 제품군이 원래 설계된 목표인 비용에 민감한 작업을 위해, 명시적이고 문서화된, 목적에 맞게 구축된 수준을 개발자에게 제공합니다.
제미나이 3.5 플래시 로우의 출시는 9배 할당량 증가 및 기본 사고 수준 조정과 결합되어 안티그래비티 개발자 경험을 안정시켰습니다. 이제 개발자들은:
thinking_level: "low"로우 변종은 구글의 할당량 증가를 대체하는 것이 아니라 보완하는 것입니다. 새로운 사고 수준과 9배로 확장된 할당량을 함께 사용하는 개발자들은 이제 한계에 도달하거나 오후 한나절 만에 월간 예산을 모두 소진하지 않고도 의미 있는 코딩 세션을 진행할 수 있습니다.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
제미나이 3.5 플래시 런칭 직후, 과도한 사고 모드 토큰 소비로 유료 플랜 사용자 할당량이 1시간도 안 돼 소진되는 심각한 워크플로 문제가 발생했다.
제미나이 3.5 플래시 런칭 직후, 과도한 사고 모드 토큰 소비로 유료 플랜 사용자 할당량이 1시간도 안 돼 소진되는 심각한 워크플로 문제가 발생했다. 이에 구글은 일주일 만에 긴급 할당량을 두 차례(총 9배) 인상하고, 기본 사고 수준을 'high'에서 'medium'으로 조용히 조정했으며, 토큰 소비를 약 45% 줄여주는 새로운 '로우(Low)' 사고 수준 모델을 추가로 출시했다.
이제 개발자는 간단한 코딩에는 '로우', 복잡한 에이전트 작업에는 '미디엄' 또는 '하이' 모드를 선택해 비용과 할당량을 탄력적으로 관리할 수 있게 되었다.