開發者的挫折感幾乎瞬間爆發。Antigravity 論壇、Reddit 和 X(前 Twitter)上充斥著對於配額極度消耗的抱怨 。許多支付 Antigravity Pro 費用的開發者回報,他們原先可以支撐一整天工作的配額,在切換到 Gemini 3.5 Flash 後,僅需 30 到 60 分鐘就見底了 。
Reddit 用戶 u/tadanada 發表了一篇量化分析,直接點名批評成本膨脹。他比較了 Gemini 3.5 Flash 的 1,552 美元與 Gemini 3 Flash 的 278 美元基準測試費用,高達 5.6 倍的差異,清楚解釋了為何付費方案崩潰得如此迅速 。
Google 的回應分為兩波:
high 改為 medium 。即使是 9 倍配額的增長也未能完全解決問題。有些開發者回報,在配額重置後恢復工作 30 分鐘內,就又觸及了 Gemini 3.5 Flash 的每週鎖定上限 。
Gemini 3.5 Flash Low 代表的是一種更為精確的手術式修正:它不僅是給開發者更多原始配額(供給面止血),而是給了他們一種方法,使每個任務消耗更少的 Token(需求面的控制)。
Google 的官方文件描述這個 Low 變體「針對需要較少步驟的程式碼和代理任務有了顯著改進,能在低延遲與低成本下提供強大的品質」。該公司表示,與現已更名為 Medium 的變體相比,Low 變體產生的輸出 Token 大約減少了 45% 。
對於開發者來說,這意味著他們現在可以在 API 呼叫中明確設定 thinking_level: "low",用於直接的程式碼生成、簡單的內容補全或輕量化的代理循環,並將更高的推理預算保留給真正困難的推理任務。正如 NxCode 在他們的開發者指南中所指出的,由於 Google 特別針對程式碼和工具調用工作流程對 Low 模式進行了調整,因此「對大多數代理式編碼來說,Low 是正確的設定」。
這實際上等於給了開發者一個四段式的推理力度控制閥——minimal、low、medium、high——而非過去那種在「開啟推理」和「關閉推理」之間的二元選擇 。
在 Gemini 3.5 Flash 的發布過程中,最大的 API 陷阱之一就是「未經公告」地將預設的 thinking_level 從 high 改為 medium。那些直接從 gemini-3-flash-preview 搬遷程式碼、卻沒有明確設定推理等級的開發者,在不知不覺中獲得了不同的推理行為 。這意味著,即使 Low 變體已經推出,許多開發者因為沒有注意到預設值已經轉移,依然在簡單任務上消耗著過多的 Token。
Low 變體本質上完成了這個修正:它為開發者提供了一個明確、有文件記錄且專為 Flash 系列原先設計的那些「成本敏感型工作」而生的等級。
Gemini 3.5 Flash Low 的推出,結合了 9 倍配額增長以及預設推理等級的調整,已經穩定了 Antigravity 的開發體驗。現在開發者可以:
thinking_level: "low" 。Low 變體並非取代 Google 的配額增長——而是這一切的互補。結合使用新推理等級與擴充至 9 倍的配額,開發者現在終於能順利完成有意義的程式開發過程,而不會在一個下午就觸及限制、或燒光整月的 Antigravity 預算。