开发者的沮丧情绪几乎瞬间爆发。Antigravity 论坛、Reddit 和 X(前身 Twitter)上充斥着对极端配额消耗的抱怨 。购买了 Antigravity Pro 计划的开发者反馈,原本能支撑一天工作的配额,在切换到 Gemini 3.5 Flash 后,30 到 60 分钟内就用完了 。
Reddit 用户 u/tadanada 发布了一份量化分析,明确指出成本的飙升:Gemini 3.5 Flash 一个基准测试运行成本高达 1,552 美元,而 Gemini 3 Flash 为 278 美元——这 5.6 倍的差异解释了为何付费计划会如此迅速崩溃 。
谷歌的回应分为两个阶段:
high(高)更改为 medium(中) 。然而,即便是 9 倍的配额提升也未能完全解决问题。一些开发者反映,在配额重置后恢复工作,不到 30 分钟就再次触发了每周的 Flash 模型锁定 。
Gemini 3.5 Flash Low 代表了一种更精准的修复方案:它不仅仅是给开发者提供更多原始配额(供给侧补救),更是让他们有一种方法能减少每个任务的 Token 消耗(需求侧控制)。
谷歌的官方文档描述称,Low 模式“针对需要较少步骤的代码和智能体任务有了显著改进,以更低的延迟和成本提供了强大的质量” 。该公司表示,Low 模式变体比现已重命名为 Medium 的变体少生成约 45% 的输出 Token 。
对开发者而言,这意味着他们可以在 API 调用中显式设置 thinking_level: "low",将其用于直白的代码生成、简单补全或轻量级的智能体循环,并将更高的思考预算留给真正困难的推理任务。正如 NxCode 在其开发者指南中指出的,“low 是大多数智能体编程的正确设置”,因为谷歌专门针对代码和工具调用工作流对其进行了重新调整 。
这实际上给了开发者一个四挡推理力度调节器——minimal(极少)、low(低)、medium(中)、high(高)——而不是在“思考开启”和“思考关闭”之间做二元选择 。
Gemini 3.5 Flash 发布时最大的 API 陷阱之一,是未公开地将默认 thinking_level 从 high 更改为 medium。那些没有显式设置推理级别,直接从 gemini-3-flash-preview 移植到新模型的开发者,正悄无声息地获得不同的推理行为 。这意味着,即使在 Low 变体发布后,许多开发者在处理简单任务时,仍在消耗不必要的 Token,因为他们没注意到默认值已经变了。
Low 变体从根本上完善了修复方案:它为开发者提供了一种明确的、有文档记录的、且为特定目的而构建的级别,用于 Flash 系列最初设计的、对成本敏感的工作。
Gemini 3.5 Flash Low 模式的推出,结合 9 倍的配额提升和默认推理级别的调整,已经稳定了 Antigravity 的开发体验。开发者现在可以:
thinking_level: "low" 。Low 变体并非为了替代谷歌的配额提升,而是一种补充。现在,同时利用新的推理级别和 9 倍扩容的配额的开发者,可以进行有意义的编码会话,而不会触顶限制,或在一个下午内耗光月度 Antigravity 预算。