谷歌的回应分为两个阶段:
Gemini 3.5 Flash Low 代表了一种更精准的修复方案:它不仅仅是给开发者提供更多原始配额(供给侧补救),更是让他们有一种方法能减少每个任务的 Token 消耗(需求侧控制)。
谷歌的官方文档描述称,Low 模式“针对需要较少步骤的代码和智能体任务有了显著改进,以更低的延迟和成本提供了强大的质量” 。该公司表示,Low 模式变体比现已重命名为 Medium 的变体少生成约 45% 的输出 Token
。
对开发者而言,这意味着他们可以在 API 调用中显式设置 thinking_level: "low"low 是大多数智能体编程的正确设置”,因为谷歌专门针对代码和工具调用工作流对其进行了重新调整 。
Gemini 3.5 Flash 发布时最大的 API 陷阱之一,是未公开地将默认 thinking_level 从 high 更改为 medium。那些没有显式设置推理级别,直接从 gemini-3-flash-preview 移植到新模型的开发者,正悄无声息地获得不同的推理行为 。这意味着,即使在 Low 变体发布后,许多开发者在处理简单任务时,仍在消耗不必要的 Token,因为他们没注意到默认值已经变了。
Low 变体从根本上完善了修复方案:它为开发者提供了一种明确的、有文档记录的、且为特定目的而构建的级别,用于 Flash 系列最初设计的、对成本敏感的工作。
Gemini 3.5 Flash Low 模式的推出,结合 9 倍的配额提升和默认推理级别的调整,已经稳定了 Antigravity 的开发体验。开发者现在可以:
Low 变体并非为了替代谷歌的配额提升,而是一种补充。现在,同时利用新的推理级别和 9 倍扩容的配额的开发者,可以进行有意义的编码会话,而不会触顶限制,或在一个下午内耗光月度 Antigravity 预算。