Gemini 3.1 Flash Lite 于2026年5月7日正式可用,Google 将其定位为面向速度、规模和成本效率优化的 Gemini 3.1 模型;预览模型将在2026年5月25日关闭。 企业应优先把翻译、内容审核、结构化输出、重复性工作流和智能体步骤等高频低延迟任务拿来评测,而不是直接替代更强的大模型。

Create a landscape editorial hero image for this Studio Global article: Gemini 3.1 Flash-Lite Is GA: Enterprise Workloads, Pricing, and Migration. Article summary: Gemini 3.1 Flash Lite became generally available on May 7, 2026, giving enterprises a production target for low latency, high volume Gemini workloads; preview users must move before the May 25 shutdown.. Topic tags: ai, google, gemini, google cloud, enterprise ai. Reference image context from search candidates: Reference image 1: visual subject "# Gemini 3.1 Flash-Lite and Workspace AI: Pricing, Rollout, and What to Do Next (March 2026). **Gemini 3.1 Flash-Lite** (March 2026) is Google’s **preview** Gemini 3–series API mod" source context "Gemini 3.1 Flash-Lite and Workspace AI: Pricing, Rollout, and What to Do Next (March 2026) | Use Apify" Reference image 2: visual subject "Google Unveils Gemini 3.1 Flash-Lite for Enterprise
Google 的 Gemini 3.1 Flash-Lite GA(Generally Available,正式可用)不是一次单纯的模型改名,而是一个很现实的企业运维节点:低延迟版本从预览模型变成稳定的正式模型 ID,同时预览端点已经进入短周期下线安排 。
对企业 AI 团队来说,问题也随之从“要不要试试看”变成了“哪些工作负载先迁、Token 成本怎么算、怎样在截止日期前安全切换”。
Google Gemini API 发布说明显示,gemini-3.1-flash-lite 于2026年5月7日发布,是 Gemini 3.1 Flash-Lite 的正式可用版本,并被描述为针对速度、规模和成本效率优化 。Google Cloud 同时称,Gemini 3.1 Flash-Lite 已在 Gemini Enterprise Agent Platform 上正式可用,设计目标是超低延迟和高容量任务
。
真正需要企业注意的是模型名称与生命周期。gemini-3.1-flash-lite-preview 将于2026年5月11日开始弃用,并计划在2026年5月25日关闭 。因此,新的评测应直接面向
gemini-3.1-flash-lite,已经接入预览端点的系统则应在关闭日前完成迁移 。
Flash-Lite 最值得优先评测的场景,是吞吐量、响应延迟和单次调用成本比“最强推理能力”更关键的任务。Google 公开列出的用途包括翻译、内容审核、生成用户界面以及创建模拟 。Google Cloud 的 GA 说明也把高容量企业任务和智能体平台部署作为核心定位
。
这并不意味着它可以无脑替代更大的 Gemini 模型。Google Cloud 表示,Flash-Lite 是 Pro 和 Flash 等更广泛模型组合的一部分,用来提供不同的智能水平、速度与成本搭配 。更稳妥的做法是:把简单、重复、对延迟敏感的步骤交给 Flash-Lite,把复杂推理、高风险判断或对准确率要求更高的例外情况升级给能力更强的模型。
一个可落地的分层方式是:
Google 3月发布的预览期材料曾列出 Gemini 3.1 Flash-Lite 的价格:通过 Google AI Studio 中的 Gemini API 和 Vertex AI 使用时,每100万输入 Token 为0.25美元,每100万输出 Token 为1.50美元 。按这一公开价格计算,输出 Token 的单价是输入 Token 的6倍
。
这对企业预算很关键。一个总是生成长答案的流程,成本可能明显高于只返回标签、JSON 字段或短摘要的流程。对于高调用量系统,优化重点不应只盯着提示词长度,还应包括回复长度、Schema 设计、缓存策略,以及每一步是否真的需要自然语言输出。
需要强调的是,上述价格来自 Google 预览期发布材料,并非本文所引用资料中的 GA 计费表。采购、平台和 FinOps 团队在把它作为生产预算依据前,应核对当前 Gemini API、Vertex AI 或企业合同条款。
预览用户的时间窗口很短:2026年5月11日开始弃用,2026年5月25日关闭 。迁移应按生产变更处理,而不是简单替换模型名。
建议的检查清单如下:
gemini-3.1-flash-lite-preview 替换为 gemini-3.1-flash-lite。GA 提供的是更稳定的目标端点,但并不等于可以跳过具体业务场景的评测。
这次发布也说明,Google 正在把 Gemini 3.1 包装成一组面向不同任务的专用模型,而不是单一的“万能模型”。Google 更新日志显示,Gemini 3.1 Flash-Lite Preview 于2026年3月3日推出,是 Gemini 3 系列中的首个 Flash-Lite 模型;Gemini 3.1 Flash TTS Preview 于2026年4月15日推出,被描述为成本高效、表现力强且可控的文本转语音模型 。随后,Flash-Lite 于2026年5月7日进入 GA
。
但对路线图的解读应保持克制:现有发布说明只能证明 Google 正在继续推出专用化的 Gemini 3.1 变体,并没有公布下一个 Gemini 模型或未来发布日期 。企业规划应围绕 Google 已给出日期的事项展开:Flash-Lite 已 GA,预览模型2026年5月11日开始弃用,2026年5月25日关闭
。
对企业 AI 团队而言,Gemini 3.1 Flash-Lite GA 的核心意义,是推动团队按成本、延迟和能力把工作负载分层。它最适合先用于速度和 Token 经济性决定成败的高容量自动化任务 。
短期动作很明确:尽快从 gemini-3.1-flash-lite-preview 迁出,并在放大生产流量前用真实业务样本测算成本,特别是输出 Token 的规模 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Gemini 3.1 Flash Lite 于2026年5月7日正式可用,Google 将其定位为面向速度、规模和成本效率优化的 Gemini 3.1 模型;预览模型将在2026年5月25日关闭。
Gemini 3.1 Flash Lite 于2026年5月7日正式可用,Google 将其定位为面向速度、规模和成本效率优化的 Gemini 3.1 模型;预览模型将在2026年5月25日关闭。 企业应优先把翻译、内容审核、结构化输出、重复性工作流和智能体步骤等高频低延迟任务拿来评测,而不是直接替代更强的大模型。
此前预览期公开价格为每100万输入 Token 0.25美元、每100万输出 Token 1.50美元;企业在生产放量前仍需核对当前 API、Vertex AI 或合同计费条款。