Gemini 3.1 Flash Lite 已於 2026 年 5 月 7 日成為一般可用模型,Google 定位為重視速度、規模與成本效率的 Gemini 3.1 選項。 適合優先測試的場景包括翻譯、內容審核、UI 產生、模擬,以及大量重複的企業流程或代理工作步驟。

Create a landscape editorial hero image for this Studio Global article: Gemini 3.1 Flash-Lite Is GA: Enterprise Workloads, Pricing, and Migration. Article summary: Gemini 3.1 Flash Lite became generally available on May 7, 2026, giving enterprises a production target for low latency, high volume Gemini workloads; preview users must move before the May 25 shutdown.. Topic tags: ai, google, gemini, google cloud, enterprise ai. Reference image context from search candidates: Reference image 1: visual subject "# Gemini 3.1 Flash-Lite and Workspace AI: Pricing, Rollout, and What to Do Next (March 2026). **Gemini 3.1 Flash-Lite** (March 2026) is Google’s **preview** Gemini 3–series API mod" source context "Gemini 3.1 Flash-Lite and Workspace AI: Pricing, Rollout, and What to Do Next (March 2026) | Use Apify" Reference image 2: visual subject "Google Unveils Gemini 3.1 Flash-Lite for Enterprise
Google 的 Gemini 3.1 Flash-Lite 從預覽版走到一般可用(GA),對企業來說不只是「多了一個模型」。更實際的問題是:哪些 AI 工作負載應該先搬過去?成本模型會怎麼變?現有預覽版服務又要多快完成遷移?
Google 的 Gemini API 發布說明列出,gemini-3.1-flash-lite 已於 2026 年 5 月 7 日發布,這是 Gemini 3.1 Flash-Lite 的一般可用版本,主打速度、規模與成本效率 。Google Cloud 也表示,Gemini 3.1 Flash-Lite 已在 Gemini Enterprise Agent Platform 上一般可用,定位是超低延遲與高流量任務
。
關鍵不只在「GA」這個標籤,而是模型名稱與生命週期已經明確。原本的 gemini-3.1-flash-lite-preview 將於 2026 年 5 月 11 日開始棄用,並預定在 2026 年 5 月 25 日關閉 。也就是說,新的評估與開發應直接對準
gemini-3.1-flash-lite,既有預覽版部署則不宜拖到最後一刻才改 。
Flash-Lite 最適合先拿來測試的,不是需要最深推理能力的任務,而是吞吐量、延遲與單次成本壓力最大的流程。Google 公布的使用情境包括翻譯、內容審核、產生使用者介面,以及建立模擬 。Google Cloud 的 GA 說明也把高流量企業任務與代理平台部署列為核心定位
。
這並不代表它可以一口氣取代更大型的 Gemini 模型。Google Cloud 表示,Flash-Lite 是 Pro 與 Flash 等模型組合的一部分,讓使用者能依照智慧能力、速度與成本取得不同搭配 。對企業而言,較合理的做法是把簡單、重複、對延遲敏感的步驟交給 Flash-Lite;需要更高準確度、複雜推理或例外判斷的部分,再升級到更強的模型。
一個務實的部署方式可以是:
Google 3 月的發布文章曾列出,Gemini 3.1 Flash-Lite 在透過 Gemini API、Google AI Studio 與 Vertex AI 預覽供應期間,價格為每 100 萬輸入 token 0.25 美元、每 100 萬輸出 token 1.50 美元 。依該公開價格計算,輸出 token 的成本是輸入 token 的 6 倍
。
這個比例對企業預算很有影響。若某個流程經常產生長篇自然語言回答,成本可能明顯高於只回傳標籤、JSON、簡短摘要或分類結果的流程。對高流量系統來說,成本優化不只是在「縮短 prompt」,也要看回應長度、結構化 schema、快取策略,以及每一個步驟是否真的需要完整自然語言輸出。
但要注意:上述價格來自 Google 的預覽版發布資料,而不是這裡所引用來源中的 GA 計費表。採購、雲端平台與財務團隊在正式擴大上線前,仍應確認目前的 Gemini API、Vertex AI 或企業合約條款,不宜直接把預覽期公開價格視為最終生產價格。
使用 gemini-3.1-flash-lite-preview 的團隊時間並不寬裕:該模型將於 2026 年 5 月 11 日開始棄用,並於 5 月 25 日關閉 。這應被視為一次生產變更,而不是單純替換一段模型名稱字串。
gemini-3.1-flash-lite-preview 改為 gemini-3.1-flash-lite。GA 提供了更穩定的目標模型名稱,但不代表可以跳過工作負載層級的驗證。
這次發布也顯示,Google 正把 Gemini 3.1 包裝成一組更細分的模型,而不是單一「一體適用」方案。Google 的變更紀錄顯示,Gemini 3.1 Flash-Lite Preview 於 2026 年 3 月 3 日推出,是 Gemini 3 系列中的第一個 Flash-Lite 模型;Gemini 3.1 Flash TTS Preview 則於 2026 年 4 月 15 日推出,定位為具成本效率、表現力與可控性的文字轉語音模型 。隨後,Flash-Lite 在 2026 年 5 月 7 日進入 GA
。
可以安全解讀的是:Google 仍在推出專門化的 Gemini 3.1 變體。不過,現有發布說明並未公布下一個 Gemini 模型,也沒有提供未來發布日期 。企業規劃時,應以 Google 已明確列出的時間點為準:Flash-Lite 現已 GA、預覽版 5 月 11 日開始棄用、5 月 25 日關閉
。
對企業 AI 團隊而言,Gemini 3.1 Flash-Lite GA 的重點,是把工作負載依成本、延遲與模型能力重新分流。它值得優先用於大量自動化、低延遲要求高、token 經濟性會直接影響預算的場景 。
眼前最急的兩件事很明確:第一,在 gemini-3.1-flash-lite-preview 關閉前完成遷移;第二,在擴大正式流量前,用真實工作負載重新計算成本,尤其要盯緊輸出 token 量 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Gemini 3.1 Flash Lite 已於 2026 年 5 月 7 日成為一般可用模型,Google 定位為重視速度、規模與成本效率的 Gemini 3.1 選項。
Gemini 3.1 Flash Lite 已於 2026 年 5 月 7 日成為一般可用模型,Google 定位為重視速度、規模與成本效率的 Gemini 3.1 選項。 適合優先測試的場景包括翻譯、內容審核、UI 產生、模擬,以及大量重複的企業流程或代理工作步驟。
預覽版 gemini 3.1 flash lite preview 將於 2026 年 5 月 11 日開始棄用、5 月 25 日關閉;現有使用者需要盡快遷移。