Google 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,兩者都是用於即時語音代理與即時對話的原生「音訊對音訊」模型。前者面向大規模部署、成本效率、流暢對話與視覺脈絡理解;後者則鎖定需要背景推理的高複雜度、多步驟工作。
10
2
最大差異:工作還沒做完,對話不必停下來
真正的亮點在 Gemini 3.8 Live Extended Thinking。Google 表示,模型可在背景中推理、規劃與呼叫非同步工具,同時持續串流語音回應。當較耗時的工具尚在執行,系統可用自然的對話銜接語維持互動,而不是讓使用者一路等待結果。
1
2
這裡所謂的「同步推理」,不只是縮短輪次之間的回覆時間。在 Google 的設計中,語音生成、背景規劃與非同步工具活動能並行進行。例如,語音代理可以一邊說明接下來會怎麼處理,一邊等待資料查詢完成,或執行多步驟流程。這是否真的改善體驗,仍要看工具本身是否可靠、對話流程是否設計得宜,以及代理的發話是否提供實質資訊,而非單純填補空白。
1
2
兩款模型各自適合什麼情境?
Google 將標準版 Gemini 3.8 Live 定位為低延遲、高量對話體驗的選項,目標是在不引入推理造成的延遲下,提供即時交流能力。它結合即時對話與視覺脈絡理解,讓代理可同時運用對話內容與畫面資訊。
10
45
Google 代表另表示,該模型支援 97 種語言,並可在同一段對話中切換語言。實際導入前,開發團隊仍應針對自己的口音、語言組合、地區供應狀況與特定工作流程進行測試。
16
簡單來說:
- Gemini 3.8 Live:適合重視即時反應、規模與成本的語音互動。
- Gemini 3.8 Live Extended Thinking:適合診斷、查詢、規劃等需要多步思考,或工具可能需要數秒才回傳結果的任務。
1
2
基準成績可參考,但不能直接當作採購結論
發表報導列出的 Speech-to-Speech Quality Index 成績為:Gemini 3.8 Live 76.0、Gemini 3.8 Live Extended Thinking 82.6,以及 OpenAI 的 GPT-Live-1(中等推理強度)81.5。
25
在該比較裡,Extended Thinking 的分數最高;不過,這些數字不應被視為經獨立稽核、足以判定整體生產品質的結論。真正的語音代理部署還必須面對插話與打斷、多語與不同口音辨識、工具呼叫正確性、高負載延遲、安全防護、可觀測性,以及每個成功解決任務的總成本。
因此,這組分數比較適合作為一項評估訊號,而不是宣告某個系統適用所有客服中心或助理工作流程的勝負判決。
25
定價:應以 Live API 價表為準
Google 官方定價表將兩款新模型歸在 Live API。付費標準方案中,音訊輸入為每 100 萬個權杖 3.00 美元,或每分鐘 0.005 美元;音訊輸出為每 100 萬個權杖 12.00 美元,或每分鐘 0.018 美元。文字輸入為每 100 萬個權杖 0.75 美元;文字輸出(含思考權杖)則為 4.50 美元。
37
這項區分很重要:其他地方看到的 Gemini 3.8 Flash 權杖價格,不能直接套用到 Live 模型。做預算時,應查閱最新的 Live API 定價表與模型文件,並用真實通話情境測試;因為語音代理的成本取決於輸入音訊、輸出音訊、視覺脈絡、文字與相關工具使用量的組合。
37
開發者、企業與一般使用者在哪裡能用?
Google DeepMind 將兩款模型都列為 正式推出(Generally Available)。公開的可用性表格顯示,兩者都可透過 Gemini 應用程式、Google AI Studio、Gemini API 與 Google Enterprise Agent Platform 使用。Google Search Live 列有 Extended Thinking;Google Workspace 則列有 Gemini 3.8 Live。
54
對開發者而言,這是在同一個原生音訊對音訊模型家族中,於標準即時對話模型與高推理模型之間作選擇。對企業來說,問題不只是哪個模型可用,也包括預定部署情境對應的產品介面、資料控管、可用地區與整合路徑。
54
對生產級語音代理意味著什麼?
Google 的競爭主張,是把語音互動、視覺脈絡理解、背景推理與非同步工具整合到同一模型家族。理論上,這可減少團隊在語音辨識、文字模型、工具編排與語音合成之間自行拼接的工作,也能在背景工作進行時維持對話連續性。
1
10
OpenAI 的 GPT-Live-1 仍是重要比較對象,尤其對正在評估全雙工對話行為的團隊而言。不過,上述基準比較範圍有限,無法單獨決定平台選擇。較可信的評估方式,是以具代表性的真實通話進行測試,量測插話處理、工具呼叫正確率、多語表現、安全控管、故障復原、延遲,以及每個完成成果的成本。
25
Google 尚未明確說清楚的部分
目前提供的發表資料,未能確認 Gemini 3.8 Live 或 Extended Thinking 有精確的 SynthID 音訊浮水印政策。Google 表示,SynthID 已擴展至為 Gemini 應用程式與網頁體驗產生的文字加入浮水印及提供辨識能力;但這不等於每一段由這兩款 Live 模型產生的音訊串流都已加上浮水印,也未交代偵測方式或推出條件。
59
同樣地,整合公告與合作支援可能快速變動。計畫正式上線的團隊,應在確定技術架構前,再核對最新模型文件、價格、平台可用性與適用服務條款。
37
54