Google 發表 Gemini 3.5 Live Translate,這是一款能在近即時狀態下進行語音轉語音翻譯的全新 AI 音訊模型,目前已開始在 Google 翻譯 App、Gemini Live API 和 Google AI Studio 等平台逐步推出。 有別於傳統逐句翻譯工具,此模型在你一開口就開始產生翻譯,並保留原始說話者的語調、語速和音高,以連續串流的方式提供譯文音訊。

Create a landscape editorial hero image for this Studio Global article: What is Google's Gemini 3.5 Live Translate model, how does its streaming speech-to-speech translation work across more than 70 languages, an. Article summary: ## What It Is. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Google Launches Gemini 3.5 Live Translate in 70 Languages. Google has launched Gemini 3.5 Live Translate, a new AI powered speech translation model that enables near real time co" source context "Google Launches Gemini 3.5 Live Translate in 70 ..." Reference image 2: visual subject "Google Patches Chrome Zero Day Vulnerability Under Attack" source context "Google Launches Gemini 3.5 Live Translate in 70 ..." Style: premium digital editorial illustration, source-backed research mood, clean compositio
2026 年 6 月 9 日,Google 正式向大眾發布了迄今為止最先進的音訊翻譯模型:Gemini 3.5 Live Translate。這個開發人員代碼為 gemini-3.5-live-translate-preview 的特殊模型,是專為一個核心任務所設計——近乎即時的、串流式的語音轉語音翻譯。它支援超過 70 種語言與超過 2,000 種語言組合,對於早已習慣按鍵、停頓、再播放這種傳統翻譯模式的大眾來說,是一次根本性的體驗轉變 。
Gemini 3.5 Live Translate 不再需要等你把整句話說完才開始翻譯,而是在短短數秒內就開始處理並生成譯文音訊,目標是讓對話保持流暢自然。這次公開發布,也標誌著從 2025 年 12 月早期展示,到 2026 年春季透過 Gemini 3.1 flash live 模型持續打磨,這個階段性推出計畫的集大成 。
Gemini 3.5 Live Translate 最核心的創新,在於它採用了 連續、雙向的串流架構。這與傳統一來一往的翻譯系統截然不同,仰賴數項關鍵技術協同運作。
模型不會等待說話者結束。它同時串流接收音訊,並逐步生成翻譯後的語音輸出。Google 形容這就像「僅僅落後說話者幾秒鐘」,進而消除了那種可能打斷自然對話節奏的尷尬停頓 。
使用者不需要手動選擇來源語言。模型會在過程中自動辨識正在說的是哪一種語言。即使是在多種語言夾雜的環境中也能順暢運作,使其更貼近真實世界動態多變的對話情境 。
對使用者體驗至關重要的一點是,翻譯後的語音聽起來不會像機器人。模型在設計上保留了原始說話者的語調、語速和音高,產出的譯文語音更像是說話者本人,而非冰冷的文字轉語音引擎 。
由於支援超過 70 種語言,模型涵蓋了數千種雙向語言組合。它是專為雙向對話設計的,讓對話的雙方都能流暢地聽到對方話語被即時翻譯成自己的語言 。
對開發者來說,可以透過 Gemini Live API 使用此模型。它要求的音訊輸入格式為:原始、低位元組優先、16 位元 PCM 音訊,取樣率為 16kHz。翻譯後的音訊輸出同樣是原始的 16 位元 PCM,但取樣率會提升至更高的 24kHz 。模型的上下文窗口允許輸入高達 128,000 個 token 以及輸出 64,000 個 token
。
Google 走向這次公開發布的旅程是階段性的,Gemini 3.5 模型家族最早已於 2026 年 5 月的 Google I/O 開發者大會上亮相 。
gemini-3.1-flash-live-preview,已於 2026 年 3 月 26 日發布,成為此迭代發展的一環 gemini-3.5-live-translate-preview 模型正式向開發者發布,可透過 Gemini Live API 和 Google AI Studio 使用;同時,也透過 Android 與 iOS 版 Google 翻譯 App 的更新,全面帶給全球消費者 此模型正廣泛地在 Google 的消費者、開發者及企業平台上線,但開放程度略有不同。
對一般消費者來說,這是最簡單的使用途徑。此功能正在 Google 翻譯 App 中全球推出。使用者只需戴上耳機,點選 App 畫面左下角的「即時翻譯」按鈕即可。在 Android 裝置上,Google 還推出一種不用動手的「聆聽模式」,能將翻譯內容透過手機聽筒播放,讓你像講一般電話一樣將手機貼近耳邊使用 。
對開發人員而言,此模型處於 公開預覽版 階段。這意味著可以透過帶有特定翻譯配置的 Gemini Live API,將其整合至第三方應用程式與服務中。Google AI Studio 也提供了一個沙盒環境,讓開發者能夠進行模型功能原型設計與測試 。
針對企業的存取權限較為嚴格。從 2026 年 6 月開始,Gemini 3.5 Live Translate 將以 私人預覽版 的形式,率先開放給特定的企業客戶。功能上線後,系統會自動偵測發言者的語言,並將其翻譯成每位與會者偏好的語言,在會議期間支援超過 70 種語言與 2,000 多種語言組合。更廣泛的推出計畫定於 2026 年下半年 。此功能適用於訂閱 Google Workspace 商業標準版與進階版、企業標準版與進階版,以及 Google AI Pro 和 Google AI Ultra 方案的用戶
。
像是 Agora、Fishjam、LiveKit、Pipecat 和 Vision Agents 等即時通訊平台,已在著手整合 Gemini Live API,要將此翻譯模型導入其自家的影音處理管線中 。
其中一個最引人注目的真實世界測試案例,便是東南亞叫車與外送平台 Grab。Grab 正試行這項技術,為司機與乘客提供即時語音翻譯。該公司每月處理超過 1,000 萬通語音通話,而此試行計畫正面迎擊了這個語言極度破碎市場所帶來的挑戰 。
從逐句對話轉變為串流翻譯,是一種根本的 UX 轉變。藉由將此模型深度整合到 Google 翻譯和 Meet 這類無所不在的產品,並向開發者生態系統開放,Google 正將即時語音翻譯,從一項利基功能,推向全球溝通的基礎設施標準配備 。Grab 的試行案例清楚說明了此轉變,將即時、聽感自然的翻譯定位成一種公用事業,而非新奇玩具
。
所有由 AI 生成的音訊,都會加上 Google 的 SynthID 技術浮水印,以確保其來源可被偵測,並減少潛在的濫用。隨著合成語音技術日益逼真普及,這正是至關重要的一步 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google 發表 Gemini 3.5 Live Translate,這是一款能在近即時狀態下進行語音轉語音翻譯的全新 AI 音訊模型,目前已開始在 Google 翻譯 App、Gemini Live API 和 Google AI Studio 等平台逐步推出。
Google 發表 Gemini 3.5 Live Translate,這是一款能在近即時狀態下進行語音轉語音翻譯的全新 AI 音訊模型,目前已開始在 Google 翻譯 App、Gemini Live API 和 Google AI Studio 等平台逐步推出。 有別於傳統逐句翻譯工具,此模型在你一開口就開始產生翻譯,並保留原始說話者的語調、語速和音高,以連續串流的方式提供譯文音訊。
此技術目前正由東南亞叫車平台 Grab 測試用於司機與乘客間的溝通,並預計在 2026 年下半年擴大推廣至 Google Meet 視訊會議服務。