Google 推出 Gemini 3.5 Live Translate,係一個支援超過 70 種語言、近乎實時嘅語音翻譯 AI 模型,已經喺 Google 翻譯 App、Gemini Live API 同 Google Meet 逐步推出。 同舊時要等成句講完先開始翻譯唔同,呢個新模型你一開口佢就即刻開工,仲可以保留你原本講說話嗰陣嘅聲調、語速同語氣,令對話更自然流暢。

Create a landscape editorial hero image for this Studio Global article: What is Google's Gemini 3.5 Live Translate model, how does its streaming speech-to-speech translation work across more than 70 languages, an. Article summary: ## What It Is. Topic tags: general, general web, user generated, documentation. Reference image context from search candidates: Reference image 1: visual subject "# Google Launches Gemini 3.5 Live Translate in 70 Languages. Google has launched Gemini 3.5 Live Translate, a new AI powered speech translation model that enables near real time co" source context "Google Launches Gemini 3.5 Live Translate in 70 ..." Reference image 2: visual subject "Google Patches Chrome Zero Day Vulnerability Under Attack" source context "Google Launches Gemini 3.5 Live Translate in 70 ..." Style: premium digital editorial illustration, source-backed research mood, clean compositio
2026 年 6 月 9 日,Google 向公眾發布咗佢哋最先進嘅音頻翻譯模型:Gemini 3.5 Live Translate。呢個代號為 gemini-3.5-live-translate-preview 嘅模型,專門為一個核心任務而設——就係近乎實時、串流式嘅語音對語音翻譯。佢支援超過 70 種語言,以及超過 2,000 個語言組合 。
同大家用開嗰啲「一問一答」式翻譯系統唔同,Gemini 3.5 Live Translate 唔需要等講嘢嘅人成句講晒先開始翻譯,而係喺幾秒之內就處理好音頻,開始生成翻譯,保持對話好似流水咁順暢自然。呢一次公開發布,正式標誌住呢個由 2025 年 12 月開始展示,並且喺 2026 年春天經過 Gemini 3.1 flash live 模型不斷改良嘅階段性成果 。
Gemini 3.5 Live Translate 最核心嘅創新,就係佢嗰套 連續、雙向嘅串流架構。呢個設計同傳統逐句翻譯嘅系統好唔同,要靠幾個關鍵技術一齊配合先做到。
呢個模型唔會等講嘢嘅人收聲先開工。佢會一邊接收音頻輸入,一邊同步生成翻譯輸出。用 Google 自己嘅講法,佢只係「慢講嘢嘅人幾秒鐘」,咁做就解決咗以前翻譯時會出現嗰啲令人尷尬嘅停頓 。
用家唔需要手動去設定來源語言。模型會自動實時偵測對方講緊邊種語言,就算喺夾雜多種語言嘅環境入面都一樣認到,非常適合現實中千變萬化嘅對話情境 。
對用家嚟講至關重要嘅一點,就係翻譯出嚟嘅把聲絕對唔似機械人。模型設計嗰陣特別保留講者原本嘅 語氣、節奏同音調,出到嚟嘅翻譯聲會更似你本人,而唔係一部文字轉語音嘅發聲機器 。
支援超過 70 種語言,即係涵蓋咗數以千計嘅雙向語言組合。佢係專為雙向對話而設,對話雙方都可以流暢聽到對方講嘅嘢翻譯成自己嘅語言 。
對於開發者嚟講,呢個模型係透過 Gemini Live API 使用嘅。佢要求音頻輸入要用特定格式:無壓縮、低位元組優先、16-bit PCM 格式,取樣率 16kHz。而翻譯後嘅音頻輸出都係無壓縮嘅 16-bit PCM,不過取樣率就提升到 24kHz 。模型嘅上下文窗口最多可以處理 128,000 個輸入 token,以及輸出 64,000 個 token
。
Google 今次嘅公開發布係有計劃咁逐步進行嘅,而整個 Gemini 3.5 模型系列早喺 2026 年 5 月嘅 Google I/O 開發者大會上面已經公佈咗 。
gemini-3.1-flash-live-preview,就係呢個開發過程嘅一部份 gemini-3.5-live-translate-preview 模型正式向開發者發布,可以透過 Gemini Live API 同 Google AI Studio 使用,同時亦透過全球嘅 Google 翻譯 App(Android 同 iOS)更新,開放俾普羅大眾使用 呢個模型喺 Google 一系列嘅消費者、開發者同企業平台上面都有得用,不過開放程度就唔同。
對一般消費者嚟講,呢個係最簡單嘅使用途徑。「即時翻譯」功能會喺 Google 翻譯 App 入面向全球用戶推出。戴住耳機之後,只要㩒吓 App 畫面左下角嘅「即時翻譯」掣就用得。喺 Android 上面,Google 仲推出咗一個免提嘅「聆聽模式」,可以透過手機嘅聽筒播放翻譯,等你可以好似平時聽電話咁,將部手機擺喺耳邊就用得 。
對開發者而言,呢個模型係以公開預覽版嘅形式提供。開發者可以用 Gemini Live API 同特定嘅翻譯配置,將佢整合到第三方嘅應用程式同服務入面。而 Google AI Studio 就提供咗一個沙盒環境,俾開發者喺入面創建原型同測試模型嘅能力 。
俾企業用嘅就更加有限制。專為 Google Meet 而設嘅 Gemini 3.5 Live Translate,會由 2026 年 6 月開始,俾指定嘅企業客戶做私人預覽。等到正式推出之後,佢會自動偵測講者嘅語言,再翻譯成每位參加者揀好嘅語言,開會期間支援超過 70 種語言同 2,000 幾個語言組合。更大規模嘅推出計劃就預定喺 2026 年稍後時間 。呢個功能會開放俾 Google Workspace Business Standard 同 Plus、Enterprise Standard 同 Plus、Google AI Pro 同 Google AI Ultra 嘅訂閱用戶
。
好似 Agora、Fishjam、LiveKit、Pipecat 同 Vision Agents 呢類即時通訊平台,已經喺度整合 Gemini Live API,準備將呢個翻譯模型帶入佢哋自己嘅媒體管道入面 。
其中一個最令人注目嘅現實世界測試,就係同東南亞叫車同外賣平台 Grab 嘅合作。Grab 正喺度測試呢項技術,為司機同乘客提供即時語音翻譯。呢間公司每個月處理超過 1,000 萬個語音通話,而呢個測試正係要迎面解決東南亞市場語言碎片化呢個棘手問題 。
由「逐句翻譯」轉去「串流翻譯」,係用戶體驗上嘅一個根本轉變。透過將模型深度整合到 Google 翻譯同 Meet 呢類無處不在嘅產品入面,並且開放俾開發者生態系統,Google 正將即時語音翻譯,由一種小眾功能,推動成為全球溝通基礎建設嘅一個標準配備 。同 Grab 嘅合作測試,就清楚展示咗呢個轉變——將即時、聽落自然嘅翻譯定位為一種好似水電煤咁基本嘅「公用事業」,而唔係只係一個新噱頭
。
所有由模型生成嘅 AI 音頻都會加入 Google 嘅 SynthID 技術浮水印,確保佢嘅來源可以被偵測到,同時減少被濫用嘅風險。喺合成語音技術變得越嚟越逼真同普及嘅今日,呢一步至關重要 。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google 推出 Gemini 3.5 Live Translate,係一個支援超過 70 種語言、近乎實時嘅語音翻譯 AI 模型,已經喺 Google 翻譯 App、Gemini Live API 同 Google Meet 逐步推出。
Google 推出 Gemini 3.5 Live Translate,係一個支援超過 70 種語言、近乎實時嘅語音翻譯 AI 模型,已經喺 Google 翻譯 App、Gemini Live API 同 Google Meet 逐步推出。 同舊時要等成句講完先開始翻譯唔同,呢個新模型你一開口佢就即刻開工,仲可以保留你原本講說話嗰陣嘅聲調、語速同語氣,令對話更自然流暢。
東南亞叫車平台 Grab 已經率先測試呢個技術,俾司機同乘客可以即時用唔同語言溝通,之後更加會擴展到更多商業應用。