傳統語音助理的運作方式像一條**「流水線」**:音訊先經過 ASR(語音轉文字),文字再傳給視覺模型(如果需要),然後透過大型語言模型(LLM)處理,最後再由 TTS(文字轉語音)轉回聲音。每一次的「交接」都會增加延遲,而且每次模組切換都會流失部分上下文資訊。
SeedRealtime 以四大關鍵優勢取代了這條流水線:
SeedRealtime 解決的最核心問題,是在連續的多模態資訊流中**「何時該說話、何時該聆聽」**。傳統的「輪流說話」(半雙工)助理會等待一段靜默後才回應——結果不是打斷使用者,就是呆坐不語。
SeedRealtime 的全雙工架構讓它能夠:
端到端人工評測結果顯示,與級聯模型相比,SeedRealtime 的音視訊對話節奏問題減少了一半。「話未說完就被打斷、說完話卻回應遲緩、或被背景雜音誤觸發」等卡殼現象大幅減少,而能完成一次完整、流暢單次對話的機率則顯著提升。
SeedRealtime 是字節跳動早期全雙工研究的多模態進化版。Seeduplex 於 2026 年 4 月 9 日 推出,是字節跳動首個原生全雙工且僅限語音的大型語言模型——它能同時聽和說,擺脫了過往「半雙工」的互動模式。
| Seeduplex(2026 年 4 月 9 日) | SeedRealtime(2026 年 8 月 5 日) |
|---|---|
| 純音訊全雙工 | 音訊 + 視訊 + 文字全雙工 |
| 語音層面的「邊聽邊說」 | 同時「邊看、邊聽、邊說」 |
| 單一模態(語音) | 統一多模態架構 |
SeedRealtime 繼承了 Seeduplex 的核心突破——原生端到端全雙工處理——並將其擴展至即時視覺理解,讓模型不僅能根據聽到的內容,也能根據看到的畫面做出反應。
SeedRealtime 已全面部署於字節跳動的 AI 助理應用程式「豆包」(Doubao),並開放給所有使用者。使用者只需將豆包更新至最新版本,並透過「打電話」功能進入視訊通話介面,即可體驗即時的音視訊 AI 互動。
字節跳動展示了多種應用場景:在多人聚會中辨識不同人物並持續追蹤發言者;幫助外國遊客即時理解中文菜單與服務員的解說;在博物館中持續觀察展品,並在指定文物出現時主動提醒;引導使用者操作咖啡機,並根據畫面變化即時糾正錯誤;在閱讀論文時監控翻頁,並在指定章節出現時自動提示。
SeedRealtime 是字節跳動加速發布 AI 模型的其中一環。Seed 團隊在 2025 年中至 2026 年中發布了多款模型:
| 模型 | 類別 | 發布日期 | 主要能力 |
|---|---|---|---|
| Seed 2.1(豆包 2.1 Pro) | 大型語言模型 | 2026 年 6 月 23 日(火山引擎 FORCE);API 已上線 | 通用 LLM;定價約為 $0.88/M 輸入 tokens,$4.42/M 輸出 tokens |
| Seedance 2.5 | 影片生成 | 2026 年 7 月 31 日 | 一次性生成長達 30 秒的 4K 影片;可接受最多 50 個多模態參考;支援時間戳級編輯 |
| Seedream 5.0 Pro | 圖像生成 | 2026 年 6 月 23 日預覽;「即將推出」 | 新一代圖像生成模型 |
| Seed Audio 1.0 | 音樂/音效生成 | 2026 年 6 月 29 日 | 文字轉音訊模型,可用於音樂與音效生成 |
| SeedRealtime | 全雙工音視訊 LLM | 2026 年 8 月 5 日 | 原生音視訊全雙工互動 |
這些模型,連同 Seeduplex(2026 年 4 月 9 日),共同構成了字節跳動涵蓋語言、圖像、影片、音訊生成以及即時多模態互動的全方位 AI 生態系統。