字節跳動喺 2026 年 8 月 5 日推出 SeedRealtime——首個原生音視頻全雙工大模型,可以同時識睇、聽同講。 同傳統語音助手唔同,SeedRealtime 唔使分開用 ASR、視覺模型、LLM 同 TTS 幾個模塊,而係用單一端到端架構,減低延遲同資訊流失。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is ByteDance's SeedRealtime, when was it launched, what unique capabilities does it have compared to traditional voice assistants, what. Article summary: ## What is SeedRealtime?. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
字節跳動嘅 Seed 團隊喺 2026 年 8 月 5 日 正式推出 SeedRealtime,係一個原生音視頻全雙工大語言模型,可以同時睇、同時聽、同時講 。同傳統嗰啲分開用語音辨識、視覺模型、語言模型同文字轉語音嘅做法唔同,SeedRealtime 採用 統一嘅端到端架構,原生融合咗音頻、視頻同文字,做到同步感知、理解、決策同表達——字節跳動話呢個就係「邊睇、邊聽、邊講」嘅體驗
。
傳統語音助手係一條 串聯管道:錄音入去先經 ASR(語音轉文字),傳去視覺模型(如果要用),然後送去 LLM,最後先由 TTS(文字轉語音)輸出。每一次交接都會增加延遲,而且每次過界都會流失一啲上文下理 。
SeedRealtime 呢個新模型有四個主要優勢:
SeedRealtime 最大嘅技術突破,係解決咗 「幾時講、幾時聽」 呢個問題。傳統嘅輪流式(半雙工)助手要等用戶靜咗一陣先敢回應——結果一係搶住講,一係就呆咗 。
SeedRealtime 嘅全雙工架構令到佢可以:
端到端嘅人工評測結果顯示,同串聯模型比較,SeedRealtime 嘅音視頻對話節奏問題 減少咗一半。之前成日出現嘅「未講完就畀人搶住講、講完嘢但回應遲緩、或者畀背景雜音亂觸發」呢啲情況明顯少咗,而一次對話可以完整順暢完成嘅機率就顯著提升 。
SeedRealtime 係字節跳動之前全雙工技術 Seeduplex 嘅 多模態升級版。Seeduplex 喺 2026 年 4 月 9 日 推出,係字節跳動首個原生全雙工 純語音 LLM——佢可以同時聽同講,突破咗之前半雙工嘅模式 。
| Seeduplex(2026 年 4 月 9 日) | SeedRealtime(2026 年 8 月 5 日) |
|---|---|
| 純語音全雙工 | 音頻 + 視頻 + 文字全雙工 |
| 語音方面做到「邊講邊聽」 | 同時「邊睇、邊聽、邊講」 |
| 單一模態(語音) | 統一多模態架構 |
SeedRealtime 繼承咗 Seeduplex 嘅核心突破——原生端到端全雙工處理——再延伸至加入 即時視覺理解,令模型唔單止聽到你講乜,仲睇到你做緊乜 。
SeedRealtime 已經 全面喺豆包 App 上線,所有用戶都用得。只要將豆包更新到最新版本,然後喺「打電話」功能入面進入視頻通話界面,就可以體驗即時音視頻 AI 互動 。
字節跳動仲示範咗幾個應用場景:喺聚會入面認得出邊個打邊個,追蹤邊個喺度講嘢;幫外國遊客即時理解中文菜單同侍應嘅介紹;喺博物館持續觀察展品,當指定文物出現就主動通知;幫用戶操作咖啡機,睇到畫面變化就即時糾錯;閱讀論文時監測翻頁,當指定章節出現就自動提示 。
SeedRealtime 只係字節跳動加速推出 AI 模型嘅一部分。Seed 團隊喺 2025 年中到 2026 年中已經推出咗多款模型:
呢啲模型,連同 Seeduplex(2026 年 4 月 9 日),組成咗字節跳動嘅 全棧 AI 生態系統,涵蓋語言、圖片、視頻、音頻生成同即時多模態互動 。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
字節跳動喺 2026 年 8 月 5 日推出 SeedRealtime——首個原生音視頻全雙工大模型,可以同時識睇、聽同講。
字節跳動喺 2026 年 8 月 5 日推出 SeedRealtime——首個原生音視頻全雙工大模型,可以同時識睇、聽同講。 同傳統語音助手唔同,SeedRealtime 唔使分開用 ASR、視覺模型、LLM 同 TTS 幾個模塊,而係用單一端到端架構,減低延遲同資訊流失。
SeedRealtime 解決咗 AI 對話嘅「幾時講、幾時聽」呢個核心挑戰,對話節奏問題減少一半。