Běžní hlasoví asistenti fungují jako kaskádové potrubí: audio projde ASR (převod řeči na text), text pak případně vizuálním modelem, poté velkým jazykovým modelem (LLM) a nakonec TTS (převod textu na řeč). Každé předání mezi moduly přidává zpoždění a na každém rozhraní se ztrácí kontext .
SeedRealtime toto potrubí nahrazuje čtyřmi klíčovými výhodami:
Nejobtížnějším problémem, který SeedRealtime překonal, je „kdy mluvit a kdy poslouchat" v nepřetržitém multimodálním toku dat. Tradiční asistenti s polovičním duplexem (half-duplex) čekají na období ticha, než odpoví – což znamená, že buď skáčou do řeči, nebo mlčí .
Full-duplexní architektura SeedRealtime umožňuje:
Výsledky end-to-end hodnocení ukazují, že ve srovnání s kaskádovými modely se problémy s rytmem audio-video dialogu u SeedRealtime snížily na polovinu. Výrazně ubylo situací, kdy „řečník nebyl dříve dokončen, odpověď přišla se zpožděním nebo došlo k falešnému spuštění kvůli hluku", a naopak se výrazně zvýšila pravděpodobnost úplného a plynulého jednoho dialogu .
SeedRealtime je multimodální evoluce dřívějšího full-duplexního modelu ByteDance. Seeduplex byl spuštěn 9. dubna 2026 jako první nativní full-duplexní pouze hlasový LLM od ByteDance – uměl zároveň poslouchat i mluvit, čímž překonal předchozí half-duplexní paradigma .
| Seeduplex (9. dubna 2026) | SeedRealtime (5. srpna 2026) |
|---|---|
| Pouze audio full-duplex | Audio + video + text full-duplex |
| „Poslouchání při mluvení" pro hlas | „Sledování, poslouchání a mluvení" současně |
| Jedna modalita (řeč) | Jednotná multimodální architektura |
SeedRealtime přebírá klíčový průlom Seeduplexu – nativní end-to-end full-duplexní zpracování – a rozšiřuje ho o porozumění videu v reálném čase, což modelu umožňuje reagovat nejen na to, co slyší, ale i na to, co vidí .
SeedRealtime je plně nasazen v aplikaci Doubao (豆包) – AI asistentovi od ByteDance – a je k dispozici všem uživatelům. Stačí aktualizovat Doubao na nejnovější verzi a prostřednictvím funkce „telefonát" vstoupit do rozhraní videohovoru, kde lze zažít interakci s AI v reálném čase .
ByteDance předvedl několik případů použití: identifikaci různých osob ve skupinové konverzaci a sledování, kdo právě mluví; pomoc zahraničnímu turistovi s porozuměním čínskému menu a výkladu číšníka v reálném čase; nepřetržité pozorování exponátu v muzeu a proaktivní upozornění, když se objeví konkrétní artefakt; navigaci uživatele při obsluze kávovaru a opravu chyb na základě vizuálních změn; sledování otáčení stránek při čtení odborného článku a automatické upozornění, když se objeví cílová kapitola .
SeedRealtime je jednou ze součástí zrychlujícího se tempa vydávání AI modelů ByteDance. Tým Seed mezitím uvedl několik dalších modelů:
| Model | Kategorie | Datum uvedení | Klíčová schopnost |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Velký jazykový model | 23. června 2026 (Volcano Engine FORCE); živě přes API | Obecný LLM; cena ~0,88 USD/M vstupních tokenů, ~4,42 USD/M výstupních tokenů |
| Seedance 2.5 | Generování videa | 31. července 2026 | 30sekundové 4K video na jeden zátah; přijímá až 50 multimodálních referencí; úpravy na úrovni časových kódů |
| Seedream 5.0 Pro | Generování obrázků | Preview 23. června 2026; „již brzy" | Model nové generace pro generování obrázků |
| Seed Audio 1.0 | Generování hudby/ zvuků | 29. června 2026 | Model pro převod textu na audio (hudba a zvukové efekty) |
| SeedRealtime | Full-duplexní audio-vizuální LLM | 5. srpna 2026 | Nativní audio-vizuální full-duplexní interakce |
Tyto modely společně s Seeduplexem (9. dubna 2026) tvoří full-stack AI ekosystém ByteDance pokrývající jazyk, obraz, video, generování zvuku a interakci v reálném čase .