Tradycyjne asystenty głosowe działają jak kaskadowy potok: dźwięk przechodzi przez ASR (zamiana mowy na tekst), następnie tekst trafia do modelu wizji (jeśli jest potrzebny), potem do modelu językowego (LLM), a na końcu do modelu zamiany tekstu na mowę (TTS). Każde przejście między modułami dodaje opóźnienia i powoduje utratę kontekstu .
SeedRealtime zastępuje ten potok czterema kluczowymi zaletami:
Najtrudniejszym problemem, który rozwiązał SeedRealtime, jest „kiedy mówić, kiedy słuchać” w ciągłym, wielomodalnym strumieniu. Tradycyjni asystenci działający w trybie naprzemiennym (half-duplex) czekają na moment ciszy, zanim odpowiedzą – co oznacza, że albo przerywają, albo milczą .
Pełnodupleksowa architektura SeedRealtime pozwala mu na:
Wyniki kompleksowych testów z udziałem ludzi pokazują, że w porównaniu z modelami kaskadowymi, problemy z rytmem dialogu audio-wideo w SeedRealtime zostały zmniejszone o połowę. Problemy takie jak „przerywanie przed skończeniem wypowiedzi, opóźnione odpowiedzi po zakończeniu mówienia czy fałszywe wywołania przez hałas w tle” znacząco zmalały, a prawdopodobieństwo pełnej i płynnej pojedynczej rozmowy wyraźnie wzrosło .
SeedRealtime jest wielomodalną ewolucją wcześniejszej pracy ByteDance w zakresie pełnego dupleksu. Seeduplex został uruchomiony 9 kwietnia 2026 roku jako pierwszy natywny, pełnodupleksowy model LLM ByteDance tylko do mowy – potrafił jednocześnie słuchać i mówić, wykraczając poza poprzedni paradygmat half-duplex .
| Seeduplex (9 kwietnia 2026) | SeedRealtime (5 sierpnia 2026) |
|---|---|
| Pełny dupleks tylko dla dźwięku | Pełny dupleks dla audio + wideo + tekstu |
| „Słuchaj podczas mówienia” dla głosu | „Patrz, słuchaj i mów” jednocześnie |
| Pojedyncza modalność (mowa) | Jednolita, wielomodalna architektura |
SeedRealtime przejmuje kluczowy przełom Seeduplex – natywne, kompleksowe przetwarzanie w pełnym dupleksie – i rozszerza go o rozumienie obrazu w czasie rzeczywistym, umożliwiając modelowi reagowanie na to, co widzi, oprócz tego, co słyszy .
SeedRealtime został w pełni wdrożony w aplikacji Doubao (豆包) – asystencie SI ByteDance – i jest dostępny dla wszystkich użytkowników. Użytkownicy mogą zaktualizować Doubao do najnowszej wersji i wejść do interfejsu połączeń wideo za pomocą funkcji „połączenie telefoniczne”, aby doświadczyć interakcji SI w czasie rzeczywistym z dźwiękiem i obrazem .
ByteDance zaprezentował wiele przypadków użycia: identyfikowanie różnych osób w grupie i śledzenie, kto mówi; pomoc zagranicznemu turyście w zrozumieniu chińskiego menu i wyjaśnień kelnera w czasie rzeczywistym; ciągłe obserwowanie eksponatu muzealnego i aktywne ostrzeganie, gdy pojawi się konkretny artefakt; prowadzenie użytkownika przez obsługę ekspresu do kawy i korygowanie błędów na podstawie zmian wizualnych; monitorowanie przewracania stron podczas czytania artykułu i automatyczne wywoływanie, gdy pojawi się docelowy rozdział .
SeedRealtime jest jednym z elementów przyspieszającego tempa wydań SI przez ByteDance. Zespół Seed wypuścił wiele modeli od połowy 2025 do połowy 2026 roku:
| Model | Kategoria | Data wydania | Kluczowa funkcja |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Duży model językowy | 23 czerwca 2026 (Volcano Engine FORCE); aktywny przez API | Ogólnego przeznaczenia LLM; cena ~0,88 USD/M tokenów wejściowych, ~4,42 USD/M tokenów wyjściowych |
| Seedance 2.5 | Generowanie wideo | 31 lipca 2026 | Generowanie 30-sekundowego wideo 4K w jednym przebiegu; akceptuje do 50 multimodalnych referencji; edycja na poziomie znaczników czasu |
| Seedream 5.0 Pro | Generowanie obrazów | Zapowiedziany 23 czerwca 2026; „wkrótce” | Model nowej generacji do generowania obrazów |
| Seed Audio 1.0 | Generowanie muzyki/dźwięku | 29 czerwca 2026 | Model zamiany tekstu na dźwięk do generowania muzyki i efektów dźwiękowych |
| SeedRealtime | Pełnodupleksowy model audiowizualny LLM | 5 sierpnia 2026 | Natywna, audiowizualna interakcja w pełnym dupleksie |
Modele te, wraz z Seeduplex (9 kwietnia 2026), tworzą pełny ekosystem SI ByteDance, obejmujący generowanie języka, obrazu, wideo i dźwięku oraz interakcję multimodalną w czasie rzeczywistym .