Traditionella röstassistenter arbetar i en kedja av steg: ljudet förstås av en taligenkänningsmodell (ASR), texten skickas vidare till en bildmodell om det behövs, därefter till en språkmodell (LLM) och slutligen till en talsyntesmodell (TTS). Varje överföring mellan modulerna skapar fördröjning, och sammanhanget går förlorat vid varje gränssnitt .
SeedRealtime ersätter denna kedja med fyra centrala fördelar:
Den svåraste utmaningen som SeedRealtime löste är ”när ska man tala, när ska man lyssna” i en kontinuerlig ström av ljud och bild. Traditionella röstassistenter (halv-duplex) väntar på en tystnad innan de svarar – vilket antingen leder till att de avbryter eller blir tysta .
SeedRealtimes full-duplex-arkitektur gör att den kan:
Resultaten från slut-till-slut-utvärderingar visar att SeedRealtime halverade problemen med samtalsrytm jämfört med kedjemodeller. Problem som ”bli avbruten innan man talat färdigt, försenade svar eller falska utlösningar av bakgrundsljud” minskade kraftigt, medan sannolikheten för en fullständig och smidig dialog ökade markant .
SeedRealtime är den multimodala utvecklingen av ByteDances tidigare full-duplex-arbete. Seeduplex lanserades den 9 april 2026 som ByteDances första direktanslutna endast tal full-duplex LLM – den kunde lyssna och tala samtidigt, vilket var ett steg bortom den tidigare halv-duplex-paradigmen .
| Seeduplex (9 april 2026) | SeedRealtime (5 augusti 2026) |
|---|---|
| Endast ljud, full-duplex | Ljud + video + text, full-duplex |
| ”Lyssna medan du talar” för röst | ”Se, lyssna och tala” samtidigt |
| En modalitet (tal) | Enhetlig multimodal arkitektur |
SeedRealtime tar Seeduplex kärngenombrott – direktansluten full-duplex-bearbetning – och utökar det med realtidsbildförståelse, så att modellen kan reagera på vad den ser utöver vad den hör .
SeedRealtime är fullt integrerad i appen Doubao (豆包) – ByteDances AI-assistent – och är tillgänglig för alla användare. Genom att uppdatera Doubao till den senaste versionen och gå in i videokonversationsgränssnittet via ”telefonsamtalsfunktionen” kan användare uppleva realtidsinteraktion med ljud och bild .
ByteDance har demonstrerat flera användningsområden: att identifiera olika personer i en grupp och följa vem som talar; att hjälpa en utländsk turist att förstå en kinesisk meny och servitörens förklaringar i realtid; att kontinuerligt övervaka en museiutställning och självmant varna när ett specifikt föremål dyker upp; att guida en användare genom att använda en kaffemaskin och korrigera fel baserat på visuella förändringar; att övervaka sidvändning vid läsning av en text och automatiskt påminna när ett visst kapitel dyker upp .
SeedRealtime är en del av ByteDances allt snabbare lanseringstakt. Seed-teamet har lanserat flera modeller från mitten av 2025 till mitten av 2026:
| Modell | Kategori | Lansering | Nyckelfunktion |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Språkmodell | 23 juni 2026. Volcano Engine FORCE; live via API | Allmän LLM; pris ca 0,88 USD/M input-tokens, 4,42 USD/M output-tokens |
| Seedance 2.5 | Videogenerering | 31 juli 2026 | 30 sekunders 4K-video i ett steg; upp till 50 multimodala referenser; tidsstämpelbaserad redigering |
| Seedream 5.0 Pro | Bildgenerering | Förhandsvisad 23 juni 2026; ”kommer snart” | Nästa generations bildgenereringsmodell |
| Seed Audio 1.0 | Musik/ljudgenerering | 29 juni 2026 | Text-till-ljud-modell för musik och ljudeffekter |
| SeedRealtime | Full-duplex ljud-bild LLM | 5 augusti 2026 | Direktansluten ljud-bild-interaktion |
Dessa modeller, tillsammans med Seeduplex (9 april 2026), bildar ByteDances fullstack-AI-ekosystem som omfattar språk, bild, video, ljudgenerering och realtidsmultimodal interaktion .