Gli assistenti vocali tradizionali operano come una pipeline a cascata: l'audio passa attraverso un sistema ASR (riconoscimento vocale), il testo attraversa un modello di visione se necessario, poi un LLM e infine un sistema TTS (sintesi vocale). Ogni passaggio aggiunge latenza e il contesto si perde a ogni confine .
SeedRealtime sostituisce questa pipeline con quattro vantaggi chiave:
Il problema più difficile che SeedRealtime ha risolto è "quando parlare, quando ascoltare" in un flusso multimodale continuo. I tradizionali assistenti half-duplex aspettano un periodo di silenzio prima di rispondere, il che significa che o interrompono o restano in silenzio .
L'architettura full-duplex di SeedRealtime gli consente di:
I risultati della valutazione umana end-to-end mostrano che, rispetto ai modelli a cascata, i problemi di ritmo del dialogo audio-video di SeedRealtime sono stati ridotti della metà. Problemi come "essere interrotti prima di finire, risposte ritardate dopo aver parlato o falsi inneschi dovuti a rumore di fondo" sono diminuiti significativamente, mentre la probabilità di un dialogo singolo completo e fluido è aumentata notevolmente .
SeedRealtime è l'evoluzione multimodale del precedente lavoro full-duplex di ByteDance. Seeduplex è stato lanciato il 9 aprile 2026 come primo LLM full-duplex nativo solo vocale di ByteDance: poteva ascoltare e parlare simultaneamente, superando il precedente paradigma half-duplex .
| Seeduplex (9 aprile 2026) | SeedRealtime (5 agosto 2026) |
|---|---|
| Full-duplex solo audio | Full-duplex audio + video + testo |
| "Ascolta mentre parli" per la voce | "Guarda, ascolta e parla" simultaneamente |
| Modalità singola (parola) | Architettura multimodale unificata |
SeedRealtime prende la scoperta fondamentale di Seeduplex (elaborazione nativa end-to-end full-duplex) e la estende per incorporare la comprensione visiva in tempo reale, consentendo al modello di reagire a ciò che vede oltre a ciò che sente .
SeedRealtime è stato distribuito completamente nell'app Doubao (豆包) — l'assistente AI di ByteDance — ed è disponibile per tutti gli utenti. Gli utenti aggiornano Doubao all'ultima versione e accedono all'interfaccia di videochiamata tramite la funzione "telefonata" per sperimentare l'interazione AI audio-video in tempo reale .
ByteDance ha dimostrato diversi casi d'uso: identificare diverse persone in una conversazione di gruppo e tenere traccia di chi sta parlando; aiutare un turista straniero a comprendere un menu cinese e le spiegazioni del cameriere in tempo reale; osservare continuamente una mostra museale e avvisare proattivamente quando appare un artefatto specifico; guidare un utente nell'uso di una macchina da caffè e correggere errori in base ai cambiamenti visivi; monitorare il voltare pagina durante la lettura di un articolo e suggerire automaticamente quando appare un capitolo target .
SeedRealtime è un tassello del ritmo crescente di rilascio dell'IA di ByteDance. Il team Seed ha pubblicato diversi modelli da metà 2025 a metà 2026:
| Modello | Categoria | Data di lancio | Capacità chiave |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Modello linguistico | 23 giugno 2026 (Volcano Engine FORCE); live via API | LLM generico; prezzo ~$0.88/M token di input, ~$4.42/M token di output |
| Seedance 2.5 | Generazione video | 31 luglio 2026 | Generazione video 4K a 30 secondi in un unico passaggio; accetta fino a 50 riferimenti multimodali; editing con timestamp |
| Seedream 5.0 Pro | Generazione immagini | Anteprima il 23 giugno 2026; "in arrivo" | Modello di generazione immagini di nuova generazione |
| Seed Audio 1.0 | Generazione musicale/suoni | 29 giugno 2026 | Modello text-to-audio per generazione musicale e effetti sonori |
| SeedRealtime | LLM full-duplex audio-video | 5 agosto 2026 | Interazione full-duplex audio-video nativa |
Questi modelli, insieme a Seeduplex (9 aprile 2026), formano l'ecosistema AI full-stack di ByteDance che copre generazione di linguaggio, immagini, video, audio e interazione multimodale in tempo reale .