Asisten suara tradisional beroperasi sebagai saluran paip bertingkat: audio melalui ASR (pertuturan-ke-teks), teks melalui model penglihatan jika perlu, kemudian melalui LLM, dan akhirnya melalui TTS (teks-ke-pertuturan). Setiap pertukaran menambah kependaman, dan konteks hilang di setiap sempadan .
SeedRealtime menggantikan saluran paip ini dengan empat kelebihan utama:
Masalah paling sukar yang diselesaikan SeedRealtime ialah "bila hendak bercakap, bila hendak mendengar" dalam aliran multimodal yang berterusan. Asisten berasaskan giliran (half-duplex) tradisional menunggu tempoh senyap sebelum bertindak balas — yang bermaksud mereka sama ada mengganggu atau duduk diam .
Seni bina full-duplex SeedRealtime membolehkannya:
Penilaian manusia hujung-ke-hujung menunjukkan bahawa berbanding model bertingkat, masalah irama dialog audio-video SeedRealtime berkurang separuh. Isu seperti "diganggu sebelum selesai, tindak balas tertangguh selepas bercakap, atau dicetuskan palsu oleh bunyi latar belakang" menurun dengan ketara, manakala kebarangkalian dialog tunggal yang lengkap dan lancar meningkat dengan ketara .
SeedRealtime ialah evolusi multimodal bagi kerja full-duplex awal ByteDance. Seeduplex dilancarkan pada 9 April 2026 sebagai LLM full-duplex pertuturan sahaja asli pertama ByteDance — ia boleh mendengar dan bercakap serentak, melangkaui paradigma half-duplex sebelumnya .
| Seeduplex (9 April 2026) | SeedRealtime (5 Ogos 2026) |
|---|---|
| Full-duplex audio sahaja | Full-duplex audio + video + teks |
| "Mendengar sambil bercakap" untuk suara | "Menonton, mendengar dan bercakap" serentak |
| Modaliti tunggal (pertuturan) | Seni bina multimodal bersatu |
SeedRealtime mengambil kejayaan teras Seeduplex — pemprosesan full-duplex hujung-ke-hujung asli — dan melanjutkannya untuk menggabungkan pemahaman visual masa nyata, membolehkan model bertindak balas terhadap apa yang dilihatnya selain apa yang didengarinya .
SeedRealtime telah digunakan sepenuhnya dalam aplikasi Doubao (豆包) — pembantu AI ByteDance — dan tersedia kepada semua pengguna. Pengguna mengemas kini Doubao ke versi terkini dan memasuki antara muka panggilan video melalui ciri "panggilan telefon" untuk mengalami interaksi AI audio-video masa nyata .
ByteDance telah menunjukkan pelbagai kes penggunaan: mengenal pasti orang yang berbeza dalam perbualan kumpulan dan menjejaki siapa yang bercakap; membantu pelancong asing memahami menu Cina dan penerangan pelayan dalam masa nyata; memerhati pameran muzium secara berterusan dan memberi amaran secara proaktif apabila artifak tertentu muncul; membimbing pengguna mengendalikan mesin kopi dan membetulkan kesilapan berdasarkan perubahan visual; memantau pembalikan halaman semasa membaca kertas dan secara automatik menggesa apabila bab sasaran muncul .
SeedRealtime adalah sebahagian daripada rentak pelancaran AI ByteDance yang semakin pantas. Pasukan Seed telah menghantar pelbagai model dari pertengahan 2025 hingga pertengahan 2026:
| Model | Kategori | Tarikh Pelancaran | Keupayaan Utama |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Model bahasa besar | 23 Jun 2026 (Volcano Engine FORCE); langsung melalui API | LLM tujuan umum; berharga ~$0.88/M token input, ~$4.42/M token output |
| Seedance 2.5 | Penjanaan video | 31 Julai 2026 | Penjanaan video 30 saat 4K satu tangkapan; menerima sehingga 50 rujukan multimodal; penyuntingan peringkat cap masa |
| Seedream 5.0 Pro | Penjanaan imej | Pratonton 23 Jun 2026; "akan datang" | Model penjanaan imej generasi akan datang |
| Seed Audio 1.0 | Penjanaan muzik/bunyi | 29 Jun 2026 | Model teks-ke-audio untuk penjanaan muzik dan kesan bunyi |
| SeedRealtime | LLM audio-visual full-duplex | 5 Ogos 2026 | Interaksi audio-visual full-duplex asli |
Model-model ini, bersama-sama dengan Seeduplex (9 April 2026), membentuk ekosistem AI penuh timbunan ByteDance merangkumi penjanaan bahasa, imej, video, audio dan interaksi multimodal masa nyata .