Традиційні голосові асистенти працюють як каскадний конвеєр: спочатку аудіо проходить через ASR (розпізнавання мовлення), потім текст — через модель зору (якщо потрібно), далі через велику мовну модель, і нарешті через TTS (синтез мовлення). Кожен перехід додає затримки, а контекст втрачається на кожному етапі .
SeedRealtime замінює цей конвеєр чотирма ключовими перевагами:
Найскладнішою проблемою, яку вирішив SeedRealtime, є «коли говорити, коли слухати» в безперервному мультимодальному потоці. Традиційні покрокові (напівдуплексні) асистенти чекають на період тиші, перш ніж відповісти — що означає, що вони або перебивають, або мовчки чекають .
Архітектура повного дуплексу SeedRealtime дозволяє:
Результати наскрізної людської оцінки показують, що порівняно з каскадними моделями проблеми з ритмом аудіовідеодіалогу в SeedRealtime зменшилися вдвічі. Такі явища, як «перебивання до завершення фрази, затримки відповіді після мовлення або хибне спрацьовування на фоновий шум», значно зменшилися, а ймовірність повного та плавного однократного діалогу помітно зросла .
SeedRealtime є мультимодальною еволюцією попередньої роботи ByteDance у сфері повного дуплексу. Seeduplex був запущений 9 квітня 2026 року як перша нативна модель повного дуплексу від ByteDance, що працювала лише з мовленням — вона могла одночасно слухати і говорити, долаючи попередню напівдуплексну парадигму .
| Seeduplex (9 квітня 2026) | SeedRealtime (5 серпня 2026) |
|---|---|
| Аудіо-повний дуплекс | Аудіо + відео + текст повний дуплекс |
| «Слухай, поки говориш» для голосу | «Дивись, слухай і говори» одночасно |
| Одна модальність (мовлення) | Уніфікована мультимодальна архітектура |
SeedRealtime бере основний прорив Seeduplex — нативне наскрізне опрацювання повного дуплексу — і розширює його, додаючи розуміння відео в реальному часі, що дозволяє моделі реагувати на те, що вона бачить, на додачу до того, що чує .
SeedRealtime повністю розгорнуто в додатку Doubao (豆包) — ШІ-асистенті ByteDance — і доступний усім користувачам. Користувачі оновлюють Doubao до останньої версії та через функцію «телефонний дзвінок» переходять до інтерфейсу відеодзвінків, щоб отримати досвід взаємодії зі штучним інтелектом у реальному часі через аудіо та відео .
ByteDance продемонструвала численні сценарії використання: розпізнавання різних людей у груповій розмові та відстеження того, хто говорить; допомога іноземному туристу в розумінні китайського меню та пояснень офіціанта в реальному часі; безперервне спостереження за музейним експонатом і проактивне попередження, коли з'являється конкретний артефакт; керування користувачем під час роботи з кавоваркою та виправлення помилок на основі візуальних змін; відстеження перегортання сторінок під час читання наукової роботи та автоматичне сповіщення, коли з'являється потрібний розділ .
SeedRealtime є частиною прискореного темпу випуску ШІ-моделей ByteDance. Команда Seed випустила кілька моделей у період з середини 2025 до середини 2026 року:
| Модель | Категорія | Дата запуску | Ключова можливість |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Велика мовна модель | 23 червня 2026 (Volcano Engine FORCE); доступна через API | Універсальна LLM; ціна ~$0,88/млн вхідних токенів, ~$4,42/млн вихідних |
| Seedance 2.5 | Генерація відео | 31 липня 2026 | 30-секундне відео 4K за один прохід; підтримує до 50 мультимодальних посилань; покадрове редагування |
| Seedream 5.0 Pro | Генерація зображень | Анонсовано 23 червня 2026; «скоро» | Модель генерації зображень наступного покоління |
| Seed Audio 1.0 | Генерація музики/звуку | 29 червня 2026 | Текст-в-аудіо модель для створення музики та звукових ефектів |
| SeedRealtime | Аудіовізуальна LLM повного дуплексу | 5 серпня 2026 | Нативна аудіовізуальна взаємодія повного дуплексу |
Ці моделі, разом із Seeduplex (9 квітня 2026), формують повноцінну ШІ-екосистему ByteDance, що охоплює мову, зображення, відео, аудіогенерацію та взаємодію в реальному часі .