ByteDance запустила SeedRealtime 5 августа 2026 года — это нативная аудиовизуальная полнодуплексная большая языковая модель (LLM), которая может одновременно смотреть, слушать и говорить. В отличие от традиционных голосовых помощников, использующих отдельные модули ASR, зрения, LLM и TTS, SeedRealtime работает на ед...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is ByteDance's SeedRealtime, when was it launched, what unique capabilities does it have compared to traditional voice assistants, what. Article summary: ## What is SeedRealtime?. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
5 августа 2026 года команда Seed, входящая в состав ByteDance, представила SeedRealtime — нативную аудиовизуальную полнодуплексную большую языковую модель (LLM), способную одновременно смотреть, слушать и говорить . В отличие от традиционных систем, где распознавание речи (ASR), зрение (CV), языковая модель (LLM) и синтез речи (TTS) работают как отдельные модули, SeedRealtime использует единую сквозную архитектуру, которая нативно объединяет аудио, видео и текст. Это позволяет модели параллельно воспринимать, понимать, принимать решения и выдавать ответы — то, что ByteDance называет опытом «смотреть, слушать и говорить»
.
Традиционные голосовые помощники работают по каскадной схеме: аудио проходит через ASR (распознавание речи), текст — через модель зрения (если требуется), затем через LLM, и наконец — через TTS (синтез речи). Каждый переход между модулями добавляет задержку и теряет контекст .
SeedRealtime заменяет эту схему четырьмя ключевыми преимуществами:
Самой сложной проблемой, которую решила SeedRealtime, стало определение «когда говорить, а когда слушать» в непрерывном мультимодальном потоке. Традиционные ассистенты с поочередной (полудуплексной) схемой ждут паузы перед ответом — из-за этого они либо перебивают, либо молчат .
Полнодуплексная архитектура SeedRealtime позволяет модели:
Результаты сквозного человеческого тестирования показывают, что по сравнению с каскадными моделями количество проблем с ритмом аудио-видео диалога сократилось вдвое. Такие проблемы, как «перебивание до окончания фразы, задержка ответа после паузы или ложное срабатывание на фоновый шум», значительно уменьшились, а вероятность полного и плавного диалога заметно выросла .
SeedRealtime — это мультимодальная эволюция более ранней полнодуплексной работы ByteDance. Seeduplex был запущен 9 апреля 2026 года как первая нативная полнодуплексная только голосовая LLM от ByteDance — она могла одновременно слушать и говорить, преодолев предыдущую полудуплексную парадигму .
| Seeduplex (9 апреля 2026) | SeedRealtime (5 августа 2026) |
|---|---|
| Полнодуплекс только по аудио | Полнодуплекс по аудио + видео + текст |
| «Слушай, пока говоришь» (голос) | «Смотри, слушай и говори» одновременно |
| Одна модальность (речь) | Единая мультимодальная архитектура |
SeedRealtime берёт ключевой прорыв Seeduplex — нативную сквозную полнодуплексную обработку — и расширяет её на понимание видео в реальном времени, позволяя модели реагировать на то, что она видит, в дополнение к тому, что слышит .
SeedRealtime полностью развёрнут в приложении Doubao (豆包) — ИИ-помощнике ByteDance — и доступен всем пользователям. Чтобы начать работу, нужно обновить Doubao до последней версии и войти в интерфейс видеочата через функцию «звонок» .
ByteDance продемонстрировала множество сценариев использования: идентификация разных людей в группе и отслеживание говорящего; помощь иностранному туристу в понимании китайского меню и пояснений официанта в реальном времени; непрерывное наблюдение за музейным экспонатом с оповещением, когда появляется определённый артефакт; помощь пользователю в управлении кофемашиной с исправлением ошибок на основе визуальных изменений; отслеживание перелистывания страниц при чтении статьи с автоматическим оповещением о появлении нужной главы .
SeedRealtime — лишь часть стремительно расширяющейся линейки ИИ от ByteDance. Команда Seed выпустила несколько моделей с середины 2025 по середину 2026 года:
Вместе с Seeduplex (9 апреля 2026) эти модели образуют полноценную ИИ-экосистему ByteDance, охватывающую генерацию текста, изображений, видео, аудио и взаимодействие в реальном времени .
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
ByteDance запустила SeedRealtime 5 августа 2026 года — это нативная аудиовизуальная полнодуплексная большая языковая модель (LLM), которая может одновременно смотреть, слушать и говорить.
ByteDance запустила SeedRealtime 5 августа 2026 года — это нативная аудиовизуальная полнодуплексная большая языковая модель (LLM), которая может одновременно смотреть, слушать и говорить. В отличие от традиционных голосовых помощников, использующих отдельные модули ASR, зрения, LLM и TTS, SeedRealtime работает на единой сквозной архитектуре, устраняя задержки и потерю контекста.
Модель решает ключевую проблему диалогового ритма: она определяет, когда говорить, а когда слушать, не полагаясь на паузы и уменьшая количество ошибок взаимодействия вдвое.