Les assistants vocaux traditionnels fonctionnent comme un pipeline en cascade : l'audio passe par la reconnaissance vocale (ASR) pour devenir du texte, le texte traverse un modèle de vision si nécessaire, puis un LLM, et enfin un module de synthèse vocale (TTS). Chaque transfert ajoute de la latence, et le contexte se perd à chaque frontière .
SeedRealtime remplace ce pipeline par quatre avantages clés :
Le problème le plus difficile que SeedRealtime a résolu est celui de « quand parler, quand écouter » dans un flux multimodal continu. Les assistants traditionnels à tour de rôle (half-duplex) attendent une période de silence avant de répondre — ce qui signifie qu'ils interrompent ou restent silencieux .
L'architecture full-duplex de SeedRealtime lui permet de :
Les résultats d'évaluation humaine de bout en bout montrent que, par rapport aux modèles en cascade, les problèmes de rythme des dialogues audio-vidéo de SeedRealtime ont été réduits de moitié. Les problèmes comme « se faire interrompre avant d'avoir fini, des réponses retardées après avoir parlé, ou des déclenchements intempestifs causés par le bruit de fond » ont considérablement diminué, tandis que la probabilité d'un dialogue unique complet et fluide a sensiblement augmenté .
SeedRealtime est l'évolution multimodale des travaux antérieurs de ByteDance sur le full-duplex. Seeduplex a été lancé le 9 avril 2026 comme premier LLM full-duplex natif uniquement vocal de ByteDance — il pouvait écouter et parler simultanément, dépassant le paradigme précédent du half-duplex .
| Seeduplex (9 avril 2026) | SeedRealtime (5 août 2026) |
|---|---|
| Full-duplex audio uniquement | Full-duplex audio + vidéo + texte |
| « Écouter en parlant » pour la voix | « Regarder, écouter et parler » simultanément |
| Modalité unique (parole) | Architecture multimodale unifiée |
SeedRealtime reprend la percée centrale de Seeduplex — le traitement full-duplex natif de bout en bout — et l'étend pour intégrer la compréhension visuelle en temps réel, permettant au modèle de réagir à ce qu'il voit en plus de ce qu'il entend .
SeedRealtime a été entièrement déployé dans l'application Doubao (豆包) — l'assistant IA de ByteDance — et est accessible à tous les utilisateurs. Les utilisateurs mettent à jour Doubao vers la dernière version et entrent dans l'interface d'appel vidéo via la fonction « appel téléphonique » pour expérimenter l'interaction IA audio-vidéo en temps réel .
ByteDance a démontré plusieurs cas d'usage : identifier différentes personnes dans une conversation de groupe et suivre qui parle ; aider un touriste étranger à comprendre un menu chinois et les explications du serveur en temps réel ; observer en continu une exposition de musée et alerter proactivement lorsqu'un artefact spécifique apparaît ; guider un utilisateur dans l'utilisation d'une machine à café et corriger les erreurs en fonction des changements visuels ; surveiller le changement de page lors de la lecture d'un article et inviter automatiquement à l'apparition d'un chapitre cible .
SeedRealtime fait partie du rythme accéléré des lancements IA de ByteDance. L'équipe Seed a livré plusieurs modèles entre mi-2025 et mi-2026 :
| Modèle | Catégorie | Date de lancement | Capacité clé |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Grand modèle de langage | 23 juin 2026 (Volcano Engine FORCE) ; disponible via API | LLM généraliste ; tarifé à environ 0,88 $/M tokens d'entrée, 4,42 $/M tokens de sortie |
| Seedance 2.5 | Génération vidéo | 31 juillet 2026 | Génération vidéo 4K en un seul passage de 30 secondes ; accepte jusqu'à 50 références multimodales ; édition au niveau des horodatages |
| Seedream 5.0 Pro | Génération d'images | Aperçu le 23 juin 2026 ; « à venir » | Modèle de génération d'images de nouvelle génération |
| Seed Audio 1.0 | Génération musicale/sonore | 29 juin 2026 | Modèle texte-audio pour la génération de musique et d'effets sonores |
| SeedRealtime | LLM audio-visuel full-duplex | 5 août 2026 | Interaction full-duplex audio-visuelle native |
Ces modèles, avec Seeduplex (9 avril 2026), forment l'écosystème IA complet de ByteDance couvrant le langage, l'image, la vidéo, la génération audio et l'interaction multimodale en temps réel .