تعمل المساعدات الصوتية التقليدية كـ خط أنابيب متسلسل: يمر الصوت عبر نظام التعرف على الكلام (ASR)، ثم النص عبر نموذج الرؤية إذا لزم الأمر، ثم عبر نموذج لغوي كبير (LLM)، وأخيرًا عبر نظام تحويل النص إلى كلام (TTS). كل مرحلة تضيف تأخيرًا، ويتم فقدان السياق عند كل حد فاصل بين هذه المراحل .
يستبدل SeedRealtime هذا الخط المتسلسل بأربع مزايا رئيسية:
أصعب مشكلة حلها SeedRealtime هي مسألة "متى يتحدث ومتى يستمع" في تدفق مستمر متعدد الوسائط. المساعدات التقليدية التي تعمل بنظام النصف-مزدوج (Half-Duplex) تنتظر فترة من الصمت قبل الرد — مما يعني أنها إما تقاطع المستخدم أو تظل صامتة .
تسمح بنية الإرسال المزدوج الكامل (Full-Duplex) لـ SeedRealtime بما يلي:
أظهرت نتائج التقييم البشري الشامل أنه مقارنة بالنماذج المتسلسلة، انخفضت مشاكل إيقاع الحوار الصوتي-المرئي في SeedRealtime إلى النصف. المشكلات مثل "المقاطعة قبل إنهاء الحديث، أو تأخر الردود بعد التحدث، أو التنشيط الخاطئ بسبب الضوضاء الخلفية" انخفضت بشكل كبير، بينما زادت احتمالية حدوث حوار واحد كامل وسلس بشكل ملحوظ .
يعتبر SeedRealthime التطور متعدد الوسائط لعمل بايت دانس السابق في نظام الإرسال المزدوج الكامل. فقد تم إطلاق Seeduplex في 9 أبريل 2026 كأول نموذج لغوي ضخم أصلي يعمل بنظام الإرسال المزدوج الكامل للصوت فقط من بايت دانس — حيث كان بإمكانه الاستماع والتحدث في وقت واحد، متجاوزًا النموذج السابق للنصف-مزدوج .
| Seeduplex (9 أبريل 2026) | SeedRealtime (5 أغسطس 2026) |
|---|---|
| إرسال مزدوج كامل للصوت فقط | إرسال مزدوج كامل للصوت + الفيديو + النص |
| "الاستماع أثناء التحدث" للصوت | "الرؤية والسمع والتحدث" في وقت واحد |
| نمط واحد (الكلام) | معمارية موحدة متعددة الوسائط |
يأخذ SeedRealtime الاختراق الأساسي لـ Seeduplex — وهو المعالجة الأصلية للإرسال المزدوج الكامل من البداية إلى النهاية — ويمدها لتشمل الفهم البصري في الوقت الفعلي، مما يمكن النموذج من التفاعل مع ما يراه بالإضافة إلى ما يسمعه .
تم النشر الكامل لـ SeedRealtime في تطبيق Doubao (豆包) — المساعد الذكي من بايت دانس — وهو متاح لجميع المستخدمين. يقوم المستخدمون بتحديث تطبيق Doubao إلى أحدث إصدار والدخول إلى واجهة مكالمات الفيديو من خلال ميزة "المكالمة الهاتفية" لتجربة التفاعل الصوتي-المرئي المباشر بالذكاء الاصطناعي .
أظهرت بايت دانس عدة حالات استخدام: التعرف على مختلف الأشخاص في محادثة جماعية وتتبع المتحدث؛ مساعدة سائح أجنبي في فهم قائمة طعام صينية وشروحات النادل في الوقت الفعلي؛ مراقبة معرض متحفي باستمرار والتنبيه بشكل استباقي عند ظهور قطعة أثرية محددة؛ توجيه المستخدم لتشغيل آلة القهوة وتصحيح الأخطاء بناءً على التغيرات البصرية؛ مراقبة قلب الصفحات أثناء قراءة ورقة بحثية والتنبيه تلقائيًا عند ظهور فصل معين .
يعتبر SeedRealtime جزءًا من إيقاع الإصدارات المتسارع لنماذج الذكاء الاصطناعي من بايت دانس. لقد أصدر فريق Seed نماذج متعددة من منتصف 2025 إلى منتصف 2026:
| النموذج | الفئة | تاريخ الإطلاق | القدرة الرئيسية |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | نموذج لغوي كبير | 23 يونيو 2026 (في مؤتمر Volcano Engine FORCE)؛ متاح عبر API | LLM متعدد الأغراض؛ بسعر ~0.88 دولار/مليون رمز إدخال، ~4.42 دولار/مليون رمز إخراج |
| Seedance 2.5 | توليد الفيديو | 31 يوليو 2026 | توليد فيديو بدقة 4K لمدة 30 ثانية في لقطة واحدة؛ يقبل ما يصل إلى 50 مرجعًا متعدد الوسائط؛ تحرير على مستوى الطابع الزمني |
| Seedream 5.0 Pro | توليد الصور | تم عرضه في 23 يونيو 2026؛ "قريبًا" | نموذج توليد صور من الجيل التالي |
| Seed Audio 1.0 | توليد الموسيقى/الصوت | 29 يونيو 2026 | نموذج تحويل النص إلى صوت لتوليد الموسيقى والمؤثرات الصوتية |
| SeedRealtime | LLM كامل الإرسال المزدوج للصوت والفيديو | 5 أغسطس 2026 | تفاعل كامل الإرسال المزدوج للصوت والفيديو بشكل أصلي |
تشكل هذه النماذج، جنبًا إلى جنب مع Seeduplex (9 أبريل 2026)، النظام البيئي الشامل للذكاء الاصطناعي لشركة بايت دانس والذي يغطي اللغة والصور والفيديو وتوليد الصوت والتفاعل متعدد الوسائط في الوقت الفعلي .