ผู้ช่วยเสียงแบบดั้งเดิมทำงานเป็น ระบบทอดต่อ (cascaded pipeline) เสียงเข้า → ผ่าน ASR แปลงเป็นข้อความ → ข้อความเข้า Vision Model (ถ้าต้องการภาพ) → ผ่าน LLM → ข้อความออก → TTS แปลงเป็นเสียง การส่งต่อแต่ละขั้นตอนทำให้เกิดความหน่วง และบริบทก็หายไปตามรอยต่อ
SeedRealtime เข้ามาเปลี่ยนระบบนี้ด้วยข้อได้เปรียบสำคัญสี่ประการ:
ปัญหาที่ยากที่สุดที่ SeedRealtime แก้ได้คือ "เมื่อไหร่ควรพูด เมื่อไหร่ควรฟัง" ในสตรีมข้อมูลต่อเนื่องแบบมัลติโมดัล ผู้ช่วยแบบ half-duplex (ผลัดกันพูด) แบบเดิมจะรอให้เงียบก่อนถึงตอบ ซึ่งทำให้มันอาจจะแทรกขณะที่ผู้ใช้ยังพูด หรือไม่ก็เงียบเกินไป
สถาปัตยกรรมแบบ full-duplex ของ SeedRealtime ช่วยให้มันสามารถ:
ผลการประเมินด้วยมนุษย์แบบ end-to-end ชี้ว่า เมื่อเทียบกับระบบ cascaded ปัญหาจังหวะการสนทนาแบบภาพและเสียงของ SeedRealtime ลดลงครึ่งหนึ่ง ปัญหาอย่าง "พูดยังไม่ทันจบก็ถูกขัด" "พูดจบแล้วก็ยังเงียบ" หรือ "ถูกเสียงรบกวนข้างๆ ทำให้ตอบผิดจังหวะ" ลดลงอย่างมาก ในขณะที่โอกาสที่การสนทนาครั้งเดียวจะราบรื่นและสมบูรณ์เพิ่มขึ้นอย่างเห็นได้ชัด
SeedRealtime คือ วิวัฒนาการด้านมัลติโมดัล ของผลงาน full-duplex ก่อนหน้าของ ByteDance โดย Seeduplex เปิดตัวเมื่อ วันที่ 9 เมษายน 2026 ซึ่งเป็น LLM แบบ full-duplex เน้นเสียงล้วน ตัวแรกของ ByteDance — มันสามารถฟังและพูดไปพร้อมกัน ก้าวข้ามกระบวนทัศน์แบบ half-duplex เก่า
| Seeduplex (9 เม.ย. 2026) | SeedRealtime (5 ส.ค. 2026) |
|---|---|
| Full-duplex แบบเสียงเท่านั้น | Full-duplex แบบเสียง + วิดีโอ + ข้อความ |
| "ฟังไปพร้อมพูด" สำหรับเสียงพูด | "ดู ฟัง และพูด" พร้อมกัน |
| ใช้โมดอลเดียว (เสียงพูด) | สถาปัตยกรรมมัลติโมดัลรวมศูนย์ |
SeedRealtime นำนวัตกรรมหลักของ Seeduplex — การประมวลผลแบบ full-duplex end-to-end — มาต่อยอดโดยเพิ่ม ความเข้าใจภาพแบบเรียลไทม์ ทำให้โมเดลสามารถตอบสนองต่อสิ่งที่มัน เห็น นอกเหนือจากที่มัน ได้ยิน
SeedRealtime ขึ้นเต็มรูปแบบในแอป Doubao (豆包) ซึ่งเป็น AI ผู้ช่วยของ ByteDance และเปิดให้ผู้ใช้ทุกคนใช้งานได้ทันที ผู้ใช้เพียงอัปเดต Doubao เป็นเวอร์ชันล่าสุด และเข้าไปที่ฟีเจอร์วิดีโอคอลผ่านปุ่ม "โทรศัพท์" เพื่อสัมผัสประสบการณ์ AI แบบโต้ตอบภาพและเสียงแบบเรียลไทม์
ByteDance สาธิตการใช้งานหลากหลาย เช่น :
SeedRealtime เป็นเพียงส่วนหนึ่งของจังหวะการปล่อยโมเดล AI ที่เร่งขึ้นของ ByteDance โดยทีม Seed ได้ส่งโมเดลหลายตัวออกมาตั้งแต่กลางปี 2025 จนถึงกลางปี 2026:
| โมเดล | หมวดหมู่ | วันที่เปิดตัว | ความสามารถหลัก |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Large language model | 23 มิ.ย. 2026 (Volcano Engine FORCE); ให้บริการผ่าน API | LLM ทั่วไป; ราคาประมาณ $0.88/ล้าน input tokens, $4.42/ล้าน output tokens |
| Seedance 2.5 | Video generation | 31 ก.ค. 2026 | สร้างวิดีโอ 30 วินาที 4K แบบ shot เดียว; รองรับการอ้างอิงมัลติโมดัลสูงสุด 50 รายการ; แก้ไขในระดับ timestamp |
| Seedream 5.0 Pro | Image generation | เปิดตัวตัวอย่าง 23 มิ.ย. 2026; "เร็วๆ นี้" | โมเดลสร้างภาพเจเนอเรชันถัดไป |
| Seed Audio 1.0 | Music/sound generation | 29 มิ.ย. 2026 | โมเดลข้อความเป็นเสียงสำหรับสร้างเพลงและเอฟเฟกต์เสียง |
| SeedRealtime | Full-duplex audio-visual LLM | 5 ส.ค. 2026 | การโต้ตอบแบบภาพและเสียง full-duplex แบบเนทีฟ |
โมเดลเหล่านี้ร่วมกับ Seeduplex (9 เม.ย. 2026) รวมกันเป็น ระบบนิเวศ AI แบบ full-stack ของ ByteDance ที่ครอบคลุมทั้งภาษา ภาพ วิดีโอ เสียง และการโต้ตอบมัลติโมดัลแบบเรียลไทม์