Trợ lý giọng nói truyền thống hoạt động như một đường ống ghép nối tầng: âm thanh đi qua ASR (chuyển giọng nói thành văn bản), văn bản đi qua mô hình thị giác (nếu cần), rồi qua LLM, và cuối cùng qua TTS (chuyển văn bản thành giọng nói). Mỗi lần chuyển tiếp đều tạo thêm độ trễ, và ngữ cảnh bị mất ở mọi ranh giới .
SeedRealtime thay thế đường ống này bằng bốn ưu điểm chính:
Vấn đề khó nhất mà SeedRealtime giải quyết là "khi nào nên nói, khi nào nên nghe" trong một luồng đa phương thức liên tục. Các trợ lý theo lượt (half-duplex) truyền thống chờ một khoảng im lặng trước khi phản hồi — nghĩa là chúng hoặc ngắt lời, hoặc ngồi im .
Kiến trúc full-duplex của SeedRealtime cho phép nó:
Kết quả đánh giá end-to-end của con người cho thấy, so với các mô hình ghép nối, các vấn đề về nhịp điệu hội thoại âm thanh-hình ảnh của SeedRealtime đã giảm một nửa. Các hiện tượng như "bị ngắt lời trước khi nói xong, phản hồi chậm sau khi nói, hoặc bị kích hoạt sai bởi tiếng ồn nền" đã giảm đáng kể, trong khi xác suất có một cuộc đối thoại hoàn chỉnh, trôi chảy tăng lên rõ rệt .
SeedRealtime là sự tiến hóa đa phương thức của công trình full-duplex trước đó của ByteDance. Seeduplex được ra mắt vào ngày 9/4/2026 , là mô hình LLM song công toàn phần thuần bản địa chỉ dành cho giọng nói đầu tiên của ByteDance — nó có thể vừa nghe vừa nói cùng lúc, vượt ra khỏi mô hình bán song công (half-duplex) trước đây .
| Seeduplex (9/4/2026) | SeedRealtime (5/8/2026) |
|---|---|
| Full-duplex chỉ âm thanh | Full-duplex âm thanh + video + văn bản |
| "Nghe trong khi nói" cho giọng nói | "Nhìn, nghe và nói" đồng thời |
| Đơn phương thức (giọng nói) | Kiến trúc đa phương thức thống nhất |
SeedRealtime tiếp nhận đột phá cốt lõi của Seeduplex — xử lý full-duplex end-to-end thuần bản địa — và mở rộng nó để kết hợp khả năng hiểu thị giác thời gian thực, cho phép mô hình phản ứng với những gì nó nhìn thấy bên cạnh những gì nó nghe thấy .
SeedRealtime đã được triển khai đầy đủ trong ứng dụng Doubao (豆包) — trợ lý AI của ByteDance — và có sẵn cho tất cả người dùng. Người dùng cập nhật Doubao lên phiên bản mới nhất và vào giao diện cuộc gọi video thông qua tính năng "gọi điện" để trải nghiệm tương tác AI âm thanh-hình ảnh thời gian thực .
ByteDance đã trình diễn nhiều trường hợp sử dụng: xác định những người khác nhau trong một cuộc trò chuyện nhóm và theo dõi ai đang nói; giúp một khách du lịch nước ngoài hiểu thực đơn tiếng Trung và lời giải thích của người phục vụ trong thời gian thực; liên tục quan sát một triển lãm bảo tàng và chủ động cảnh báo khi một hiện vật cụ thể xuất hiện; hướng dẫn người dùng vận hành máy pha cà phê và sửa lỗi dựa trên những thay đổi về hình ảnh; theo dõi việc lật trang khi đọc một bài báo và tự động nhắc nhở khi một chương mục tiêu xuất hiện .
SeedRealtime là một phần trong nhịp độ ra mắt AI ngày càng tăng tốc của ByteDance. Đội ngũ Seed đã tung ra nhiều mô hình từ giữa năm 2025 đến giữa năm 2026:
| Mô hình | Danh mục | Ngày ra mắt | Năng lực chính |
|---|---|---|---|
| Seed 2.1 (Doubao 2.1 Pro) | Mô hình ngôn ngữ lớn | 23/6/2026 (Volcano Engine FORCE); khả dụng qua API | LLM đa năng; giá ~$0.88/M token đầu vào, ~$4.42/M token đầu ra |
| Seedance 2.5 | Tạo video | 31/7/2026 | Tạo video 4K 30 giây một lần; chấp nhận tới 50 tham chiếu đa phương thức; chỉnh sửa theo mốc thời gian |
| Seedream 5.0 Pro | Tạo hình ảnh | Xem trước ngày 23/6/2026; "sắp ra mắt" | Mô hình tạo hình ảnh thế hệ tiếp theo |
| Seed Audio 1.0 | Tạo nhạc/âm thanh | 29/6/2026 | Mô hình chuyển văn bản thành âm thanh để tạo nhạc và hiệu ứng âm thanh |
| SeedRealtime | LLM full-duplex âm thanh-hình ảnh | 5/8/2026 | Tương tác full-duplex âm thanh-hình ảnh thuần bản địa |
Các mô hình này, cùng với Seeduplex (9/4/2026), tạo thành hệ sinh thái AI toàn diện của ByteDance, bao gồm ngôn ngữ, hình ảnh, video, tạo âm thanh và tương tác đa phương thức thời gian thực .