Luna TTS là dòng mô hình chuyển văn bản thành giọng nói đa ngôn ngữ do VUI Labs phát triển. Thay vì dự đoán từng token âm thanh theo tuần tự, Luna TTS sử dụng mô hình khuếch tán có mặt nạ dựa trên Qwen3 để đồng thời tinh chỉnh cả lưới token giọng nói.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS là dòng mô hình chuyển văn bản thành giọng nói (text-to-speech, hay TTS) đa ngôn ngữ do startup trí tuệ nhân tạo VUI Labs phát triển. Dòng sản phẩm gồm phiên bản tiêu chuẩn, ưu tiên chất lượng âm thanh, và Luna-TTS Realtime, được thiết kế cho các ứng dụng hội thoại cần phản hồi nhanh.
VUI Labs được thành lập vào đầu năm 2025. Các nguồn công khai cho biết công ty do giáo sư Tiền Ngạn Mân (Qian Yanmin) thuộc Đại học Giao thông Thượng Hải và doanh nhân khởi nghiệp liên tiếp Mai Kiệt (Mei Jie) đồng sáng lập.
Điểm khiến Luna-TTS được chú ý không chỉ nằm ở một thứ hạng trên bảng đánh giá. Công ty đang theo đuổi một hướng khác với TTS tự hồi quy truyền thống: thay vì tạo từng token âm thanh theo thứ tự, mô hình nén giọng nói thành các token rời rạc rồi dùng cơ chế khuếch tán có mặt nạ để tạo và sửa nhiều token cùng lúc. Mục tiêu là cân bằng tốt hơn giữa độ tự nhiên, khả năng biểu đạt và độ trễ khi tương tác.1
3
Câu trả lời phụ thuộc vào bảng xếp hạng và thời điểm kiểm tra. Vì vậy, gọi Luna-TTS là “mô hình TTS số một thế giới” một cách tuyệt đối sẽ dễ gây hiểu nhầm.
Những kết quả này không nhất thiết mâu thuẫn với nhau. Các bảng đánh giá kiểu “nghe mù” có thể thay đổi theo phiên bản mô hình, ngôn ngữ thử nghiệm, giọng đọc, câu lệnh, số lượng mẫu và thời điểm bình chọn.
Kết luận thận trọng hơn là Luna-TTS đã lọt vào nhóm dẫn đầu của các bảng xếp hạng TTS lớn, từng đạt vị trí số một hoặc số ba trong những khoảng thời gian nhất định. Tuy nhiên, dữ liệu hiện có chưa chứng minh mô hình liên tục vượt qua Cartesia, ElevenLabs, Qwen và mọi đối thủ khác.
Các nguồn được cung cấp cũng chưa đủ dữ liệu đồng nhất để xác định chính xác Luna-TTS đứng trên hay dưới ByteDance Seed và Zhipu. Do đó, không nên biến mối quan hệ giữa các mô hình này thành một kết luận thắng-thua toàn diện.
Luna-TTS được phát triển từ mô hình ngôn ngữ Qwen3-0.6B đã được tiền huấn luyện, sau đó tiếp tục huấn luyện để xử lý các token giọng nói theo cơ chế mô hình ngôn ngữ khuếch tán.2
Với TTS tự hồi quy thông thường, mô hình lần lượt dự đoán token codec tiếp theo dựa trên phần đã tạo trước đó. Luna-TTS thay đổi quy trình này bằng cách áp dụng mặt nạ ngẫu nhiên lên toàn bộ lưới token được lượng tử hóa theo vector dư (RVQ), rồi thực hiện nhiều vòng sửa song song.1
4
Nói đơn giản, mô hình không nhất thiết phải “đi từng bước một” từ đầu đến cuối câu. Trong cùng một vòng xử lý, nó có thể làm việc trên nhiều vị trí trong chuỗi âm thanh. Cách tiếp cận này giúp giảm sự phụ thuộc tuần tự vốn khiến các chuỗi âm thanh dài tạo chậm, đồng thời hạn chế nguy cơ lỗi ở đầu chuỗi kéo theo những lỗi tiếp theo.1
3
Luna-TTS sử dụng Luna-Codec do VUI Labs tự phát triển để biến âm thanh thành biểu diễn giọng nói rời rạc. Tài liệu công khai mô tả codec này có tần số lấy mẫu 24 kHz, tốc độ 25 khung hình mỗi giây và 8 codebook.8
9
Codec không chỉ là một bộ phận nén âm thanh. Nó quyết định mô hình phải dự đoán bao nhiêu thông tin, mỗi giây cần xử lý bao nhiêu khung và việc tạo song song có thể giữ được chất lượng đến đâu. Vì vậy, hướng đi của Luna-TTS thực chất là sự kết hợp giữa mô hình ngôn ngữ, codec rời rạc và cơ chế lấy mẫu khuếch tán.
Phiên bản tiêu chuẩn có thể tạo toàn bộ một câu nói theo cách phi tự hồi quy. Nhưng trong hội thoại trực tiếp, hệ thống cần bắt đầu phát âm thanh trước khi người dùng nói xong cả câu. Luna-TTS Realtime vì thế dùng một giải pháp trung gian: các khối được tạo tuần tự, nhưng token bên trong mỗi khối được khử nhiễu song song.1
4
Mỗi khối gồm 32 khung codec, tương đương 1,28 giây âm thanh. Phiên bản Realtime sử dụng KV Cache để lưu ngữ cảnh, sau đó tiếp tục phát các khối tiếp theo khi khối đầu tiên đã được tạo xong.1
Do đó, nói Luna-TTS Realtime “hoàn toàn phi tự hồi quy” là chưa chính xác. Mô tả đúng hơn là mô hình có phụ thuộc tự hồi quy giữa các khối, nhưng thực hiện tạo khuếch tán song song bên trong từng khối.
Báo cáo kỹ thuật cũng mô tả một giai đoạn hậu huấn luyện tăng cường sử dụng GRPO, được điều chỉnh cho quy trình khuếch tán rời rạc có mặt nạ. Hệ thống đồng thời hỗ trợ điều khiển cảm xúc và các âm thanh phi ngôn ngữ như tiếng cười, tiếng thở hoặc những biểu hiện giọng nói không phải từ ngữ.1
5
Mục tiêu của giai đoạn này không chỉ là giúp người nghe hiểu nội dung, mà còn cải thiện độ tự nhiên, khả năng biểu đạt và mức độ phù hợp với sở thích của người dùng.
Tài liệu cũng cho biết việc chỉnh sửa giọng nói và nhân bản giọng nói zero-shot có thể được xem như những bài toán điền hoặc viết lại lưới token âm thanh.1
4 Tuy vậy, chất lượng nhân bản thực tế, thời lượng âm thanh tham chiếu cần thiết và độ ổn định giữa các ngôn ngữ vẫn phải được kiểm chứng qua sản phẩm, thay vì suy ra chỉ từ kiến trúc mô hình.
Báo cáo kỹ thuật của Luna-TTS Realtime đưa ra hai chỉ số được trích dẫn rộng rãi: hệ số thời gian thực (RTF) đầu-cuối là 0,024 và khối âm thanh đầu tiên dài 1,28 giây được gửi đi sau 41,6 mili giây trong điều kiện phục vụ nội bộ đã làm nóng.1
5
Một số bài viết cũng cho biết phiên bản Realtime thường sử dụng 8–16 bước khử nhiễu và được thử nghiệm trên hai GPU H20.7 Nếu chỉ xét ranh giới suy luận của mô hình, các số liệu này cho thấy tốc độ tạo âm thanh rất cao.
Nhưng 41,6 mili giây không đồng nghĩa mọi người dùng đều có trải nghiệm API đám mây với độ trễ tương tự. Phép đo sử dụng phần cứng, cấu hình song song, máy chủ đã làm nóng và giao thức triển khai cụ thể. Độ trễ mạng, thời gian xếp hàng, tiền xử lý văn bản, giải mã âm thanh và tải hệ thống trong môi trường thật đều có thể làm tăng thời gian chờ.
Vì vậy, 41,6 mili giây nên được hiểu là thời gian gửi khối âm thanh đầu tiên trong điều kiện thử nghiệm có kiểm soát, không phải cam kết phổ quát về độ trễ đầu-cuối của mọi API.
Nhóm tác giả cho biết Luna-TTS được tiền huấn luyện trên khoảng 1 triệu giờ dữ liệu giọng nói bằng tiếng Trung, tiếng Anh, tiếng Nhật và tiếng Hàn.1
2
Kho dữ liệu đa ngôn ngữ như vậy có thể giúp mô hình mở rộng độ phủ về phát âm, ngữ điệu và khả năng mô hình hóa giọng nói xuyên ngôn ngữ. Tuy nhiên, phần tóm tắt công khai chưa cung cấp đủ thông tin để đánh giá độc lập nguồn dữ liệu, tiêu chuẩn làm sạch, tỷ lệ dữ liệu của từng ngôn ngữ hoặc vấn đề bản quyền.
Do đó, “1 triệu giờ dữ liệu” là mô tả về quy mô huấn luyện có thể trích dẫn, nhưng không nên suy ra rằng Luna-TTS chắc chắn dẫn đầu ở mọi ngôn ngữ, giọng vùng miền hay tình huống sử dụng.
Các thông tin công khai cho thấy VUI Labs không chỉ định vị Luna-TTS như một mô hình tổng hợp giọng nói độc lập. Công ty còn phát triển năng lực mô hình và API, công cụ giọng nói cho nhà sáng tạo, cùng các ứng dụng tác nhân giọng nói (voice agent).
Điều này cho thấy chất lượng mô hình chỉ là một phần của bài toán thương mại. Giá trị sản phẩm còn phụ thuộc vào nhân bản giọng nói, điều khiển cảm xúc, thiết kế hội thoại, độ trễ, chi phí suy luận và khả năng tích hợp vào từng ngành.
Một số bài viết trong ngành cho biết công nghệ của VUI Labs đã được triển khai trong điều phối logistics, bảo hiểm trực tuyến và phần mềm dịch vụ du lịch – khách sạn; tổng số hội thoại nghiệp vụ do nhiều khách hàng thực hiện đã vượt 1 triệu lần.6
Tuy nhiên, con số này là tuyên bố của công ty hoặc bên triển khai được truyền thông đưa tin, chưa phải chỉ số được kiểm toán độc lập. Các tài liệu công khai cũng chưa nêu đầy đủ danh sách khách hàng, định nghĩa một cuộc hội thoại, thời gian hoạt động hay tiêu chuẩn so sánh với nhà cung cấp khác.
Đội ngũ sáng lập thể hiện sự kết hợp giữa chuyên môn học thuật và năng lực sản phẩm – thương mại hóa: ông Tiền Ngạn Mân phụ trách hướng nghiên cứu giọng nói và AI, còn ông Mai Kiệt được giới thiệu là một doanh nhân khởi nghiệp liên tiếp. Mô hình tổ chức này có thể giúp rút ngắn khoảng cách từ nghiên cứu đến API, giải pháp doanh nghiệp và sản phẩm voice agent. Dù vậy, năng lực cạnh tranh dài hạn vẫn phụ thuộc vào vòng lặp dữ liệu, khả năng giữ chân khách hàng, chi phí suy luận trên mỗi lượt dùng và năng lực triển khai quốc tế.
Tổng hợp giữa báo cáo kỹ thuật và dữ liệu bảng xếp hạng, những ưu thế có cơ sở nhất của Luna-TTS gồm:
Những thiết kế này giải thích vì sao Luna-TTS có thể nhanh chóng đạt thứ hạng cao trong một số bảng nghe mù. Nhưng chúng chưa tự động chứng minh mô hình tốt hơn đối thủ ở mọi tiêu chí như giá thành, độ ổn định với văn bản dài, tính nhất quán của giọng, an toàn bản quyền, độ sẵn sàng của API hoặc chất lượng trên mọi ngôn ngữ.
Câu chuyện cốt lõi của Luna-TTS có nền tảng kỹ thuật đáng chú ý: VUI Labs kết hợp mô hình ngôn ngữ phát triển từ Qwen3, codec giọng nói rời rạc, cơ chế khuếch tán có mặt nạ, hậu huấn luyện tăng cường và suy luận theo khối cho streaming thành một hệ thống TTS hoàn chỉnh.1
Luna-TTS từng đứng đầu bảng Hugging Face TTS Arena trong các báo cáo tháng 8/2026 và đứng thứ ba trong báo cáo cùng thời điểm của Artificial Analysis. Nhưng ảnh chụp bảng xếp hạng ngày 1/9/2026 của Artificial Analysis đã đưa Luna TTS xuống vị trí thứ 5.8
Vì vậy, cách đánh giá hợp lý nhất không phải là “Luna-TTS đã đánh bại vĩnh viễn mọi đối thủ”, mà là: đây đã là một mô hình thuộc nhóm dẫn đầu trong cuộc đua TTS toàn cầu, với hướng tạo âm thanh bằng khuếch tán song song và tạo streaming theo khối rất đáng theo dõi.
Với các nhà phát triển đang chọn nền tảng, thứ đáng kiểm tra không chỉ là một con số tổng hạng. Hãy thử trực tiếp trên ngôn ngữ mục tiêu, khả năng nhân bản giọng, điều khiển cảm xúc, độ trễ khối đầu tiên, tính nhất quán của văn bản dài và chi phí API thực tế.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Luna TTS là dòng mô hình chuyển văn bản thành giọng nói đa ngôn ngữ do VUI Labs phát triển.
Luna TTS là dòng mô hình chuyển văn bản thành giọng nói đa ngôn ngữ do VUI Labs phát triển. Thay vì dự đoán từng token âm thanh theo tuần tự, Luna TTS sử dụng mô hình khuếch tán có mặt nạ dựa trên Qwen3 để đồng thời tinh chỉnh cả lưới token giọng nói.
VUI Labs được thành lập bởi giáo sư Tiền Ngạn Mân của Đại học Giao thông Thượng Hải và doanh nhân khởi nghiệp liên tiếp Mai Kiệt.