Luna TTS הוא משפחת מודלים רב לשונית להמרת טקסט לדיבור מבית VUI Labs. באוגוסט 2026 הוא דורג במקום הראשון בדיווחים על Hugging Face TTS Arena, אך ב 1 בספטמבר 2026 הופיע במקום החמישי בדירוג של Artificial Analysis — תזכורת...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS הוא מערך מודלים רב-לשוני להמרת טקסט לדיבור (TTS), שפותח על ידי חברת הבינה המלאכותית הסינית VUI Labs. המערך כולל גרסה שמכוונת לאיכות קולית גבוהה וגרסת Realtime שמיועדת לשיחות ולתגובות קוליות בהשהיה נמוכה.
VUI Labs הוקמה בתחילת 2025. לפי הדיווחים הפומביים, החברה הוקמה בידי פרופסור צ'יין יאנמין (Qian Yanmin) מאוניברסיטת ג'יאו טונג בשנגחאי והיזם הסדרתי מיי ג'ייה (Mei Jie).
הסיבה להתעניינות ב-Luna-TTS אינה רק הופעה מרשימה בטבלת דירוג אחת. החידוש המרכזי הוא ניסיון לשנות את אופן יצירת הדיבור: במקום לחזות טוקנים קוליים בזה אחר זה, המודל מייצר ומתקן קבוצות גדולות של טוקנים במקביל — גישה שקרובה יותר למודלי Diffusion מאשר למודלי TTS אוטורגרסיביים מסורתיים.1
3
התשובה תלויה בטבלה ובמועד הבדיקה. לכן לא נכון לתאר את Luna-TTS כ"מקום ראשון בעולם" באופן קבוע.
הפערים אינם בהכרח סתירה. טבלאות האזנה עיוורת מושפעות מגרסת המודל, מהשפות שנבדקות, מהקולות, מההנחיות שניתנות למערכת, ממספר הדגימות וממועד ההצבעה.
המסקנה הזהירה יותר היא ש-Luna-TTS כבר נכנס לצמרת של טבלאות TTS מרכזיות, ובחלונות זמן מסוימים הגיע למקום הראשון או השלישי. עם זאת, אין במידע הקיים הוכחה לכך שהוא מנצח באופן עקבי את Cartesia, ElevenLabs, Qwen או את כל המתחרים האחרים.
גם אין די נתונים ברי-השוואה מאותה טבלה ובאותו מועד כדי לקבוע את מיקומו המדויק מול מודלי ByteDance Seed או Zhipu. לכן אין בסיס לנסח את התחרות ביניהם כניצחון כולל וחד-משמעי.
Luna-TTS נבנה באמצעות התאמה ואימון נוסף של מודל השפה Qwen3-0.6B, שהוסב למודל שמייצר טוקנים קוליים באמצעות תהליך Diffusion.2
במערכות TTS אוטורגרסיביות רגילות, המודל חוזה בכל שלב את הטוקן הבא של ה-Codec. כך נוצרת תלות סדרתית: כל שלב חייב להמתין לתוצאה של השלב הקודם. Luna-TTS נוקט גישה אחרת. הוא מפעיל מיסוך אקראי על רשת הטוקנים הקוליים של כל קטע הדיבור, ולאחר מכן ממלא ומעדכן את המקומות החסרים בכמה סבבים מקביליים.1
4
היתרון התיאורטי הוא שהמודל אינו חייב להסתמך לחלוטין על תחילתו של רצף הדיבור. הוא יכול לטפל במספר רב של מיקומים באותו סבב, לצמצם את התלות הסדרתית ובכך להפחית את זמן היצירה. הגישה גם עשויה לצמצם הצטברות של טעויות לאורך רצף ארוך.1
3
Luna-TTS משתמש ב-Luna-Codec, Codec קולי שפותח על ידי החברה וממיר את האודיו לייצוגים קוליים בדידים. לפי המידע הפומבי, התכנון כולל קצב דגימה של 24 קילוהרץ, קצב של 25 פריימים בשנייה ושמונה Codebooks.8
9
המשמעות היא שהדיבור מיוצג כרשת של טוקנים שנוחה יותר לעיבוד על ידי מודל שפה, תוך שמירה על פרטים אקוסטיים הדרושים לשחזור קול טבעי.
ה-Codec אינו רק שלב דחיסה טכני. הוא קובע כמה מידע קולי צריך המודל לחזות, כמה פריימים נוצרים בכל שנייה ועד כמה אפשר לאזן בין איכות, מהירות ויכולת יצירה במקביל. במקרה של Luna-TTS, מודל השפה, ה-Codec ותהליך ה-Diffusion תוכננו כחלק ממערכת אחת.
הגרסה הרגילה יכולה לייצר את רשת הטוקנים של קטע דיבור שלם באופן לא-אוטורגרסיבי. אבל בשיחה בזמן אמת אי אפשר להמתין עד שהמשתמש יסיים משפט שלם לפני שמתחילים להשמיע את התשובה.
לכן Luna-TTS Realtime משתמשת בפשרה הנדסית: הבלוקים נוצרים בזה אחר זה, אך בתוך כל בלוק הטוקנים עוברים תהליך Denoising במקביל.1
4
כל בלוק כולל 32 פריימים של Codec, שהם 1.28 שניות של אודיו. גרסת Realtime משתמשת ב-KV Cache לשמירת ההקשר, ולאחר שהבלוק הראשון מוכן היא ממשיכה להזרים את הבלוקים הבאים.1
לכן לא מדויק לומר שגרסת Realtime היא "לא-אוטורגרסיבית לחלוטין". הניסוח המדויק יותר הוא שהיא אוטורגרסיבית ברמת הבלוקים, אך מבצעת יצירה מקבילית בתוך כל בלוק.
הדוח הטכני מתאר גם שלב אימון-אחרי המבוסס על GRPO, שהותאם לתהליך ה-Masked Diffusion הבדיד, וכן יכולות לשליטה ברגש ובקולות לא-מילוליים — למשל צחוק, אנחות או מאפיינים קוליים שאינם מילים.1
5
המטרה אינה רק להפיק דיבור מובן, אלא לשפר את הטבעיות, את יכולת ההבעה ואת ההתאמה להעדפות המשתמש.
המקורות מתארים גם שכפול קול ללא דוגמאות קודמות ועריכת דיבור כתהליכי השלמה או כתיבה מחדש של רשת טוקנים קוליים.1
4 עם זאת, איכות השכפול בפועל, אורך קטע הייחוס הדרוש והיציבות בין שפות שונות עדיין דורשים בדיקה במוצר עצמו. אי אפשר להסיק אותם רק מהארכיטקטורה.
בדוח הטכני של Luna-TTS Realtime מופיעים שני מספרים שזכו לתשומת לב רבה: מקדם זמן אמת (RTF) של 0.024 והתחייבות לבלוק האודיו הראשון — באורך 1.28 שניות — בתוך 41.6 אלפיות השנייה.1
5
דיווחים נוספים ציינו כי גרסת Realtime משתמשת בדרך כלל ב-8 עד 16 צעדי Denoising, ונבדקה על שני מעבדי GPU מסוג H20.7
אם מסתכלים רק על גבול המנוע, הנתונים מעידים על קצב יצירה גבוה מאוד. אבל הם אינם מבטיחים שכל משתמש יקבל השהיה של 41.6 אלפיות השנייה בשירות ענן.
הבדיקה בוצעה על חומרה מסוימת, בתצורה מקבילית, בשירות מקומי שעבר חימום ובפרוטוקול מדידה מוגדר. תקשורת רשת, תורים בשרת, עיבוד הטקסט, פענוח האודיו ועומס בסביבת ייצור יכולים להאריך את זמן ההמתנה בפועל. לכן נכון להבין את 41.6 האלפיות השנייה כזמן התחייבות של הבלוק הראשון בתנאי בדיקה מבוקרים — לא כהבטחה כללית לחוויית API מקצה לקצה.
מחברי המודל מדווחים כי Luna-TTS אומן על כמיליון שעות של דיבור בסינית, באנגלית, ביפנית ובקוריאנית.1
2
מאגר רב-לשוני בהיקף כזה עשוי לספק כיסוי רחב יותר להגייה, לאינטונציה ולמודלים של קול בין שפות. עם זאת, התקצירים הפומביים אינם מספקים די מידע כדי להעריך באופן בלתי תלוי את מקורות הנתונים, את תהליכי הניקוי, את חלוקת השעות בין השפות או את עמידת המאגר בדרישות זכויות היוצרים.
לכן אפשר לצטט את הנתון של כמיליון שעות כתיאור של היקף האימון המדווח, אך אין להסיק ממנו שהמודל מוביל באותה מידה בכל שפה, מבטא או תרחיש שימוש.
מהדיווחים הפומביים עולה ש-VUI Labs אינה מציגה את Luna-TTS כמודל סינתזת דיבור בודד בלבד. החברה פועלת במקביל בשלושה כיוונים כלליים: יכולות מודל ו-API, כלי קול ליוצרים ויישומים של סוכנים קוליים.
המשמעות היא שאיכות הקול היא רק חוליה אחת בשרשרת. הערך העסקי תלוי גם בשכפול קול, בשליטה רגשית, בניהול שיחה, בהשהיה, בעלות ההרצה ובקלות השילוב במערכות של ארגונים.
דיווחי תעשייה טוענים כי VUI Labs כבר יישמה את הטכנולוגיה בשילוח ולוגיסטיקה, בביטוח מקוון ובתוכנות לתחומי התיירות והאירוח, וכי כמה לקוחות השלימו יחד יותר ממיליון שיחות עסקיות.6
עם זאת, מדובר בטענה של החברה או של גורמי פריסה כפי שדווחה בתקשורת — לא במדד שעבר ביקורת עצמאית. המידע הפומבי אינו מפרט את רשימת הלקוחות, את ההגדרה המדויקת של "שיחה", את תקופת הפעילות או את שיטת ההשוואה לספקים אחרים.
צוות המייסדים משקף שילוב של מוביל מחקר אקדמי עם מנהל מוצר ומסחור: צ'יין יאנמין מוביל את כיוון המחקר בתחום הקול והבינה המלאכותית, ומיי ג'ייה מתואר כיזם סדרתי. מבנה כזה יכול לסייע בהפיכת מחקר למוצרי API, לפתרונות ארגוניים ולסוכנים קוליים. בטווח הארוך, היתרון של החברה ייקבע גם לפי איכות לולאת הנתונים, שימור לקוחות, עלות ההרצה ליחידת שימוש ויכולת אספקה גלובלית.
מהשילוב בין הדוח הטכני לבין נתוני הדירוג, אפשר לזהות ארבעה יתרונות מבוססים יחסית:
העקרונות האלה מסבירים מדוע Luna-TTS הצליח להגיע במהירות למקומות גבוהים בכמה טבלאות האזנה עיוורת. אבל הם אינם מוכיחים אוטומטית עליונות במחיר, ביציבות של טקסטים ארוכים, בעקביות של זהות הקול, בבטיחות זכויות יוצרים, בזמינות API או בביצועים בכל השפות.
הסיפור הטכנולוגי של Luna-TTS משמעותי: VUI Labs שילבה מודל שפה המבוסס על Qwen3, Codec קולי בדיד, יצירת Masked Diffusion, אימון-אחרי באמצעות חיזוק ויצירה בבלוקים עבור סטרימינג בזמן אמת — למערכת TTS אחת.1
המודל אכן דורג במקום הראשון בדיווחים מאוגוסט 2026 על Hugging Face TTS Arena, ובמקום השלישי בדיווחים המקבילים על Artificial Analysis. אך בצילום המצב של Artificial Analysis מ-1 בספטמבר 2026 הוא כבר הופיע במקום החמישי.8
לכן ההערכה הסבירה ביותר אינה ש-Luna-TTS "ניצח לצמיתות את כולם", אלא שהוא הפך למודל משמעותי בצמרת התחרות העולמית בתחום ה-TTS. מסלול היצירה המקבילית המבוסס על Diffusion, לצד ההזרמה בבלוקים, הוא כיוון שכדאי להמשיך לעקוב אחריו.
למפתחים שבוחנים מערכת לשימוש אמיתי, הצעד החשוב ביותר אינו להסתמך על דירוג יחיד. כדאי לבדוק בנפרד את השפות הרלוונטיות, שכפול הקול, השליטה הרגשית, זמן קבלת האודיו הראשון, עקביות בטקסטים ארוכים ואת העלות האמיתית של ה-API.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS הוא משפחת מודלים רב לשונית להמרת טקסט לדיבור מבית VUI Labs. באוגוסט 2026 הוא דורג במקום הראשון בדיווחים על Hugging Face TTS Arena, אך ב 1 בספטמבר 2026 הופיע במקום החמישי בדירוג של Artificial Analysis — תזכורת...
Luna TTS הוא משפחת מודלים רב לשונית להמרת טקסט לדיבור מבית VUI Labs. באוגוסט 2026 הוא דורג במקום הראשון בדיווחים על Hugging Face TTS Arena, אך ב 1 בספטמבר 2026 הופיע במקום החמישי בדירוג של Artificial Analysis — תזכורת... במקום לחזות טוקן קולי אחד בכל פעם, Luna TTS מבוסס על מודל Masked Diffusion שמתקן במקביל רשת של טוקנים קוליים.
VUI Labs נוסדה בתחילת 2025 בידי פרופסור צ'יין יאנמין מאוניברסיטת ג'יאו טונג בשנגחאי והיזם הסדרתי מיי ג'ייה.