Luna TTS — сімейство багатомовних моделей синтезу мовлення від VUI Labs. У серпні 2026 року модель ненадовго очолила згадуваний рейтинг Hugging Face TTS Arena, однак у знімку таблиці Artificial Analysis від 1 вересня...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS — сімейство багатомовних моделей text-to-speech (TTS), тобто систем, які перетворюють текст на природне мовлення. Його розробляє китайський стартап VUI Labs, заснований на початку 2025 року професором Шанхайського交通大学 Цянь Яньмінем і серійним підприємцем Мей Цзе.
У центрі уваги опинився не лише черговий результат у таблиці лідерів. Luna-TTS пропонує інший підхід до генерації голосу: замість послідовного прогнозування кожного аудіотокена модель стискає мовлення в дискретне представлення, а потім за кілька ітерацій паралельно відновлює великі його фрагменти.1
3
Говорити про Luna-TTS як про «беззаперечного світового лідера» некоректно: результати залежать від конкретної таблиці, версії моделі, набору мов, голосів, підказок і часу підрахунку голосів.
Отже, найобережніший висновок такий: Luna-TTS увійшла до верхньої частини основних TTS-рейтингів і в окремі періоди займала перше або третє місце. Водночас наявні дані не підтверджують постійної переваги над Cartesia, ElevenLabs, Qwen та всіма іншими конкурентами. Надійного зіставлення з ByteDance Seed або моделями Zhipu в наведених джерелах також немає.
В основі Luna-TTS лежить попередньо навчена мовна модель Qwen3-0.6B, яку додатково адаптували для роботи з голосовими токенами.2 У традиційних авторегресійних TTS-системах модель зазвичай крок за кроком прогнозує наступний codec-токен. Luna-TTS натомість працює з усією сіткою RVQ-токенів: частина позицій маскується, а модель у кілька раундів паралельно відновлює їх.
1
4
Це змінює сам порядок генерації. Результат не так жорстко залежить від уже створеного початку послідовності, тому система може обробляти багато позицій одночасно. Теоретично це зменшує затримку на довгих фрагментах і послаблює накопичення помилок, характерне для послідовної генерації.1
3
Для перетворення аудіо на дискретне представлення система використовує власний Luna-Codec. У відкритих описах вказані частота дискретизації 24 кГц, частота кадрів 25 Гц і вісім кодових книг.8
9
Codec тут — не просто «архіватор» аудіо. Він визначає, скільки інформації про голос має передбачити модель, скільки кадрів припадає на секунду та наскільки ефективно можна поєднати якість із паралельною генерацією. Тому Luna-TTS слід розглядати як узгоджену систему, де мовна модель, аудіокодек і diffusion-семплінг спроєктовані разом.
Повна версія Luna-TTS може генерувати ціле висловлювання як одну глобальну сітку. Для діалогу цього недостатньо: голос потрібно почати відтворювати ще до завершення всієї репліки.
Тому Luna-TTS Realtime використовує компромісну схему. Між блоками генерація відбувається послідовно, але всередині кожного блока токени очищуються паралельно. Один блок містить 32 codec-кадри, або 1,28 секунди аудіо. Контекст зберігається через KV Cache, а після підтвердження першого блока система поступово передає наступні.1
4
Тож формулювання «Realtime повністю неавторегресійна» було б неточним. Коректніше сказати: модель має авторегресійні залежності на рівні блоків, але використовує паралельну diffusion-генерацію всередині кожного блока.
Технічний звіт описує додаткове навчання з підкріпленням на основі GRPO, адаптоване до дискретного masked-diffusion-процесу. Також заявлено контроль емоцій і невербальних вокалізацій — наприклад, особливостей подачі, які виходять за межі самого тексту.1
5
За задумом, це має покращувати не тільки розбірливість, а й природність, виразність та відповідність голосу уподобанням слухача. Редагування мовлення та zero-shot-клонування голосу в такій архітектурі можна трактувати як заповнення або переписування частини сітки голосових токенів.1
4 Однак фактичну якість клонування, стабільність різними мовами й вимоги до референсного аудіо потрібно перевіряти окремо.
У технічному звіті для Luna-TTS Realtime наведено два показники, які часто цитувалися в описах моделі: коефіцієнт реального часу (RTF) 0,024 і передача першого блока аудіо тривалістю 1,28 секунди за 41,6 мс.1
5
У супровідних матеріалах зазначено, що для генерації зазвичай використовували 8–16 кроків денойзингу, а тестування проводили на двох GPU H20.7 У межах виміряного рушія це свідчить про високу пропускну здатність: RTF 0,024 означає, що одна секунда мовлення генерується приблизно за 24 мс у відповідних умовах.
Але це не те саме, що гарантована затримка для кожного користувача хмарного API. Тест був локальним і проводився на прогрітому сервісі з конкретною апаратною конфігурацією. Мережа, черга запитів, обробка тексту, декодування аудіо та навантаження в продакшені можуть збільшити час очікування. Тому 41,6 мс варто сприймати як результат контрольованого тесту на межі роботи рушія, а не як універсальну обіцянку наскрізної затримки.
Автори повідомляють, що для попереднього навчання використали близько мільйона годин мовлення китайською, англійською, японською та корейською мовами.1
2 Такий корпус може дати моделі ширше покриття вимови, просодії та міжмовних особливостей.
Водночас відкритий опис не містить достатньо деталей, щоб незалежно оцінити походження даних, процедури очищення, частку кожної мови або питання ліцензування. Тому цифра «мільйон годин» підтверджує заявлений масштаб навчання, але не доводить однаково сильні результати для кожної мови, акценту чи практичного сценарію.
Схоже, VUI Labs розглядає Luna-TTS не як окремий генератор голосу, а як частину ширшої екосистеми. Йдеться про модель та API, інструменти для авторів і застосунки на базі голосових агентів.
У такій моделі бізнесу якість синтезу — лише один елемент. Не менш важливими стають клонування голосу, емоційний контроль, побудова діалогів, затримка, вартість інференсу, стабільність API та інтеграція з галузевими системами.
Галузеві публікації стверджують, що VUI Labs уже працює у сфері логістичної диспетчеризації, онлайн-страхування та програмних продуктів для подорожей і готельного бізнесу, а сукупна кількість ділових діалогів у клієнтів перевищила мільйон.6 Водночас це медійно наведена заява компанії або учасників впроваджень, а не незалежно перевірений показник. У відкритих матеріалах немає повного списку клієнтів, єдиного визначення «діалогу», періоду підрахунку чи порівняння з іншими постачальниками.
Організаційно стартап поєднує академічного керівника технічного напряму та підприємця, відповідального за продукт і комерціалізацію. Цянь Яньмінь пов’язаний із дослідженнями мовлення та штучного інтелекту, а Мей Цзе описується як серійний підприємець. Така комбінація може пришвидшити перетворення дослідницької моделі на API, галузеві рішення й голосових агентів. Довгострокова конкурентоспроможність, однак, залежатиме від якості даних, утримання клієнтів, собівартості інференсу та здатності постачати продукт на глобальні ринки.
Якщо відокремити підтверджені технічні характеристики від гучних маркетингових формулювань, найпереконливішими виглядають чотири елементи:
Ці рішення пояснюють, чому Luna-TTS змогла швидко піднятися у верхню частину окремих сліпих рейтингів. Але сама архітектура не доводить переваги за ціною, стабільністю довгих текстів, незмінністю тембру, безпекою авторських прав, доступністю API або якістю всіх мов.
Найбільш обґрунтована частина історії Luna-TTS має цілком конкретний технічний зміст: VUI Labs поєднала похідну від Qwen3 мовну модель, дискретний голосовий кодек, masked-diffusion-генерацію, додаткове навчання з підкріпленням і потокове виведення блоками.1
У серпні 2026 року модель, за повідомленнями, очолювала Hugging Face TTS Arena і посідала третє місце в паралельному рейтингу Artificial Analysis.8 Однак у знімку Artificial Analysis від 1 вересня вона вже була п’ятою. Це нагадує: рейтинги синтезу мовлення швидко змінюються й залежать від конкретної методики.
Тож Luna-TTS доречніше називати важливим претендентом у глобальній конкуренції TTS, а не моделлю, яка назавжди випередила всіх. Розробникам, що обирають платформу, варто тестувати не лише загальний бал, а й потрібні мови, клонування голосу, емоційний контроль, затримку першого аудіопакета, стабільність довгих текстів і фактичну ціну API.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Luna TTS — сімейство багатомовних моделей синтезу мовлення від VUI Labs. У серпні 2026 року модель ненадовго очолила згадуваний рейтинг Hugging Face TTS Arena, однак у знімку таблиці Artificial Analysis від 1 вересня...
Luna TTS — сімейство багатомовних моделей синтезу мовлення від VUI Labs. У серпні 2026 року модель ненадовго очолила згадуваний рейтинг Hugging Face TTS Arena, однак у знімку таблиці Artificial Analysis від 1 вересня... Ключова ідея моделі — не генерувати аудіотокени по одному, а паралельно відновлювати замасковану сітку токенів за допомогою дискретної masked diffusion архітектури на базі Qwen3.
VUI Labs заснували професор Шанхайського交通大学 Цянь Яньмінь і серійний підприємець Мей Цзе.