Luna TTS — семейство многоязычных моделей преобразования текста в речь от VUI Labs. Главная техническая идея — не последовательная генерация аудиотокенов по одному, а многократное параллельное восстановление замаскированной сетки токенов на базе Qwen3.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS — семейство многоязычных моделей синтеза речи, разработанное китайским стартапом VUI Labs. В него входят стандартная версия, ориентированная на качество и выразительность, и Luna-TTS Realtime для потокового голосового взаимодействия. По открытым публикациям, VUI Labs была создана в начале 2025 года профессором Шанхайского университета Цзяотун Цянь Яньминем и серийным предпринимателем Мэй Цзе.
Интерес к проекту вызвала не только громкая позиция в рейтинге. Команда предложила изменить сам принцип генерации речи: вместо последовательного предсказания каждого следующего аудиотокена модель сначала сжимает звук в дискретное представление, а затем за несколько итераций параллельно восстанавливает множество замаскированных токенов. Такой подход призван одновременно улучшить естественность, выразительность и скорость отклика.1
3
Говорить о Luna-TTS как о «постоянно лучшей в мире» модели было бы некорректно. Результаты зависят от конкретной версии модели, набора голосов, языков, текстовых подсказок, количества сравнений и времени обновления таблицы.
Эти результаты не обязательно противоречат друг другу: рейтинги «слепого» прослушивания меняются по мере появления новых версий и накопления голосов. Наиболее аккуратный вывод таков: Luna-TTS вошла в число заметных мировых TTS-моделей и в отдельные периоды занимала первое или третье место, но доступные данные не подтверждают её устойчивое превосходство над Cartesia, ElevenLabs, Qwen и всеми остальными конкурентами.
Также нет надёжных сопоставимых данных из одного и того же рейтинга, которые позволяли бы назвать точное место Luna-TTS относительно ByteDance Seed или моделей Zhipu. Поэтому здесь нельзя делать вывод о безусловной победе одной системы над другой.
Luna-TTS создана на основе предварительно обученной языковой модели Qwen3-0.6B, которую продолжили обучать для работы с речевыми токенами.2 В традиционной авторегрессионной TTS-системе модель последовательно предсказывает следующий токен кодека. Luna-TTS вместо этого работает со всей сеткой токенов RVQ: случайно маскирует её элементы и за несколько итераций восстанавливает их параллельно.
1
4
Практический смысл этой перемены в том, что генерация меньше зависит от уже созданного префикса. На одной итерации можно обрабатывать множество позиций, сокращая задержку длинных последовательностей и уменьшая риск того, что ошибка будет последовательно распространяться по всей фразе.1
3
Для представления аудио используется собственный кодек Luna-Codec. В открытых материалах указана конфигурация с частотой дискретизации 24 кГц, частотой кадров 25 Гц и восемью кодовыми книгами.8
9
Кодек здесь — не просто технический слой сжатия. Он определяет, сколько речевой информации должна предсказать модель, сколько кадров приходится обрабатывать каждую секунду и насколько удачно можно совместить качество с параллельной генерацией. Поэтому Luna-TTS следует рассматривать как совместную разработку языковой модели, дискретного аудиокодека и диффузионного процесса генерации.
Полностью нелинейная генерация всей фразы удобна для качества, но плохо соответствует диалогу: голосовому ассистенту нужно начинать воспроизведение ещё до того, как пользователь закончит формулировать длинный ответ. Поэтому Luna-TTS Realtime использует компромиссную схему.
Модель последовательно переходит от одного блока к следующему, но внутри каждого блока выполняет параллельное зашумливание и восстановление токенов. Один блок включает 32 кадра кодека — это 1,28 секунды аудио. Контекст сохраняется через KV-кэш, а после фиксации первого блока система начинает постепенно передавать последующие.1
Поэтому определение «Realtime полностью нелинейна» было бы неточным. Правильнее сказать, что версия имеет авторегрессионную зависимость между блоками, но использует параллельную диффузионную генерацию внутри каждого блока.
В техническом отчёте описаны дополнительное обучение с использованием GRPO — Group Relative Policy Optimization, метода оптимизации по относительным предпочтениям, — и управление эмоциями и невербальными вокализациями.1
5 Задача такого этапа — сделать голос не только разборчивым, но и более естественным, выразительным и соответствующим предпочтениям слушателя.
Редактирование речи и клонирование голоса в этой архитектуре можно представить как заполнение или переписывание отдельных участков сетки речевых токенов.1
4 Однако качество клонирования, необходимая длина эталонной записи и стабильность в разных языках требуют самостоятельной проверки. Одной архитектуры для таких выводов недостаточно.
В техническом отчёте Luna-TTS Realtime указаны два часто цитируемых результата: коэффициент реального времени RTF 0,024 и передача первого аудиоблока длительностью 1,28 секунды через 41,6 миллисекунды.1
5
Сторонние публикации также сообщают о тестах с 8–16 шагами подавления шума на двух GPU H20.7 Если смотреть только на границу работы движка, эти показатели указывают на высокий запас производительности.
Но 41,6 миллисекунды — не то же самое, что гарантированная задержка облачного API для каждого пользователя. Тест проводился на определённом оборудовании, с прогретым локальным сервисом и заданной конфигурацией параллельного запуска. В реальном продукте к времени могут добавиться передача данных по сети, очередь запросов, обработка текста, декодирование аудио и нагрузка на инфраструктуру.
Иными словами, 41,6 миллисекунды корректнее понимать как время фиксации первого блока в контролируемом локальном тесте, а не как универсальное обещание полной задержки от отправки запроса до звука в любой облачной среде.
Авторы сообщают, что для предварительного обучения использовалось около миллиона часов китайской, английской, японской и корейской речи.1
2 Такой корпус может дать модели широкое покрытие произношения, интонации и межъязыковых закономерностей.
При этом открытая аннотация не содержит достаточных подробностей, чтобы независимо оценить происхождение данных, критерии очистки, долю каждого языка и соблюдение авторских прав. Поэтому цифру «миллион часов» можно приводить как заявленный масштаб обучения, но нельзя автоматически заключать, что модель одинаково сильна для всех языков, акцентов и сценариев применения.
По открытым публикациям, компания строит не только отдельную TTS-модель. Её направление включает API и модельную инфраструктуру, инструменты для создателей контента, а также голосовые интеллектуальные агенты. В такой схеме качество синтеза — лишь один элемент продукта. На коммерческий результат также влияют клонирование голоса, управление эмоциями, сценарии диалога, задержка, стоимость инференса и интеграция с отраслевыми системами.
Отраслевые публикации утверждают, что VUI Labs внедряла решения в логистической диспетчеризации, интернет-страховании и программных сервисах для путешествий и гостиничного бизнеса. По этим сообщениям, несколько клиентов суммарно провели более миллиона деловых диалогов.6 Однако это заявление компании или участников внедрения, приведённое в медиа, а не результат независимого аудита. В открытом доступе нет полного списка клиентов, единого определения «диалога», периода подсчёта и сопоставимой статистики по другим поставщикам.
Команда основателей сочетает академического руководителя и специалиста по продукту и коммерциализации: Цянь Яньминь отвечает за исследовательское направление в области речи и ИИ, а Мэй Цзе описывается как серийный предприниматель. Такая структура может ускорить превращение исследовательской разработки в API, отраслевые решения и голосовых агентов. Долгосрочная конкурентоспособность, однако, будет зависеть от обратной связи с данными, удержания клиентов, стоимости одного запроса и способности поставлять сервис на международных рынках.
Если объединить технический отчёт и данные рейтингов, наиболее обоснованными выглядят четыре преимущества:
Эти решения объясняют, почему Luna-TTS быстро поднялась в отдельных рейтингах прослушивания. Но сами по себе они не доказывают превосходство по цене, стабильности длинных текстов, постоянству тембра, безопасности клонирования, доступности API или качеству на каждом языке.
Главная история Luna-TTS выглядит технически убедительно: VUI Labs объединила производную от Qwen3 языковую модель, дискретный речевой кодек, маскированную диффузионную генерацию, постобучение с подкреплением и потоковую обработку блоками в единую TTS-систему.1
В августе 2026 года модель, согласно открытым публикациям, поднималась на первое место в Hugging Face TTS Arena и занимала третью позицию в Artificial Analysis. Но в срезе Artificial Analysis от 1 сентября Luna TTS уже была пятой.8 Поэтому самый точный вывод звучит не как «Luna-TTS навсегда победила всех конкурентов», а так: модель стала важным участником верхней части мирового рынка TTS, а её сочетание параллельной диффузии и потоковой генерации блоками заслуживает дальнейшего наблюдения.
Разработчикам, выбирающим поставщика, лучше сравнивать не только общий рейтинг. На практике стоит отдельно тестировать нужные языки и акценты, клонирование голоса, управление эмоциями, задержку первого блока, стабильность длинных текстов и фактическую стоимость работы API.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Luna TTS — семейство многоязычных моделей преобразования текста в речь от VUI Labs.
Luna TTS — семейство многоязычных моделей преобразования текста в речь от VUI Labs. Главная техническая идея — не последовательная генерация аудиотокенов по одному, а многократное параллельное восстановление замаскированной сетки токенов на базе Qwen3.
VUI Labs основали профессор Шанхайского университета Цзяотун Цянь Яньминь и серийный предприниматель Мэй Цзе.