Luna TTS는 VUI Labs가 개발한 다국어 텍스트 음성 변환(TTS) 모델군이다. 2026년 8월 Hugging Face TTS Arena 관련 보도에서 1위를 기록했지만, 2026년 9월 1일 Artificial Analysis 스냅샷에서는 5위로 나타나 순위가 고정된 성적표는 아님을 보여준다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS는 중국 음성 AI 스타트업 VUI Labs가 선보인 다국어 텍스트 음성 변환(TTS) 모델군이다. 음질 중심의 표준 버전과 실시간 대화를 겨냥한 Luna-TTS Realtime으로 구성된다. VUI Labs는 2025년 초 상하이교통대 교수 첸옌민(钱彦旻)과 연쇄 창업가 메이제(梅杰)가 공동 설립한 것으로 알려졌다.
이 모델이 주목받은 이유는 단순히 한 차례 음성 벤치마크에서 높은 순위를 기록했기 때문만은 아니다. 기존 TTS의 주류 방식인 ‘음성 토큰의 순차 생성’에서 벗어나, 확산 모델에 가까운 병렬 생성 구조를 채택했기 때문이다. 음성을 먼저 이산 토큰으로 압축한 뒤, 가려진 토큰을 여러 차례 동시에 복원하는 접근이다.1
3
Luna-TTS의 순위는 어떤 평가 플랫폼을 기준으로 하는지, 또 어느 시점의 결과인지에 따라 달라진다. 따라서 ‘항상 세계 1위’라고 표현하기보다는 주요 음성 평가에서 상위권에 진입한 모델로 보는 편이 정확하다.
이 결과들은 반드시 서로 충돌한다고 볼 수 없다. 블라인드 청취 순위는 모델 버전, 테스트 언어, 음색, 프롬프트, 표본 수와 투표 시점에 따라 변한다. 현재 자료가 말해주는 가장 신중한 결론은 Luna-TTS가 주요 TTS 평가에서 상위권에 올랐고 특정 기간에는 1위 또는 3위를 기록했지만, Cartesia·ElevenLabs·Qwen을 비롯한 모든 경쟁 모델을 지속적으로 앞섰다고 입증되지는 않았다는 것이다.
특히 ByteDance Seed나 Zhipu 모델과의 정확한 일대일 순위를 확인할 수 있는 동일 기준의 신뢰할 만한 자료는 충분하지 않다. 따라서 이들 모델 사이의 전면적인 승패를 단정해서는 안 된다.
Luna-TTS는 사전 학습된 Qwen3-0.6B 언어 모델을 음성 토큰 처리에 맞게 추가 학습한 구조다.2 전통적인 자기회귀 TTS가 코덱 토큰을 하나씩 예측한다면, Luna-TTS는 잔차 벡터 양자화(RVQ) 토큰으로 구성된 전체 격자에 무작위 마스크를 적용하고 여러 차례 병렬로 복원한다.
1
4
핵심은 생성 순서가 음성 시퀀스의 앞부분에 완전히 종속되지 않는다는 점이다. 한 번의 보정 단계에서 여러 위치를 동시에 처리할 수 있어, 긴 음성을 순차적으로 생성할 때 발생하는 지연을 줄이고 앞부분의 오류가 뒤로 누적되는 현상도 완화하려는 설계다.1
3
Luna-TTS는 자체 개발한 Luna-Codec으로 오디오를 언어 모델이 다루기 쉬운 이산 음성 표현으로 변환한다. 공개 자료에 따르면 24kHz 샘플링레이트, 25Hz 프레임레이트, 8개 코드북 구조를 사용한다.8
9
코덱은 단순한 압축 모듈이 아니다. 모델이 매초 얼마나 많은 음성 정보를 예측해야 하는지, 음질과 속도의 균형을 어떻게 맞출지 결정하는 인터페이스다. Luna-TTS는 언어 모델과 이산 코덱, 확산 방식의 샘플링을 별개의 부품이 아니라 하나의 생성 시스템으로 설계한 셈이다.
표준 Luna-TTS는 한 문장 전체를 비자기회귀 방식으로 처리할 수 있지만, 실시간 대화에서는 사용자가 말을 끝내기 전에 음성을 재생해야 한다. Luna-TTS Realtime은 이를 위해 절충안을 택했다. 블록과 블록 사이에는 순차적 의존성을 두되, 각 블록 내부에서는 토큰을 병렬로 디노이징한다.1
4
각 블록은 코덱 프레임 32개로 구성되며 1.28초 분량의 오디오에 해당한다. Realtime 버전은 KV 캐시로 문맥을 유지하고 첫 블록이 확정된 뒤 다음 블록을 차례로 출력한다.1
따라서 ‘Realtime 버전도 완전히 비자기회귀 방식’이라고 말하는 것은 정확하지 않다. 더 정확히 표현하면 블록 수준에서는 자기회귀적이고, 블록 내부에서는 병렬 확산 생성을 수행한다.
기술 보고서는 이산 마스크 확산 과정에 맞게 조정한 GRPO 강화학습 후처리와 감정·비언어적 발성 제어 기능도 설명한다.1
5 목표는 단순히 문장을 알아들을 수 있게 읽는 데 그치지 않고, 자연스러움과 표현력, 사용자 선호에 대한 정합성을 높이는 데 있다.
음성 편집과 제로샷 음성 복제 역시 음성 토큰 격자의 일부를 채우거나 다시 쓰는 인필링 작업으로 해석할 수 있다.1
4 다만 실제 복제 품질, 필요한 참고 음성 길이, 언어별 안정성은 모델 구조만으로 판단하기 어렵고 제품 테스트를 통해 확인해야 한다.
Luna-TTS Realtime 기술 보고서가 제시한 수치 중 가장 많이 인용되는 것은 실시간 배율(RTF) 0.024와 첫 1.28초 오디오 블록 제출 시간 41.6ms다. 이는 워밍업이 끝난 로컬 서빙 환경에서 측정된 결과다.1
5
관련 보도에 따르면 Realtime 버전은 일반적으로 8~16회의 디노이징 단계를 사용했으며, 두 장의 H20 GPU에서 테스트됐다.7 모델 추론 엔진의 경계 안에서만 보면 높은 생성 처리량을 보여주는 수치다.
그러나 41.6ms를 모든 사용자가 클라우드 API에서 체감하는 첫 음성 지연으로 해석해서는 안 된다. 해당 테스트에는 특정 하드웨어와 병렬 설정, 워밍업된 서버, 로컬 배포 프로토콜이 사용됐다. 네트워크 전송, 대기열, 텍스트 전처리, 오디오 디코딩과 실제 서비스 부하가 더해지면 사용자 체감 지연은 달라질 수 있다. 따라서 41.6ms는 통제된 조건에서 첫 오디오 블록이 제출된 시간으로 이해하는 것이 적절하다.
저자들은 Luna-TTS가 중국어·영어·일본어·한국어 음성 약 100만 시간으로 사전 학습됐다고 보고했다.1
2 다국어 음성 데이터는 발음과 운율, 언어 간 음성 표현을 폭넓게 학습하는 데 도움이 될 수 있다.
다만 공개된 요약만으로는 데이터의 구체적인 출처, 정제 기준, 언어별 비중과 저작권 준수 여부를 독립적으로 평가하기 어렵다. 따라서 ‘100만 시간의 데이터로 학습했다’는 규모는 인용할 수 있지만, 모든 언어와 억양, 모든 사용 환경에서 동일하게 우수하다고 확대 해석해서는 안 된다.
공개 자료를 종합하면 VUI Labs는 Luna-TTS를 단일 음성 합성 모델로만 판매하기보다 모델·API, 창작자용 음성 도구, 음성 에이전트 애플리케이션을 함께 구축하려는 방향을 보인다. 이 전략에서는 음질 자체뿐 아니라 음성 복제, 감정 제어, 대화 흐름 설계, 지연 시간, 배포 비용과 산업별 통합이 모두 사업 성패를 좌우한다.
업계 보도는 VUI Labs가 물류 배차, 온라인 보험, 여행·호텔 소프트웨어 서비스 등에 제품을 적용했으며, 여러 고객의 실제 업무 대화가 누적 100만 회를 넘었다고 전한다.6 다만 이 수치는 언론에 소개된 회사 또는 배포 측 주장으로, 독립적으로 감사된 고객 지표는 아니다. 고객 목록, 대화의 정의, 운영 기간과 경쟁사 대비 산정 기준도 모두 공개된 것은 아니다.
창업팀은 학술 연구 책임자와 제품·사업화 책임자가 결합한 형태로 소개된다. 첸옌민은 음성·인공지능 연구를, 메이제는 제품화와 사업화를 맡는 구도다. 이런 구성은 연구형 모델을 API와 산업 솔루션, 음성 에이전트로 빠르게 전환하는 데 유리할 수 있다. 그러나 장기 경쟁력은 데이터 선순환, 고객 유지율, 추론 단가와 글로벌 공급 역량에 달려 있다.
기술 보고서와 순위 자료를 함께 보면 Luna-TTS의 비교적 신뢰할 만한 강점은 네 가지로 정리된다.
이 설계들이 일부 블라인드 청취 평가에서 빠르게 높은 순위를 기록한 배경을 설명해준다. 하지만 이것만으로 가격, 긴 문장 안정성, 음색 일관성, 저작권·안전성, API 가용성, 모든 언어에서의 종합 우위를 증명할 수는 없다.
Luna-TTS의 기술적 핵심은 충분히 구체적이고 의미가 있다. VUI Labs는 Qwen3 파생 언어 모델, 이산 음성 코덱, 마스크 확산 생성, 강화학습 후처리와 블록 단위 스트리밍 추론을 하나의 TTS 시스템으로 결합했다.1
순위에 대해서는 더 신중한 해석이 필요하다. Luna-TTS는 2026년 8월 공개 보도에서 Hugging Face TTS Arena 1위, Artificial Analysis Speech Arena 3위로 소개됐지만, 2026년 9월 1일 순위 스냅샷에서는 5위였다.8 이는 ‘모든 경쟁자를 영원히 앞선다’는 이야기보다, 병렬 확산과 실시간 블록 생성이라는 설계로 글로벌 TTS 경쟁의 상위권에 진입한 모델이라는 평가가 더 정확하다는 뜻이다.
실제 도입을 검토하는 개발자라면 단일 종합 순위만 볼 것이 아니라 목표 언어, 음성 복제, 감정 제어, 첫 오디오 지연, 긴 문장의 일관성, 실제 API 비용을 각각 테스트하는 것이 바람직하다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Luna TTS는 VUI Labs가 개발한 다국어 텍스트 음성 변환(TTS) 모델군이다. 2026년 8월 Hugging Face TTS Arena 관련 보도에서 1위를 기록했지만, 2026년 9월 1일 Artificial Analysis 스냅샷에서는 5위로 나타나 순위가 고정된 성적표는 아님을 보여준다.
Luna TTS는 VUI Labs가 개발한 다국어 텍스트 음성 변환(TTS) 모델군이다. 2026년 8월 Hugging Face TTS Arena 관련 보도에서 1위를 기록했지만, 2026년 9월 1일 Artificial Analysis 스냅샷에서는 5위로 나타나 순위가 고정된 성적표는 아님을 보여준다. 핵심 기술은 음성 토큰을 하나씩 예측하는 대신 Qwen3 기반의 이산 마스크 확산 모델로 전체 음성 토큰 격자를 여러 차례 병렬 보정하는 방식이다.
VUI Labs는 상하이교통대 교수 첸옌민과 연쇄 창업가 메이제가 공동 설립한 것으로 공개됐다. 현재 자료는 기술 구조와 초기 벤치마크 성과를 뒷받침하지만, ByteDance Seed·Zhipu·Qwen을 포함한 모든 경쟁 모델을 장기간 앞선다고 단정할 근거는 부족하다.