Luna TTSはVUI Labsが開発する多言語テキスト音声合成(TTS)モデル群です。2026年8月にはHugging Face TTS Arenaで1位になったと報じられましたが、2026年9月1日時点のArtificial Analysisでは5位で、ランキングはモデルのバージョンや投票状況によって変動しています。 最大の特徴は、音声トークンを1つずつ予測するのではなく、Qwen3を基盤とした離散マスク拡散モデルで音声トークンのグリッドを並列的に修復する点です。Realtime版は1.28秒単位のブロック処理を採用し、論文記載のローカル試験では最初の音声ブロックを41.6ミリ秒で出力しました。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTSは、中国の音声AIスタートアップVUI Labsが開発する多言語テキスト音声合成(TTS)モデル群です。高音質を重視した標準版と、対話サービス向けの「Luna-TTS Realtime」を展開しています。VUI Labsは2025年初頭に、上海交通大学の銭彦旻(せん・げんびん)教授と連続起業家の梅杰(メイ・ジエ)氏が共同創業したと報じられています。
注目を集めている理由は、単に新しいモデルがランキング上位に入ったからだけではありません。従来の音声合成で一般的だった「音声トークンを順番に1つずつ生成する」方式から離れ、拡散モデルに近い並列生成へと設計を切り替えているためです。1
3
Luna-TTSの評価は、どのランキングを、いつ確認するかによって変わります。「世界で常に1位」と捉えるより、複数のスナップショットを比較する方が正確です。
これらの結果が食い違うのは、必ずしも不自然ではありません。TTSのブラインド評価は、モデルのバージョン、対象言語、音声の種類、プロンプト、サンプル数、投票期間などに左右されます。
現時点で最も妥当な結論は、Luna-TTSが主要なTTS評価で上位に入り、一部の期間では1位または3位を記録した有力モデルだということです。ただし、Cartesia、ElevenLabs、Qwen、ByteDance Seed、智譜(Zhipu)など、すべての競合を継続的に上回っていると示す同一条件のデータは確認できません。特にByteDance SeedやZhipuとの正確な順位比較については、公開資料が不足しています。
Luna-TTSは、事前学習済みのQwen3-0.6Bを音声生成向けに改造し、音声トークンを扱う拡散言語モデルとして追加学習したシステムです。2
通常の自己回帰型TTSでは、前に生成したCodecトークンを手がかりに、次のトークンを順番に予測します。一方、Luna-TTSは音声をRVQ(残差ベクトル量子化)トークンのグリッドに変換し、その一部をランダムにマスクします。その後、複数回の反復処理でマスクされた部分を並列に埋めていきます。1
4
この方式では、生成の順序が完全に音声列の先頭から固定されません。同じステップで複数の位置を処理できるため、長い音声を逐次生成する際の遅延を抑えやすく、前の誤りが後続部分へ連鎖する問題も軽減できる可能性があります。1
3
Luna-TTSは、独自開発の音声Codec「Luna-Codec」と組み合わせて使われます。公開資料で説明されている仕様は、24kHzのサンプリングレート、25Hzのフレームレート、8つのコードブックです。8
9
Codecは単なる圧縮部品ではありません。音声を1秒あたり何フレームで表現するか、モデルが毎回どれだけの音声情報を予測するか、そして速度と音質をどのように両立するかを決める重要なインターフェースです。
Luna-TTSの特徴は、言語モデル、離散Codec、拡散サンプリングを別々の部品として扱うのではなく、音声生成全体を一つの設計として組み合わせている点にあります。
標準版は発話全体の音声トークングリッドを非自己回帰的に生成します。しかし、リアルタイム対話では、ユーザーが話し終わる前から音声を再生しなければなりません。
そこでRealtime版は、32フレーム、つまり1.28秒分のCodecフレームを一つのブロックとして扱います。ブロックとブロックの間には順次的な依存関係を持たせる一方、各ブロック内部では音声トークンを並列にノイズ除去します。1
4
KV Cacheで過去の文脈を保持し、最初のブロックを確定した後は、後続の音声を順次ストリーミングします。1したがって、「Realtime版も完全に非自己回帰」と説明するのは正確ではありません。より正確には、ブロック単位では自己回帰的、ブロック内部では並列拡散的な構成です。
技術報告では、離散マスク拡散の生成過程に合わせたGRPO(Group Relative Policy Optimization)ベースの強化学習後学習についても説明されています。1
5
狙いは、単に内容を聞き取れる音声を作ることではありません。自然さ、感情表現、非言語的な発声、そしてユーザーの好みに合う話し方を改善することも含まれます。
また、音声編集やゼロショット音声クローニングは、音声トークンのグリッドを部分的に埋めたり書き換えたりする「インフィリング」タスクとして扱えます。1
4ただし、実際のクローニング品質、必要な参照音声の長さ、言語ごとの安定性は、モデルの構造だけから判断すべきではありません。導入時には実音声での検証が必要です。
Luna-TTS Realtimeの技術報告で特に引用されている数値が、リアルタイム係数(RTF)0.024と、最初の1.28秒分の音声ブロックを41.6ミリ秒で確定したという結果です。1
5
関連報道では、Realtime版は通常8〜16ステップのノイズ除去を行い、2枚のH20 GPUでテストされたとされています。7モデルの推論エンジン境界だけを見れば、非常に高い生成スループットを示す数値です。
ただし、これはすべての利用者がクラウドAPIで体感する待ち時間と同じではありません。試験は特定のGPU、並列設定、ウォームアップ済みのローカルサーバー、特定の提供プロトコルを前提にしています。ネットワーク伝送、リクエスト待ち、テキスト前処理、音声デコード、サーバー負荷が加われば、実際の初回音声までの時間は長くなる可能性があります。
つまり41.6ミリ秒は、管理された試験条件で最初のブロックが確定するまでの時間であり、一般的なクラウドAPIのエンドツーエンド体験を保証する数字ではありません。
著者らは、Luna-TTSの事前学習に中国語、英語、日本語、韓国語の音声約100万時間を使ったと報告しています。1
2
4言語にまたがる大規模な音声コーパスは、発音、韻律、言語間での音声表現を学習するうえで有利になり得ます。一方、公開された概要だけでは、データの出所、クリーニング基準、言語ごとの割合、権利処理を独立に評価するには情報が足りません。
そのため、「約100万時間の音声データで学習した」という規模は引用できますが、すべての言語、方言、利用場面で同じように優れているとまでは言えません。
公開情報を見る限り、VUI LabsはLuna-TTSを単体の音声合成モデルとして提供するだけでなく、モデル/API基盤、クリエイター向け音声ツール、音声エージェント向けサービスを組み合わせようとしています。
この構成では、モデルの自然さだけでなく、音声クローニング、感情制御、対話設計、遅延、推論コスト、企業システムへの組み込みやすさが商業価値を左右します。
業界報道では、同社の技術が物流配車、インターネット保険、旅行・ホテル向けSaaSなどで導入され、複数の顧客による業務対話が累計100万回を超えたとされています。6ただし、この数字は報道された企業または導入側の説明であり、独立監査された指標ではありません。顧客名、対話回数の定義、稼働期間、競合サービスとの比較条件も公開資料だけでは明確ではありません。
創業チームは、音声・AI研究を担う銭彦旻教授と、プロダクト化・事業化を担う梅杰氏という「研究者と起業家」の組み合わせです。この体制は、研究成果をAPIや業界向けソリューション、音声エージェントへ迅速に転換するうえで強みになり得ます。今後の競争力は、データのフィードバックループ、顧客維持率、1回あたりの推論コスト、海外展開の実行力にかかっています。
技術報告とランキングを総合すると、Luna-TTSの信頼できる強みは主に次の4点です。
こうした設計は、Luna-TTSが一部のブラインド評価で急速に上位へ進んだ理由を説明します。ただし、それだけで価格、長文での安定性、話者の一貫性、権利・安全性、APIの稼働品質、すべての言語における総合性能まで競合を上回るとは限りません。
Luna-TTSの技術的な中核は明確です。VUI Labsは、Qwen3を基盤とする言語モデル、離散音声Codec、マスク拡散生成、強化学習後学習、ブロック単位のストリーミング推論を、一つのTTSシステムとして組み合わせています。1
2026年8月にはHugging Face TTS Arenaで1位、Artificial Analysisの同時期の報道では3位とされました。しかし、2026年9月1日のArtificial Analysisのスナップショットでは5位です。8
したがって、現時点での最も慎重な評価は、「Luna-TTSは世界中の競合を恒久的に打ち負かしたモデル」ではなく、グローバルなTTS競争で上位に食い込む有力モデルであり、並列拡散とリアルタイム・ブロック生成という設計が今後も注目に値するというものです。
導入を検討する開発者は、総合ランキングを一つ見るだけで判断するのではなく、対象言語、音声クローニング、感情制御、初回音声までの遅延、長文での話者一貫性、実際のAPI料金を自分の用途に合わせて比較するのがよいでしょう。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Luna TTSはVUI Labsが開発する多言語テキスト音声合成(TTS)モデル群です。2026年8月にはHugging Face TTS Arenaで1位になったと報じられましたが、2026年9月1日時点のArtificial Analysisでは5位で、ランキングはモデルのバージョンや投票状況によって変動しています。
Luna TTSはVUI Labsが開発する多言語テキスト音声合成(TTS)モデル群です。2026年8月にはHugging Face TTS Arenaで1位になったと報じられましたが、2026年9月1日時点のArtificial Analysisでは5位で、ランキングはモデルのバージョンや投票状況によって変動しています。 最大の特徴は、音声トークンを1つずつ予測するのではなく、Qwen3を基盤とした離散マスク拡散モデルで音声トークンのグリッドを並列的に修復する点です。Realtime版は1.28秒単位のブロック処理を採用し、論文記載のローカル試験では最初の音声ブロックを41.6ミリ秒で出力しました。
VUI Labsは上海交通大学の銭彦旻教授と、連続起業家の梅杰氏によって創業されました。技術と初期ランキングの実績は確認できますが、ByteDance Seed、智譜(Zhipu)、Qwenを含むすべての競合モデルに長期的に勝っていると断定できる資料はありません。