Luna TTS 是 VUI Labs 推出的多語言文字轉語音模型家族。它曾在 2026 年 8 月的 Hugging Face TTS Arena 報導中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單顯示其位列第五,反映 TTS 排名會隨模型版本與投票樣本快速變化。 它的核心路線不是逐個預測語音 Token,而是基於 Qwen3 的離散掩碼擴散模型,並行修復整段語音 Token 網格;Realtime 版本則按 1.28 秒區塊生成,在技術報告所述的本地測試中,首個音訊區塊延遲為 41.6 毫秒,即時倍率為 0.024。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS 是中國語音人工智慧新創 VUI Labs 推出的多語言文字轉語音模型家族,包含以音質為主的標準版本,以及面向即時互動的 Realtime 版本。公開報導顯示,VUI Labs 成立於 2025 年初,由上海交通大學教授錢彦旻與連續創業者梅杰共同創辦。
它受到關注,原因不只是一個榜單名次,而是它嘗試改變語音生成的基本方式:不再依序預測每一個語音 Token,而是先將聲音壓縮為離散 Token,再透過多輪掩碼修復,並行生成大量語音 Token。這種設計希望在自然度、表現力與即時延遲之間取得更好的平衡。1
3
Luna-TTS 的排名必須放在特定榜單與時間點下理解,不能簡單概括為「長期全球第一」。
這些結果不一定互相矛盾。盲聽榜單會受到模型版本、測試語言、音色、提示詞、樣本數量與投票時間影響。較準確的結論是:Luna-TTS 曾進入主流 TTS 榜單前列,並在部分時間窗口取得第一或第三名;但現有資料不足以證明它持續擊敗 Cartesia、ElevenLabs、Qwen,或其他所有競爭模型。
目前也沒有足夠可靠、可直接比較的同一榜單資料,能確認 Luna-TTS 相對於 ByteDance Seed 或智譜模型的精確名次。因此,不宜把這些模型之間的關係寫成確定的全面勝負。
Luna-TTS 由預訓練的 Qwen3-0.6B 語言模型改造而來,並進一步訓練成面向語音 Token 的擴散語言模型。2 與傳統自回歸 TTS 逐步預測下一個 Codec Token 不同,Luna-TTS 會對整段殘差向量量化(RVQ)Token 網格進行隨機遮罩,再透過多輪並行修復生成語音。
1
4
這項架構變化的關鍵在於:生成順序不再完全由語音序列的前綴決定。模型可以在同一輪處理多個位置,從而減少長序列逐步生成所帶來的延遲,也有助於降低錯誤沿序列持續累積的風險。1
3
換句話說,傳統自回歸模型比較像是「一句一句、一步一步往下寫」;Luna-TTS 則更接近先看整體,再反覆補齊被遮住的部分。這也是它被形容為「更接近擴散模型」的原因。
Luna-TTS 搭配自研的 Luna-Codec,將音訊轉換為離散語音表示。公開資料描述的設計為 24 kHz 採樣率、25 Hz 幀率,以及 8 個碼本。8
9
Codec 並不只是單純的壓縮模組。它決定模型需要預測多少語音資訊、每秒需要處理多少幀,以及並行生成能否在音質與速度之間取得平衡。Luna-TTS 的技術路線,實際上是把語言模型、離散 Codec 與擴散式採樣視為一個整體進行設計。
標準版 Luna-TTS 可以針對整段話語進行全局的非自回歸生成;但在即時對話中,系統往往要在使用者尚未說完一句話時便開始播放。因此,Realtime 版本採用折衷方案:區塊與區塊之間按順序生成,但每個區塊內部則並行去噪。1
4
每個區塊包含 32 個 Codec 幀,對應 1.28 秒音訊。Realtime 版本使用 KV Cache 保存上下文,並在提交第一個區塊後,逐步輸出後續音訊。1
因此,「Realtime 完全非自回歸」並不準確。更精確的說法是:它在區塊層面存在自回歸依賴,在區塊內部進行並行擴散生成。
技術報告還描述了針對離散掩碼擴散過程改造的 GRPO 強化學習後訓練,以及對情緒與非語言聲音表達的控制。1
5
這類後訓練的目標不只是讓語音「聽得懂」,也包括改善自然度、表現力,以及與使用者偏好的匹配程度。資料亦提到,語音編輯與零樣本聲音克隆可以被視為對語音 Token 網格進行填補或重寫的任務。1
4
不過,實際的克隆品質、所需參考音訊長度,以及不同語言下的穩定性,仍應透過產品測試驗證,不能只從模型架構推論。
Luna-TTS Realtime 技術報告提供了幾個受到廣泛引用的數字:在預熱後的本地服務測試中,端到端即時倍率(RTF)為 0.024,並在 41.6 毫秒內提交第一個 1.28 秒音訊區塊。1
5
相關報導還提到,Realtime 版本通常使用 8 至 16 步去噪,並在兩張 H20 GPU 上進行測試。7 若只看模型推理邊界,這些數據顯示系統具有很高的生成吞吐量。
但這些數字不等同於所有使用者都能獲得的雲端首包延遲。測試使用了特定硬體、並行配置、預熱服務與本地部署協定;網路傳輸、排隊、文字前處理、音訊解碼,以及正式環境負載,都可能增加實際等待時間。
因此,41.6 毫秒更適合被理解為受控測試條件下的首個區塊提交時間,而不是普遍適用的端到端 API 體驗承諾。
作者報告稱,Luna-TTS 使用約一百萬小時的中文、英文、日文與韓文語音資料進行預訓練。1
2
這類多語言語料可以為發音、韻律與跨語言聲音建模提供更廣泛的訓練覆蓋,但公開摘要沒有提供足夠細節,讓外界獨立評估資料來源、清洗標準、各語言比例或版權合規情況。
因此,「使用一百萬小時資料」是目前可以引用的訓練規模描述,但不能進一步推導出它在每一種語言、每一種口音或每一種應用場景中都同樣領先。
從公開報導來看,VUI Labs 並不只是把 Luna-TTS 定位成單一語音合成模型,而是同時推進模型與 API 能力、面向創作者的語音工具,以及語音智能體應用。
這代表模型品質只是產品鏈的一部分。真正的商業價值,還取決於聲音克隆、情緒控制、對話編排、延遲、部署成本與產業整合能力。
產業報導聲稱,VUI Labs 已在物流調度、互聯網保險與酒旅軟體服務等場景落地,數個客戶累計完成超過一百萬次業務對話。6 不過,這個數字屬於媒體報導中的公司或部署方說法,並非獨立審計指標。公開資料也沒有完整披露客戶名單、對話定義、活躍週期,或與其他供應商比較時採用的口徑。
VUI Labs 早期創始團隊呈現「學術技術負責人+產品與商業化負責人」的組合:錢彦旻負責語音與人工智慧研究方向,梅杰則被報導為連續創業者。 這種組織結構有利於把研究型模型快速轉化為 API、產業方案與語音 Agent 產品,但長期競爭力仍取決於資料閉環、客戶留存、單位推理成本與全球化交付能力。
綜合技術報告與榜單資料,Luna-TTS 目前較可信的優勢主要有四點:
這些設計解釋了為什麼 Luna-TTS 能在部分盲聽榜單中迅速取得高位。但它們並不自動證明系統在價格、長文本穩定性、音色一致性、版權安全、API 可用性,或所有語言上的綜合表現都優於競爭對手。
Luna-TTS 的核心故事是可信且具技術含量的:VUI Labs 把 Qwen3 衍生的語言模型、離散語音 Codec、掩碼擴散生成、強化學習後訓練,以及區塊級串流推理,組合成一個完整的 TTS 系統。1
它曾在 2026 年 8 月的公開報導中登上 Hugging Face TTS Arena 榜首,並在 Artificial Analysis 的同期報導中排名第三;但到 2026 年 9 月 1 日的榜單快照中,Luna TTS 已位列第五。8
這說明最穩妥的判斷不是「Luna-TTS 永久擊敗所有對手」,而是:它已成為全球 TTS 競爭中的重要高位模型,其並行擴散與即時區塊生成路線值得持續觀察。
對準備選型的開發者而言,最有價值的下一步不是只看一個總排名,而是分別測試目標語言、聲音克隆、情緒控制、首包延遲、長文本一致性與實際 API 成本。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Luna TTS 是 VUI Labs 推出的多語言文字轉語音模型家族。它曾在 2026 年 8 月的 Hugging Face TTS Arena 報導中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單顯示其位列第五,反映 TTS 排名會隨模型版本與投票樣本快速變化。
Luna TTS 是 VUI Labs 推出的多語言文字轉語音模型家族。它曾在 2026 年 8 月的 Hugging Face TTS Arena 報導中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單顯示其位列第五,反映 TTS 排名會隨模型版本與投票樣本快速變化。 它的核心路線不是逐個預測語音 Token,而是基於 Qwen3 的離散掩碼擴散模型,並行修復整段語音 Token 網格;Realtime 版本則按 1.28 秒區塊生成,在技術報告所述的本地測試中,首個音訊區塊延遲為 41.6 毫秒,即時倍率為 0.024。
VUI Labs 由上海交通大學教授錢彦旻與連續創業者梅杰共同創辦。現有資料足以支持其技術路線與早期榜單成績,但不足以證明它長期領先 ByteDance Seed、智譜或所有 Qwen 語音模型。