Luna TTS 係 VUI Labs 推出嘅多語言文字轉語音模型家族。佢曾喺 2026 年 8 月嘅 Hugging Face TTS Arena 報道中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單快照顯示佢排第五,反映 TTS 排名會隨模型版本同投票樣本快速變動。 佢嘅核心路線唔係逐個預測語音 Token,而係基於 Qwen3 嘅離散掩碼擴散模型,並行修復整個語音 Token 網格;Realtime 版本就按 1.28 秒音訊區塊生成,論文所述本地測試中首個音訊區塊延遲為 41.6 毫秒,實時倍率為 0.024。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS 係中國語音人工智能初創公司 VUI Labs 推出嘅多語言文字轉語音(TTS)模型家族,分為主打音質嘅標準版,同埋面向即時互動嘅 Realtime 版本。公開報道顯示,VUI Labs 於 2025 年初成立,由上海交通大學教授錢彥旻同連續創業者梅杰共同創辦。
佢之所以突然受到關注,唔只係因為一度登上語音榜單榜首,更重要係佢嘗試改變語音生成嘅基本方法:由傳統「逐個 Token 順序預測」,轉向較接近擴散模型嘅並行生成。模型會先將聲音壓縮成離散 Token,再透過多輪掩碼修復,同時生成大量語音 Token,目標係喺自然度、表達力同即時延遲之間搵到更好平衡。1
3
講 Luna-TTS 嘅排名,必須連同榜單名稱同截數日期一齊睇,唔可以簡單講成「長期全球第一」。
呢幾組結果未必互相矛盾。盲聽榜單會受到模型版本、測試語言、聲線、提示詞、樣本數量同投票時間影響。較穩妥嘅講法係:Luna-TTS 曾經進入主流 TTS 榜單前列,並喺部分時間窗口取得第一或第三名;但現有資料唔足以證明佢可以持續擊敗 Cartesia、ElevenLabs、Qwen,或者其他所有競爭模型。
至於 Luna-TTS 同 ByteDance Seed 或智譜模型嘅精確排名,現有來源亦未提供足夠可靠、可以直接比較嘅同一榜單數據。因此,唔應該將佢哋之間嘅關係寫成一場已經有明確結果嘅全面勝負。
Luna-TTS 由預訓練 Qwen3-0.6B 語言模型改造而成,並進一步訓練成面向語音 Token 嘅擴散語言模型。2
傳統自回歸 TTS 通常係逐步預測下一個 Codec Token;Luna-TTS 就會對整段殘差向量量化(RVQ)Token 網格進行隨機掩碼,再透過多輪迭代並行修復。1
4
簡單講,生成順序唔再完全由前面已經生成嘅語音內容決定。模型可以喺同一輪處理多個位置,減少長序列逐步生成帶嚟嘅延遲,亦有機會降低錯誤沿住序列一路累積嘅風險。1
3
Luna-TTS 配套使用自研 Luna-Codec,將音訊轉換成離散語音表示。公開資料描述嘅設計包括 24 kHz 採樣率、25 Hz 幀率同 8 個碼本。8
9
呢個 Codec 唔只係一個單純壓縮工具。佢會直接影響模型需要預測幾多語音資訊、每秒要處理幾多幀,以及並行生成可以點樣喺音質同速度之間取捨。換句話講,Luna-TTS 係將語言模型、離散 Codec 同擴散式採樣當成一個整體去設計。
標準版 Luna-TTS 可以對整段話語進行全局非自回歸生成,但即時對話就唔可以等用戶講完整句先開始播聲。Realtime 版本因此採用折衷方案:區塊之間按順序生成,但每個區塊內部就並行去噪。1
4
每個區塊包含 32 個 Codec 幀,即係 1.28 秒音訊。Realtime 版本會用 KV Cache 保存上下文,第一個區塊提交之後,再逐步輸出後續音訊。1
所以,話佢「完全非自回歸」並唔準確。更精確嘅講法係:Realtime 版本喺區塊層面存在自回歸依賴,但喺區塊內部進行並行擴散生成。
技術報告亦提到,團隊針對離散掩碼擴散過程改造 GRPO 強化學習後訓練,並加入情緒同非語言聲音表達控制。1
5
呢類後訓練唔只係令語音「聽得明」,亦希望改善自然度、表達力,以及模型同用戶偏好之間嘅匹配程度。
資料亦指,語音編輯同零樣本聲音克隆,可以視為對語音 Token 網格進行填補或者重寫嘅任務。1
4不過,實際克隆質素、需要幾長參考音訊,以及喺唔同語言下嘅穩定程度,仍然要靠產品測試驗證,唔可以單憑架構推斷。
Luna-TTS Realtime 技術報告提供咗幾個受廣泛引用嘅數字:喺預熱後嘅本地服務測試中,端到端實時倍率(RTF)為 0.024,並喺 41.6 毫秒內提交第一個 1.28 秒音訊區塊。1
5
相關報道亦提到,Realtime 版本一般使用 8 至 16 步去噪,並喺兩張 H20 GPU 上測試。7如果只睇模型推理邊界,呢啲數據反映系統具備相當高嘅生成吞吐量。
但 41.6 毫秒唔等於所有用戶喺雲端 API 都會得到同樣首包延遲。測試採用特定硬件、並行配置、預熱服務同本地部署協議;網絡傳輸、排隊、文字預處理、音訊解碼同生產環境負載,都可能令實際等待時間增加。
因此,41.6 毫秒較適合理解為「受控測試條件下,首個音訊區塊提交所需時間」,而唔係對所有雲端 API 使用情況都適用嘅端到端體驗承諾。
作者報告稱,Luna-TTS 使用大約一百萬小時中文、英文、日文同韓文語音數據進行預訓練。1
2
多語言語料可以為發音、韻律同跨語言聲音建模提供較廣泛嘅訓練覆蓋。不過,公開摘要未有提供足夠細節,讓外界獨立評估數據來源、清洗標準、各語言比例或者版權合規情況。
所以,「使用一百萬小時數據」係目前可以引用嘅訓練規模描述,但唔應該再推論成佢喺每一種語言、每一種口音或者每一個應用場景都同樣領先。
從公開報道睇,VUI Labs 並唔係只將 Luna-TTS 當成單一語音合成模型,而係同時推進模型及 API 能力、面向創作者嘅語音工具,以及語音智能體應用。
呢個方向反映,模型本身嘅音質只係產品鏈其中一環。真正嘅商業價值,仲要視乎聲音克隆、情緒控制、對話編排、延遲、部署成本同企業系統整合能力。
行業報道聲稱,VUI Labs 已經喺物流調度、互聯網保險同酒旅軟件服務等場景落地,幾個客戶累計完成超過一百萬次業務對話。6不過,呢個數字屬於媒體報道中公司或者部署方嘅說法,唔係獨立審計指標。公開資料亦未有完整披露客戶名單、對話定義、活躍周期,或者同其他供應商比較時採用嘅口徑。
VUI Labs 早期創辦團隊呈現「學術技術負責人加產品及商業化負責人」嘅組合:錢彥旻負責語音同人工智能研究方向,梅杰就被報道為連續創業者。呢種組合有利於將研究型模型較快轉化成 API、行業方案同語音 Agent 產品,但長期競爭力仍然要睇數據閉環、客戶留存、每次推理成本同全球交付能力。
綜合技術報告同榜單資料,Luna-TTS 目前較可信嘅優勢主要有四點:
呢啲設計解釋咗點解 Luna-TTS 可以喺部分盲聽榜單快速升上高位。但佢哋唔會自動證明系統喺價格、長文本穩定性、聲線一致性、版權安全、API 可用性,或者所有語言嘅綜合表現,都一定優於競爭對手。
Luna-TTS 嘅核心故事係可信,而且具備一定技術含量:VUI Labs 將 Qwen3 衍生語言模型、離散語音 Codec、掩碼擴散生成、強化學習後訓練同區塊級流式推理組合成一套完整 TTS 系統。1
佢曾喺 2026 年 8 月嘅公開報道中登上 Hugging Face TTS Arena 榜首,亦曾喺 Artificial Analysis 同期報道中排第三;但到 2026 年 9 月 1 日嘅榜單快照,Luna TTS 已經排第五。8
因此,最穩妥嘅判斷唔係「Luna-TTS 永久擊敗所有對手」,而係:佢已經成為全球 TTS 競爭中一個重要嘅高位模型,而佢所採用嘅並行擴散同實時區塊生成路線,值得繼續觀察。
對準備做技術選型嘅開發者嚟講,最有用嘅下一步唔係只睇一個總排名,而係按實際需要測試目標語言、聲音克隆、情緒控制、首包延遲、長文本一致性同 API 真實成本。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Luna TTS 係 VUI Labs 推出嘅多語言文字轉語音模型家族。佢曾喺 2026 年 8 月嘅 Hugging Face TTS Arena 報道中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單快照顯示佢排第五,反映 TTS 排名會隨模型版本同投票樣本快速變動。
Luna TTS 係 VUI Labs 推出嘅多語言文字轉語音模型家族。佢曾喺 2026 年 8 月嘅 Hugging Face TTS Arena 報道中排名第一,但截至 2026 年 9 月 1 日,Artificial Analysis 榜單快照顯示佢排第五,反映 TTS 排名會隨模型版本同投票樣本快速變動。 佢嘅核心路線唔係逐個預測語音 Token,而係基於 Qwen3 嘅離散掩碼擴散模型,並行修復整個語音 Token 網格;Realtime 版本就按 1.28 秒音訊區塊生成,論文所述本地測試中首個音訊區塊延遲為 41.6 毫秒,實時倍率為 0.024。
VUI Labs 由上海交通大學教授錢彥旻同連續創業者梅杰共同創辦。現有資料足以支持其技術路線同早期榜單成績,但未足以證明佢長期領先 ByteDance Seed、智譜或者所有 Qwen 語音模型。