Luna TTS是VUI Labs推出的多语言文本转语音模型家族。它曾在2026年8月的Hugging Face TTS Arena报道中排名第一,但截至2026年9月1日,Artificial Analysis榜单显示其位列第五,说明TTS排名会随模型版本和投票样本快速变化。 它的核心路线不是逐个预测语音Token,而是基于Qwen3的离散掩码扩散模型并行修复整段语音Token网格;Realtime版本则按1.28秒区块生成,在论文所述本地测试中首个音频区块延迟为41.6毫秒,实时倍率为0.024。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS是中国语音人工智能初创公司VUI Labs推出的多语言文本转语音模型家族,包含面向音质的标准版本和面向实时交互的Realtime版本。VUI Labs成立于2025年初,公开报道显示,公司由上海交通大学教授钱彦旻和连续创业者梅杰共同创办。
它受到关注的原因,不只是一次榜单排名,而是把语音生成从“逐个Token顺序预测”改成了更接近扩散模型的并行生成:模型先把语音压缩成离散Token,再通过多轮掩码修复同时生成大量语音Token。这种设计试图在自然度、表现力和实时延迟之间取得更好的平衡。1
3
Luna-TTS的排名需要结合具体榜单和时间来看,而不能简单概括为“长期全球第一”。
这几组结果并不一定互相矛盾。盲听榜单会受到模型版本、测试语言、音色、提示词、样本量和投票时间的影响。更准确的结论是:Luna-TTS曾进入主流TTS榜单前列,并在部分时间窗口取得第一或第三名,但现有资料不足以证明它持续击败Cartesia、ElevenLabs、Qwen或其他所有竞争模型。
现有来源也没有提供足够可靠、可直接比较的同一榜单数据,来确认Luna-TTS相对于ByteDance Seed或Zhipu模型的精确名次。因此,不应把这些模型之间的关系写成确定的全面胜负。
Luna-TTS由预训练的Qwen3-0.6B语言模型改造而来,并继续训练为面向语音Token的扩散语言模型。2与传统自回归TTS逐步预测下一个Codec Token不同,Luna-TTS会对整段残差向量量化(RVQ)Token网格进行随机掩码和多轮并行修复。
1
4
这种架构的关键变化在于:生成顺序不再完全由语音序列的前缀决定。模型可以在同一轮中处理多个位置,从而减少长序列逐步生成带来的延迟,也降低错误沿着序列持续累积的风险。1
3
Luna-TTS配套使用自研的Luna-Codec,将音频转换为离散语音表示。公开资料描述的设计为24 kHz采样率、25 Hz帧率和8个码本。8
9这让语音可以以语言模型更容易处理的Token网格表示,同时保留生成自然语音所需的声学细节。
Codec并不是简单的压缩模块。它决定了模型需要预测多少语音信息、每秒需要处理多少帧,以及并行生成能否在音质和速度之间取得平衡。Luna-TTS的技术路线,实际上是把语言模型、离散Codec和扩散式采样作为一个整体进行设计。
标准版Luna-TTS可以对整段话语进行全局的非自回归生成,但实时对话需要在用户还没有说完整句话时就开始播放声音。因此,Realtime版本采用了折中方案:它在区块之间按顺序生成,但在每个区块内部并行去噪。1
4
每个区块包含32个Codec帧,对应1.28秒音频。Realtime版本使用KV Cache保存上下文,并在第一个区块提交后逐步输出后续音频。1因此,“Realtime完全非自回归”并不准确。更准确的说法是:它在区块层面具有自回归依赖,在区块内部进行并行扩散生成。
技术报告还描述了针对离散掩码扩散过程改造的GRPO强化学习后训练,以及对情绪和非语言声音表达的控制。1
5这类后训练的目标不只是让语音“能听懂”,还包括改善自然度、表达力和用户偏好的匹配程度。
资料还提到,语音编辑和零样本声音克隆可以被视为对语音Token网格进行填补或重写的任务。1
4不过,具体克隆质量、所需参考音频长度以及不同语言下的稳定性,仍应通过实际产品测试,而不能只根据模型架构推断。
Luna-TTS Realtime技术报告给出了几个受到广泛引用的数字:在预热后的本地服务测试中,端到端实时倍率(RTF)为0.024,并在41.6毫秒内提交第一个1.28秒音频区块。1
5
相关报道还提到,Realtime版本通常使用8至16步去噪,并在两张H20 GPU上进行测试。7如果只看模型推理边界,这些数据说明系统具有较高的生成吞吐量。
但这些数字不等同于所有用户都会获得的云端首包延迟。测试使用了特定硬件、并行配置、预热服务和本地部署协议;网络传输、排队、文本预处理、音频解码以及生产环境负载,都可能增加用户实际感受到的等待时间。因此,41.6毫秒更适合被理解为受控测试条件下的首个区块提交时间,而不是普遍适用的端到端API体验承诺。
作者报告称,Luna-TTS使用了约100万小时的中文、英语、日语和韩语语音数据进行预训练。1
2这类多语言语料可以为发音、韵律和跨语言声音建模提供更广泛的训练覆盖,但公开摘要没有提供足够细节来独立评估数据来源、清洗标准、各语言占比或版权合规情况。
因此,“使用了100万小时数据”是目前可以引用的训练规模描述,但不应进一步推导出它在每一种语言、每一种口音或每一种应用场景中都同样领先。
从公开报道看,VUI Labs并不只把Luna-TTS定位为一个单独的语音合成模型,而是同时推进模型/API能力、面向创作者的语音工具,以及语音智能体应用。这种方向意味着,模型质量只是产品链条的一部分,真正的商业价值还取决于声音克隆、情绪控制、对话编排、延迟、部署成本和行业集成。
行业报道声称,VUI Labs已在物流调度、互联网保险和酒旅软件服务等场景落地,多个客户累计完成超过一百万次业务对话。6不过,这一数字属于媒体报道中的公司或部署方说法,并非独立审计指标。公开资料也没有完整披露客户名单、对话定义、活跃周期或与其他供应商的比较口径。
VUI Labs早期的创始团队呈现出“学术技术负责人+产品和商业化负责人”的组合:钱彦旻负责语音和人工智能研究方向,梅杰则被报道为连续创业者。这类组织结构有利于把研究型模型快速转化为API、行业方案和语音Agent产品,但其长期竞争力仍取决于数据闭环、客户留存、单位推理成本和全球化交付能力。
综合技术报告和榜单资料,Luna-TTS的可信优势主要有四点:
这些设计解释了为什么Luna-TTS能在部分盲听榜单中迅速取得高位。但它们并不自动证明系统在价格、长文本稳定性、音色一致性、版权安全、API可用性或所有语言上的综合表现优于竞争者。
Luna-TTS的核心故事是可信且有技术含量的:VUI Labs把Qwen3衍生的语言模型、离散语音Codec、掩码扩散生成、强化学习后训练和区块级流式推理组合成了一个完整的TTS系统。1
它曾在2026年8月的公开报道中登上Hugging Face TTS Arena榜首,并在Artificial Analysis的同期报道中排名第三;但到2026年9月1日的榜单快照中,Luna TTS已位列第五。8这说明最稳妥的判断不是“Luna-TTS永久击败所有对手”,而是:它已经成为全球TTS竞争中的重要高位模型,其并行扩散和实时区块生成路线值得持续观察。
对于准备选型的开发者,最有价值的下一步不是只看一个总排名,而是分别测试目标语言、声音克隆、情绪控制、首包延迟、长文本一致性和实际API成本。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Luna TTS是VUI Labs推出的多语言文本转语音模型家族。它曾在2026年8月的Hugging Face TTS Arena报道中排名第一,但截至2026年9月1日,Artificial Analysis榜单显示其位列第五,说明TTS排名会随模型版本和投票样本快速变化。
Luna TTS是VUI Labs推出的多语言文本转语音模型家族。它曾在2026年8月的Hugging Face TTS Arena报道中排名第一,但截至2026年9月1日,Artificial Analysis榜单显示其位列第五,说明TTS排名会随模型版本和投票样本快速变化。 它的核心路线不是逐个预测语音Token,而是基于Qwen3的离散掩码扩散模型并行修复整段语音Token网格;Realtime版本则按1.28秒区块生成,在论文所述本地测试中首个音频区块延迟为41.6毫秒,实时倍率为0.024。
VUI Labs由上海交通大学教授钱彦旻与连续创业者梅杰共同创办。现有资料足以支持其技术路线和早期榜单成绩,但不足以证明它长期领先ByteDance Seed、Zhipu或所有Qwen语音模型。