Luna TTS คือครอบครัวโมเดลแปลงข้อความเป็นเสียงหลายภาษาจาก VUI Labs ซึ่งเคยขึ้นอันดับหนึ่งในรายงานผล Hugging Face TTS Arena ช่วงเดือนสิงหาคม 2026 แต่ในภาพรวม Artificial Analysis ณ วันที่ 1 กันยายน 2026 อยู่ที่อันดับ 5 ส... จุดเด่นทางเทคนิคคือการใช้โมเดลแบบ discrete masked diffusion ที่อาศัย Qwen3 เพื่อสร้างโทเคนเสียงห...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is VUI Labs’ Luna-TTS, who founded it, how has it ranked against ElevenLabs, MiniMax, Cartesia, ByteDance Seed, Zhipu, Qwen, and Google. Article summary: Luna-TTS is VUI Labs’ multilingual text-to-speech model family: a quality-oriented fully non-autoregressive model plus a streaming “Realtime” variant. VUI Labs was founded in early 2025 by Shanghai Jiao Tong University p. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Luna-TTS คือครอบครัวโมเดลแปลงข้อความเป็นเสียงหลายภาษาที่พัฒนาโดย VUI Labs สตาร์ตอัปด้านปัญญาประดิษฐ์เสียงจากจีน โดยมีทั้งรุ่นมาตรฐานที่เน้นคุณภาพเสียง และรุ่น Luna-TTS Realtime ที่ออกแบบมาสำหรับการโต้ตอบแบบทันที
VUI Labs ก่อตั้งขึ้นในช่วงต้นปี 2025 โดยศาสตราจารย์เฉียน เหยียนหมิ่น (Qian Yanmin) จากมหาวิทยาลัยเซี่ยงไฮ้เจียวทง และเม่ย เจี๋ย (Mei Jie) ผู้ประกอบการต่อเนื่อง ตามข้อมูลจากรายงานข่าวที่เปิดเผยต่อสาธารณะ
สิ่งที่ทำให้ Luna-TTS เป็นที่สนใจไม่ใช่เพียงอันดับในชาร์ต แต่คือการเปลี่ยนวิธีสร้างเสียง จากเดิมที่โมเดลมักทำนายโทเคนเสียงทีละตัวตามลำดับ มาเป็นการสร้างโทเคนจำนวนมากแบบขนานด้วยแนวคิดที่ใกล้เคียงกับ diffusion model การออกแบบนี้มีเป้าหมายเพื่อหาจุดสมดุลใหม่ระหว่างความเป็นธรรมชาติ อารมณ์ของเสียง และความหน่วงในการตอบสนอง 1
3
คำตอบขึ้นอยู่กับว่าดูจาก榜单ใด รุ่นโมเดลใด และช่วงเวลาไหน จึงไม่ควรสรุปง่าย ๆ ว่า Luna-TTS เป็น “อันดับหนึ่งของโลกตลอดเวลา”
ผลลัพธ์เหล่านี้ไม่จำเป็นต้องขัดแย้งกัน เพราะการจัดอันดับแบบฟังเสียงโดยไม่เห็นชื่อโมเดลอาจได้รับผลจากรุ่นที่นำมาทดสอบ ภาษา เสียงต้นแบบ คำสั่งที่ใช้ จำนวนตัวอย่าง และช่วงเวลาการโหวต
ข้อสรุปที่ระมัดระวังที่สุดคือ Luna-TTS เคยขึ้นไปอยู่แถวหน้าของชาร์ต TTS ระดับสากล และทำได้ถึงอันดับ 1 หรืออันดับ 3 ในบางช่วงเวลา แต่ข้อมูลที่มีอยู่ยังไม่ยืนยันว่าโมเดลนี้เอาชนะ Cartesia, ElevenLabs, Qwen, ByteDance Seed, Zhipu หรือคู่แข่งทั้งหมดได้อย่างต่อเนื่องและครอบคลุมทุกกรณี
Luna-TTS พัฒนาต่อยอดจากโมเดลภาษา Qwen3-0.6B และฝึกให้ทำงานกับโทเคนเสียงในลักษณะ diffusion language model 2
แทนที่จะสร้างโทเคนเสียงถัดไปทีละตัวเหมือนระบบ TTS แบบ autoregressive ทั่วไป Luna-TTS จะนำตารางโทเคนเสียงที่ผ่านการควอนไทซ์แบบ RVQ (Residual Vector Quantization) มาสุ่มปิดบังบางส่วน จากนั้นค่อย ๆ เติมส่วนที่หายไปหลายรอบ โดยสามารถประมวลผลหลายตำแหน่งพร้อมกัน 1
4
แนวทางนี้ลดการพึ่งพาลำดับคำนำหน้าของเสียง เพราะโมเดลไม่ได้ถูกบังคับให้เดินหน้าเพียงจากโทเคนก่อนหน้าไปยังโทเคนถัดไปเท่านั้น จึงมีโอกาสลดความหน่วงของลำดับเสียงยาว และลดการสะสมของข้อผิดพลาดที่อาจไหลต่อเนื่องไปตามลำดับการสร้าง 1
3
Luna-TTS ใช้ตัวเข้ารหัสและถอดรหัสเสียงที่พัฒนาขึ้นเองในชื่อ Luna-Codec โดยข้อมูลที่เปิดเผยระบุการออกแบบที่ใช้อัตราสุ่มตัวอย่าง 24 kHz อัตราเฟรม 25 Hz และ codebooks จำนวน 8 ชุด 8
9
Codec ในระบบนี้ไม่ได้ทำหน้าที่เป็นเพียงเครื่องมือบีบอัดเสียง แต่เป็นตัวกำหนดว่าโมเดลต้องทำนายข้อมูลเสียงมากเพียงใด ต้องประมวลผลกี่เฟรมต่อวินาที และจะสร้างเสียงแบบขนานได้เร็วแค่ไหนโดยยังรักษารายละเอียดทางเสียงไว้ได้
กล่าวอีกอย่างหนึ่ง จุดเด่นของ Luna-TTS ไม่ได้มาจากโมเดลภาษาเพียงอย่างเดียว แต่เกิดจากการออกแบบโมเดลภาษา รูปแบบโทเคนเสียง และวิธีสุ่มตัวอย่าง diffusion ให้ทำงานเป็นระบบเดียวกัน
รุ่นมาตรฐานของ Luna-TTS สามารถสร้างตารางโทเคนของประโยคทั้งช่วงแบบไม่อาศัยการสร้างทีละลำดับ แต่การสนทนาแบบเรียลไทม์ต้องเริ่มเล่นเสียงก่อนที่ผู้พูดจะพูดจบทั้งประโยค
Luna-TTS Realtime จึงใช้แนวทางประนีประนอม โดยสร้างเสียง ตามลำดับระหว่างบล็อก แต่ทำ denoising แบบขนานภายในแต่ละบล็อก บล็อกหนึ่งมี 32 codec frames หรือเทียบเท่าเสียงยาว 1.28 วินาที 1
4
ระบบยังใช้ KV Cache เพื่อเก็บบริบท และทยอยส่งเสียงหลังจากบล็อกแรกพร้อมใช้งาน 1 ดังนั้น การเรียก Luna-TTS Realtime ว่า “ไม่ใช่ autoregressive โดยสมบูรณ์” อาจทำให้เข้าใจคลาดเคลื่อน คำอธิบายที่แม่นยำกว่าคือ โมเดลมีการพึ่งพาลำดับระหว่างบล็อก แต่สร้างโทเคนแบบขนานภายในบล็อก
รายงานทางเทคนิคยังอธิบายการทำ post-training ด้วย GRPO ซึ่งปรับให้เข้ากับกระบวนการ discrete masked diffusion รวมถึงการควบคุมอารมณ์และเสียงที่ไม่ใช่คำพูด เช่น น้ำเสียงหัวเราะหรือการเปล่งเสียงประกอบ 1
5
เป้าหมายจึงไม่ได้มีเพียงการทำให้ผู้ฟังฟังออก แต่ยังรวมถึงความเป็นธรรมชาติ การถ่ายทอดอารมณ์ และการทำให้เสียงสอดคล้องกับความชอบของผู้ใช้มากขึ้น
รายงานยังระบุว่า การโคลนเสียงแบบ zero-shot และการแก้ไขเสียงสามารถมองเป็นงานเติมหรือเขียนทับส่วนต่าง ๆ ของตารางโทเคนเสียงได้ 1
4 อย่างไรก็ตาม คุณภาพการโคลน ระยะเวลาของเสียงอ้างอิงที่ต้องใช้ และความเสถียรในแต่ละภาษา ยังควรประเมินจากการใช้งานจริง ไม่ควรสรุปจากสถาปัตยกรรมเพียงอย่างเดียว
รายงานของ Luna-TTS Realtime ระบุว่า ในการทดสอบระบบให้บริการภายในเครื่องหลังอุ่นระบบแล้ว โมเดลมีค่า end-to-end real-time factor หรือ RTF อยู่ที่ 0.024 และสามารถส่งบล็อกเสียงที่ถอดรหัสแล้วความยาว 1.28 วินาทีได้ภายใน 41.6 มิลลิวินาที 1
5
รายงานข่าวที่เกี่ยวข้องระบุเพิ่มเติมว่า การทดสอบใช้การ denoising ราว 8–16 ขั้นตอนบน GPU H20 จำนวน 2 ใบ 7
ตัวเลขดังกล่าวสะท้อนว่าเครื่องยนต์ประมวลผลมี throughput สูง แต่ไม่ควรตีความว่าเป็นเวลาหน่วงที่ผู้ใช้ทุกคนจะได้รับจาก API บนคลาวด์ เพราะการทดสอบใช้ฮาร์ดแวร์ การตั้งค่าขนาน ระบบที่อุ่นไว้ และโปรโตคอลการให้บริการภายในเครื่องโดยเฉพาะ
ในสถานการณ์จริงยังมีปัจจัยอย่างการส่งข้อมูลผ่านเครือข่าย คิวงาน การเตรียมข้อความ การถอดรหัสเสียง และภาระของระบบในช่วงที่มีผู้ใช้จำนวนมาก ดังนั้น 41.6 มิลลิวินาทีควรเข้าใจว่าเป็นเวลาส่งบล็อกแรกภายใต้เงื่อนไขควบคุม ไม่ใช่คำรับประกันเวลาเริ่มได้ยินเสียงสำหรับ API ทุกสภาพแวดล้อม
ผู้พัฒนารายงานว่า Luna-TTS ได้รับการฝึกด้วยข้อมูลเสียงภาษาจีน อังกฤษ ญี่ปุ่น และเกาหลีรวมประมาณ 1 ล้านชั่วโมง 1
2
ข้อมูลหลายภาษาขนาดใหญ่ช่วยให้ระบบมีโอกาสครอบคลุมการออกเสียง จังหวะการพูด และรูปแบบเสียงข้ามภาษาได้กว้างขึ้น แต่บทสรุปที่เปิดเผยต่อสาธารณะยังไม่มีรายละเอียดเพียงพอสำหรับการตรวจสอบอย่างอิสระเกี่ยวกับแหล่งที่มาของข้อมูล วิธีทำความสะอาดข้อมูล สัดส่วนของแต่ละภาษา หรือประเด็นด้านลิขสิทธิ์
ด้วยเหตุนี้ “ข้อมูลฝึก 1 ล้านชั่วโมง” จึงควรใช้เป็นคำอธิบายขนาดของชุดฝึกตามที่ผู้พัฒนารายงาน ไม่ควรนำไปสรุปต่อว่า Luna-TTS เหนือกว่าในทุกภาษา ทุกสำเนียง หรือทุกสถานการณ์ใช้งาน
จากข้อมูลที่เปิดเผย VUI Labs ไม่ได้วาง Luna-TTS เป็นเพียงโมเดลสังเคราะห์เสียงเดี่ยว ๆ แต่กำลังผลักดันหลายชั้นพร้อมกัน ได้แก่ ความสามารถของโมเดลและ API เครื่องมือเสียงสำหรับครีเอเตอร์ และแอปพลิเคชันผู้ช่วยเสียงหรือ Voice Agent
แนวทางนี้ทำให้คุณภาพเสียงเป็นเพียงส่วนหนึ่งของคุณค่าทางธุรกิจ ปัจจัยอื่นที่มีความสำคัญไม่แพ้กัน ได้แก่ การโคลนเสียง การควบคุมอารมณ์ การจัดการบทสนทนา ความหน่วง ต้นทุนการประมวลผล และการเชื่อมต่อเข้ากับระบบขององค์กร
รายงานอุตสาหกรรมระบุว่า VUI Labs มีการใช้งานในงานจัดตารางขนส่ง ประกันภัยออนไลน์ และซอฟต์แวร์ด้านการท่องเที่ยวและโรงแรม โดยลูกค้าหลายรายรวมกันมีบทสนทนาทางธุรกิจมากกว่า 1 ล้านครั้ง 6 อย่างไรก็ตาม ตัวเลขนี้เป็นคำกล่าวอ้างของบริษัทหรือผู้ให้บริการที่ถูกนำเสนอในสื่อ ยังไม่ใช่ตัวชี้วัดที่ผ่านการตรวจสอบโดยหน่วยงานอิสระ และข้อมูลสาธารณะยังไม่ได้เปิดเผยรายชื่อลูกค้า นิยามของ “บทสนทนา” ระยะเวลาการใช้งาน หรือเกณฑ์เปรียบเทียบกับผู้ให้บริการรายอื่นอย่างครบถ้วน
โครงสร้างผู้ก่อตั้งของ VUI Labs สะท้อนการจับคู่ระหว่างผู้นำด้านวิจัยเชิงวิชาการกับผู้นำด้านผลิตภัณฑ์และการทำตลาด โดยเฉียน เหยียนหมิ่นรับผิดชอบทิศทางการวิจัยด้านเสียงและ AI ขณะที่เม่ย เจี๋ยมีบทบาทด้านการพัฒนาผลิตภัณฑ์และการนำไปใช้เชิงธุรกิจ
เมื่อพิจารณาร่วมกันระหว่างรายงานทางเทคนิคและข้อมูลอันดับ จุดแข็งที่มีหลักฐานรองรับมากที่สุดมี 4 ประการ
การออกแบบเหล่านี้ช่วยอธิบายว่าเหตุใด Luna-TTS จึงไต่ขึ้นสู่อันดับสูงในชาร์ตแบบ blind listening ได้อย่างรวดเร็ว แต่ยังไม่เพียงพอที่จะพิสูจน์ว่าโมเดลเหนือกว่าคู่แข่งในด้านราคา ความเสถียรของข้อความยาว ความสม่ำเสมอของเสียง ความปลอดภัยด้านลิขสิทธิ์ ความพร้อมใช้งานของ API หรือคุณภาพในทุกภาษา
เรื่องราวหลักของ Luna-TTS มีแกนทางเทคนิคที่น่าสนใจและตรวจสอบได้ VUI Labs นำโมเดลภาษาที่ต่อยอดจาก Qwen3, discrete speech codec, masked diffusion, post-training ด้วย reinforcement learning และการสร้างเสียงแบบ blockwise streaming มาประกอบเป็นระบบ TTS แบบครบวงจร 1
Luna-TTS เคยขึ้นอันดับหนึ่งในรายงาน Hugging Face TTS Arena ช่วงเดือนสิงหาคม 2026 และเคยถูกจัดไว้ที่อันดับ 3 ในรายงาน Artificial Analysis ช่วงเวลาเดียวกัน แต่ข้อมูล snapshot ของ Artificial Analysis ณ วันที่ 1 กันยายน 2026 จัดให้โมเดลอยู่ที่อันดับ 5 8
มุมมองที่เหมาะสมจึงไม่ใช่ “Luna-TTS เอาชนะคู่แข่งทุกค่ายอย่างถาวร” แต่คือ Luna-TTS ได้กลายเป็นหนึ่งในโมเดลระดับแนวหน้าของการแข่งขัน TTS ทั่วโลก และแนวทางการสร้างเสียงแบบ diffusion พร้อมการสตรีมเป็นบล็อกก็คุ้มค่าที่จะติดตามต่อไป
สำหรับนักพัฒนาที่กำลังเลือกโมเดล ขั้นตอนถัดไปไม่ควรหยุดอยู่ที่อันดับรวมเพียงอย่างเดียว ควรทดสอบด้วยภาษาที่ต้องการใช้จริง การโคลนเสียง การควบคุมอารมณ์ เวลาเริ่มส่งเสียง ความสม่ำเสมอของข้อความยาว และต้นทุน API ในสภาพแวดล้อมจริง
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Luna TTS คือครอบครัวโมเดลแปลงข้อความเป็นเสียงหลายภาษาจาก VUI Labs ซึ่งเคยขึ้นอันดับหนึ่งในรายงานผล Hugging Face TTS Arena ช่วงเดือนสิงหาคม 2026 แต่ในภาพรวม Artificial Analysis ณ วันที่ 1 กันยายน 2026 อยู่ที่อันดับ 5 ส...
Luna TTS คือครอบครัวโมเดลแปลงข้อความเป็นเสียงหลายภาษาจาก VUI Labs ซึ่งเคยขึ้นอันดับหนึ่งในรายงานผล Hugging Face TTS Arena ช่วงเดือนสิงหาคม 2026 แต่ในภาพรวม Artificial Analysis ณ วันที่ 1 กันยายน 2026 อยู่ที่อันดับ 5 ส... จุดเด่นทางเทคนิคคือการใช้โมเดลแบบ discrete masked diffusion ที่อาศัย Qwen3 เพื่อสร้างโทเคนเสียงหลายตำแหน่งพร้อมกัน แทนการทำนายทีละโทเคนแบบ autoregressive ส่วน Luna TTS Realtime สร้างเสียงเป็นบล็อกยาว 1.28 วินาที โดยรา...
VUI Labs ก่อตั้งโดยศาสตราจารย์เฉียน เหยียนหมิ่น จากมหาวิทยาลัยเซี่ยงไฮ้เจียวทง และเม่ย เจี๋ย ผู้ประกอบการต่อเนื่อง ข้อมูลที่มีอยู่สนับสนุนแนวทางเทคนิคและอันดับในช่วงแรก แต่ยังไม่เพียงพอที่จะยืนยันว่า Luna TTS นำหน้า B...