MAI Transcribe 2 Streaming ถอดเสียงต่อเนื่องได้ 60 ภาษา ส่วน MAI Voice 2.1 และ Flash สร้างเสียงพูดจากข้อความและรองรับ 23 ภาษา ตามข้อมูลที่มีการรายงาน [1][35][36] โมเดลถอดเสียงส่งข้อความบางส่วนระหว่างที่ผู้พูดยังพูดอยู่ โดยมีรายงานเวลาเริ่มแสดงผลต่างกัน ตั้งแต่ราว 100 มิลลิวินาทีหลังรับเสียง ไปจนถึงประมาณ 320 มิลลิวิ...
เผยแพร่โดยแก้ไขด้วย GPT-6 Lunaรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
ไมโครซอฟท์เปิดตัวโมเดลเสียงตระกูล MAI ใหม่ 3 รุ่นสำหรับนักพัฒนาที่ต้องการสร้าง AI สนทนาด้วยเสียง: MAI-Transcribe-2-Streaming ถอดเสียงพูดสดเป็นข้อความ ส่วน MAI-Voice-2.1 และ MAI-Voice-2.1-Flash แปลงข้อความเป็นเสียงพูด ทั้งสามรุ่นเปิดให้ทดลองในสถานะ public preview ผ่าน Microsoft Foundry ซึ่งเป็นแพลตฟอร์มสำหรับนักพัฒนาของไมโครซอฟท์ 36
39
| โมเดล | หน้าที่หลัก | ภาษาที่มีรายงานว่ารองรับ | ราคาที่มีรายงาน |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | ถอดเสียงสด พร้อมส่งข้อความทยอยอัปเดต | 60 ภาษา และตรวจจับภาษาอัตโนมัติ | 0.54 ดอลลาร์ต่อชั่วโมงเสียง เป็นราคาเริ่มต้นถึงสิ้นปี 2026 |
| MAI-Voice-2.1 | แปลงข้อความเป็นเสียง โดยเน้นการถ่ายทอดน้ำเสียง | 23 ภาษา | 22 ดอลลาร์ต่อหนึ่งล้านตัวอักษร |
| MAI-Voice-2.1-Flash | แปลงข้อความเป็นเสียง โดยเน้นความเร็วในการตอบสนอง | 23 ภาษา ตามข้อมูลที่รายงานสำหรับโมเดลเสียง | 15 ดอลลาร์ต่อหนึ่งล้านตัวอักษร |
ตัวเลขเหล่านี้เป็นข้อมูลราคาที่มีการรายงาน ไม่ใช่การรับรองว่าราคาหรือเงื่อนไขการเข้าถึงจะคงเดิม โดยเฉพาะราคาโมเดลถอดเสียงที่ระบุว่าเป็นราคาโปรโมชัน 4
35
ระบบถอดเสียงทั่วไปอาจรอให้ผู้พูดพูดจบก่อนจึงแสดงข้อความ แต่ MAI-Transcribe-2-Streaming ส่งข้อความบางส่วนออกมาได้ในระหว่างที่เสียงยังเข้ามา โมเดลรับเสียงต่อเนื่องผ่าน WebSocket และมีรายงานว่าตรวจจับภาษาโดยอัตโนมัติได้ใน 60 ภาษา 1
รายงานเรื่องความหน่วงระบุจุดเริ่มจับเวลาต่างกัน แหล่งหนึ่งระบุว่าโมเดลเริ่มแสดงผลเบื้องต้นได้หลังรับเสียงเพียงเล็กน้อยกว่า 100 มิลลิวินาที ขณะที่อีกแหล่งระบุว่าคำเริ่มปรากฏราว 320 มิลลิวินาทีหลังพูด เนื่องจากใช้จุดเริ่มวัดคนละแบบ จึงไม่ควรนำตัวเลขทั้งสองมาเทียบกันตรง ๆ 2
4
ด้านความแม่นยำ มีรายงานว่าโมเดลเปิดตัวในอันดับ 1 บนการทดสอบถอดเสียงแบบสตรีมมิงของ Artificial Analysis โดยรายงานหนึ่งระบุค่า Word Error Rate (WER) ของข้อความฉบับสุดท้ายที่ 2.5% จากโมเดลทั้งหมด 38 รุ่น นี่เป็นผลการทดสอบที่มีการรายงาน ไม่ใช่การรับประกันผลลัพธ์ในทุกภาษา สภาพแวดล้อมการบันทึกเสียง หรือการใช้งานจริง 34
ราคาที่ระบุสำหรับช่วงโปรโมชันคือ 0.54 ดอลลาร์ต่อชั่วโมงเสียง จนถึงสิ้นปี 2026 นักพัฒนาที่กำลังประเมินต้นทุนจึงควรคำนึงว่าราคานี้มีกรอบเวลา 4
35
โมเดลทั้งคู่สร้างเสียงพูดจากข้อความ แต่เน้นคนละด้าน โดย MAI-Voice-2.1 วางตำแหน่งเป็นตัวเลือกที่ถ่ายทอดอารมณ์และน้ำเสียงได้มากกว่า ส่วน Flash เป็นรุ่นที่เน้นความเร็ว เหมาะกับงานที่ต้องลดช่วงรอก่อนเสียงตอบกลับ รายงานระบุว่าโมเดลเสียงรองรับ 23 ภาษา 6
35
36
ราคาที่มีการรายงานอยู่ที่ 22 ดอลลาร์ต่อหนึ่งล้านตัวอักษรสำหรับ MAI-Voice-2.1 และ 15 ดอลลาร์ต่อหนึ่งล้านตัวอักษรสำหรับ Flash ส่วนตัวเลขที่ว่า Flash สร้างเสียงความยาว 45 วินาทีด้วยความหน่วง 150 มิลลิวินาทีเป็นข้อมูลจากรายงาน ไม่ควรตีความว่าเป็นเวลาตอบสนองตั้งแต่ต้นจนจบที่รับประกันได้ในทุกระบบ 35
36
ข้อมูลที่มีไม่ได้แสดงคะแนนทดสอบสาธารณะที่นำคุณภาพเสียงของทั้งสองรุ่นมาเปรียบเทียบกันได้โดยตรง และอันดับความแม่นยำของโมเดลถอดเสียงก็ไม่ใช่อันดับคุณภาพของโมเดลสร้างเสียง 32
34
มีรายงานว่าโมเดลทั้งสามเปิดให้ทดลองผ่าน Microsoft Foundry ในสถานะ public preview ซึ่งเปิดโอกาสให้นักพัฒนาทดลองใช้งาน แต่ไม่เท่ากับการประกาศว่าพร้อมให้บริการทั่วไปแล้ว 36
สำหรับนักพัฒนา จุดเปลี่ยนสำคัญคือไมโครซอฟท์มีองค์ประกอบสำหรับทั้งการรับเสียงพูดและการสร้างเสียงพูดในระบบของตัวเองมากขึ้น จึงอาจช่วยให้สร้างส่วนงานเสียงของเอเจนต์สนทนาภายในระบบนิเวศของไมโครซอฟท์ได้สะดวกขึ้น และลดความจำเป็นในการหาโมเดลจากผู้ให้บริการรายอื่นสำหรับองค์ประกอบเหล่านี้ อย่างไรก็ตาม ข้อมูลนี้ไม่ได้ยืนยันว่าเอเจนต์เสียงทั้งระบบจะทำงานได้โดยไม่ใช้บริการภายนอก เพราะงานให้เหตุผล การประสานลำดับงาน และความสามารถอื่น ๆ อาจยังต้องพึ่งโมเดลหรือบริการคนละส่วน 6
39
MAI-Transcribe-2-Streaming รองรับ 60 ภาษา ส่งข้อความระหว่างพูด และมีรายงานว่าได้อันดับสูงสุดด้านความแม่นยำบน Artificial Analysis พร้อมค่า WER ของข้อความฉบับสุดท้ายที่ 2.5% ส่วนโมเดลสร้างเสียงสองรุ่นให้เลือกตามความสำคัญระหว่างการถ่ายทอดน้ำเสียงกับความเร็ว โดยมีรายงานว่ารองรับ 23 ภาษาและคิดราคาต่อจำนวนตัวอักษรที่ต่างกัน ก่อนตัดสินใจใช้งานจริง นักพัฒนาควรตรวจสอบสิทธิ์เข้าถึง ราคา และความหน่วงล่าสุดกับรูปแบบการใช้งานของตน 1
34
35
36
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
MAI Transcribe 2 Streaming ถอดเสียงต่อเนื่องได้ 60 ภาษา ส่วน MAI Voice 2.1 และ Flash สร้างเสียงพูดจากข้อความและรองรับ 23 ภาษา ตามข้อมูลที่มีการรายงาน [1][35][36]
MAI Transcribe 2 Streaming ถอดเสียงต่อเนื่องได้ 60 ภาษา ส่วน MAI Voice 2.1 และ Flash สร้างเสียงพูดจากข้อความและรองรับ 23 ภาษา ตามข้อมูลที่มีการรายงาน [1][35][36] โมเดลถอดเสียงส่งข้อความบางส่วนระหว่างที่ผู้พูดยังพูดอยู่ โดยมีรายงานเวลาเริ่มแสดงผลต่างกัน ตั้งแต่ราว 100 มิลลิวินาทีหลังรับเสียง ไปจนถึงประมาณ 320 มิลลิวินาทีหลังคำพูด [2][4]
ทั้งสามโมเดลเปิดให้ทดลองในสถานะ public preview ผ่าน Microsoft Foundry ราคาถอดเสียง 0.54 ดอลลาร์ต่อชั่วโมงเป็นราคาโปรโมชันถึงสิ้นปี 2026 [4][35][36]