iFLYTEK เปิดตัว Spark ASR 2.0 เมื่อ 23 กันยายน 2569 โดยระบุว่าถอดเสียงผิดพลาดน้อยลงและเรียบเรียงข้อความได้ลื่นไหลกว่ารุ่น 1.0 ขณะที่ต้นทุนรันโมเดลสูงขึ้นราว 10% [5][6] จุดที่บริษัทระบุว่าดีขึ้นรวมถึงเสียงจีนสลับอังกฤษ ภาษาถิ่น ศัพท์เฉพาะ เสียงรบกวน เสียงเบา พูดเร็ว และเสียงเด็ก แต่ยังไม่มีตัวเลขจำนวนภาษาถิ่นของโมเดล...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK เปิดตัว Spark-ASR-2.0 เมื่อ 23 กันยายน 2569 โดยตั้งเป้าให้ระบบรู้จำเสียงไม่ได้เพียงแปลงคำพูดเป็นตัวอักษร แต่ยังได้ข้อความที่อ่านต่อเนื่องคล้ายงานเขียนมากขึ้น อย่างไรก็ตาม ตัวเลขประสิทธิภาพและการเปรียบเทียบกับรุ่นก่อนในรายงานเปิดตัวมาจากบริษัท ไม่ใช่ผลทดสอบอิสระที่ตรวจสอบซ้ำได้ 5
6
ความแม่นยำ: iFLYTEK ระบุว่าอัตราคำผิดพลาด หรือ WER ลดลง โดยเฉพาะเสียงพูดที่สลับภาษาจีนกับอังกฤษ ภาษาถิ่น และเสียงที่มีสิ่งรบกวน บริษัทยังระบุว่ารู้จำศัพท์เฉพาะ เสียงพูดเบาหรือเร็ว และเสียงเด็กได้ดีขึ้น แต่ข้อมูลเปิดตัวที่มีอยู่ยังไม่พอจะสรุปเป็นตัวเลขว่าความแม่นยำโดยรวมเพิ่มขึ้นกี่จุดเปอร์เซ็นต์ 5
6
ความลื่นไหลของข้อความ: รุ่นใหม่ใช้บริบทช่วยตัดคำฟุ่มเฟือยและเรียบเรียงผลถอดเสียงให้อ่านง่ายขึ้น นี่ต่างจากการถอดทุกคำตามที่พูด ผู้ที่ต้องใช้บันทึกคำพูดอย่างเคร่งครัดจึงควรตรวจว่าผลลัพธ์คงถ้อยคำเดิมไว้มากน้อยเพียงใด 5
7
ต้นทุน: บริษัทระบุว่า ต้นทุนการประมวลผลเพื่อให้โมเดลสร้างผลลัพธ์ หรือ inference cost สูงกว่ารุ่น 1.0 ราว 10% ตัวเลขนี้ไม่ใช่ประกาศว่าราคา API ที่ลูกค้าจ่ายเพิ่มขึ้น 10% 5
6
รายงานเปิดตัวระบุแนวทางหลักสามส่วน ได้แก่ การทำงานร่วมกันของระบบรู้จำแบบไม่สร้างผลลัพธ์ทีละลำดับกับการประมวลผลแบบสร้างผลลัพธ์ตามลำดับที่เสริมด้วยโมเดลภาษาขนาดใหญ่ (LLM), การเพิ่มข้อมูลข้อความและเสียงภาษาจีน–อังกฤษร่วมกัน และการป้อนข้อมูลบริบทเข้าโมเดลแบบปรับเปลี่ยนได้ iFLYTEK เชื่อมโยงแนวทางเหล่านี้กับการรับมือเสียงพูดสลับภาษา ภาษาถิ่น ศัพท์เทคนิค สภาพเสียงที่ฟังยาก และการจัดข้อความให้อ่านง่าย แต่รายงานไม่ได้แยกว่ากลไกแต่ละอย่างช่วยเพิ่มประสิทธิภาพในกรณีใดมากเท่าไร 5
6
19
กรณีเสียงที่ฟังยากซึ่งระบุไว้คือ เสียงรบกวนสูงและเสียงพูดเบา รวมถึงการพูดเร็วและเสียงเด็ก คำว่า “เสียงเบา” ไม่ได้หมายความว่าโมเดลถอดเสียงจากไฟล์ที่ไม่มีเสียงพูดได้ 5
6
ยังไม่มีจำนวนที่ยืนยันได้ชัดเจนสำหรับ Spark-ASR-2.0 โดยเฉพาะ รายงานหนึ่งระบุ 38 รูปแบบของภาษาถิ่นและภาษาชนกลุ่มน้อย อีกรายงานกล่าวถึงการรู้จำภาษาถิ่นจาก 202 เมือง ส่วนเอกสารของ iFLYTEK ระบุ 202 ภาษาถิ่น สำหรับบริการถอดเสียงแบบเรียลไทม์ แต่ไม่ได้ยืนยันว่าตัวเลขนั้นเป็นสเปกของ Spark-ASR-2.0 จึงไม่ควรนำตัวเลขทั้งสามมาใช้แทนกัน 3
6
17
ทำนองเดียวกัน คำกล่าวที่ว่าโมเดลนี้เหนือกว่าระบบชั้นนำของอุตสาหกรรมด้านภาษาถิ่น เสียงรบกวน หรือเสียงพูดเบา ยังเป็นการเปรียบเทียบที่บริษัทรายงาน ไม่ใช่อันดับที่ได้รับการยืนยันอย่างอิสระ 5
6
ตามกำหนดการที่รายงานไว้ Spark-ASR-2.0 จะเริ่มทยอยเข้าสู่ iFLYTEK Input Method ตั้งแต่ 24 กันยายน 2569 และมีช่องทาง API กับจุดให้ทดลองผ่าน iFLYTEK Open Platform บริษัทวางแผนนำโมเดลไปใช้กับแว่นตา AI สมุดบันทึกสำนักงานอัจฉริยะ และผลิตภัณฑ์ถอดเสียง iFLYTEK Tingjian ในระยะต่อไป แผนเหล่านี้ไม่ได้ยืนยันว่าทุกผลิตภัณฑ์เปิดใช้แล้ว 6
9
18
สำหรับการพัฒนาถัดไป iFLYTEK ระบุเป้าหมายด้านประสบการณ์ใช้งานสามเรื่อง: ไม่รับเสียงจากผู้พูดที่ไม่เกี่ยวข้อง แก้ไขข้อความที่รู้จำแล้วด้วยคำสั่งเสียง และนำเสนอผลลัพธ์โดยคำนึงถึงอารมณ์ของผู้พูด รายงานที่อ้างถึงยังไม่ระบุวันเปิดตัวที่ยืนยันได้สำหรับความสามารถเหล่านี้ 18
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
iFLYTEK เปิดตัว Spark ASR 2.0 เมื่อ 23 กันยายน 2569 โดยระบุว่าถอดเสียงผิดพลาดน้อยลงและเรียบเรียงข้อความได้ลื่นไหลกว่ารุ่น 1.0 ขณะที่ต้นทุนรันโมเดลสูงขึ้นราว 10% [5][6]
iFLYTEK เปิดตัว Spark ASR 2.0 เมื่อ 23 กันยายน 2569 โดยระบุว่าถอดเสียงผิดพลาดน้อยลงและเรียบเรียงข้อความได้ลื่นไหลกว่ารุ่น 1.0 ขณะที่ต้นทุนรันโมเดลสูงขึ้นราว 10% [5][6] จุดที่บริษัทระบุว่าดีขึ้นรวมถึงเสียงจีนสลับอังกฤษ ภาษาถิ่น ศัพท์เฉพาะ เสียงรบกวน เสียงเบา พูดเร็ว และเสียงเด็ก แต่ยังไม่มีตัวเลขจำนวนภาษาถิ่นของโมเดลนี้ที่ยืนยันได้ชัดเจน [3][5][6][17]