Dirilis pada 23 September 2026, Spark ASR 2.0 diklaim mengurangi kesalahan pengenalan ucapan dan menghasilkan teks lebih lancar daripada versi 1.0, dengan biaya inferensi sekitar 10% lebih tinggi. Peningkatan yang dilaporkan mencakup campuran bahasa Mandarin–Inggris, dialek, istilah teknis, serta ucapan di tengah ke...
Diterbitkan olehDiedit dengan GPT-6 SolGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK meluncurkan Spark-ASR-2.0 pada 23 September 2026. Dibandingkan versi 1.0, tujuannya bukan hanya menangkap ucapan dengan lebih tepat, tetapi juga mengubahnya menjadi tulisan yang lebih runtut. Namun, angka peningkatan dan perbandingan kinerja yang beredar berasal dari klaim perusahaan, bukan pengujian independen yang dapat direproduksi. 5
6
Lebih sedikit kesalahan pengenalan. iFLYTEK melaporkan penurunan word error rate (WER), terutama untuk ucapan yang mencampur bahasa Mandarin dan Inggris, dialek, serta rekaman bising. Perusahaan juga menyebut peningkatan untuk istilah bidang khusus, suara pelan, ucapan cepat, dan suara anak-anak. Laporan peluncuran yang tersedia belum cukup untuk menetapkan satu angka kenaikan akurasi keseluruhan yang andal. 5
6
Teks lebih lancar. Spark-ASR-2.0 dirancang memakai konteks untuk memangkas ungkapan berulang dan merapikan hasil transkripsi. Itu berguna bila yang dibutuhkan adalah teks siap baca, tetapi berbeda dari transkrip kata demi kata. Untuk notula atau dokumentasi yang harus mempertahankan ucapan persis, hasilnya tetap perlu diperiksa terhadap audio. 5
7
Biaya menjalankan model naik. Menurut iFLYTEK, biaya inferensi—biaya komputasi saat model memproses permintaan—sekitar 10% lebih tinggi daripada Spark-ASR-1.0. Angka ini bukan pengumuman bahwa tarif API untuk pelanggan naik 10%. 5
6
Laporan peluncuran menyebut tiga pendekatan: kerja sama antara pengenalan non-autoregresif dan pemrosesan autoregresif yang diperkuat model bahasa besar (LLM); pengayaan bersama data teks dan audio Mandarin–Inggris; serta penyisipan konteks secara dinamis. iFLYTEK mengaitkan gabungan pendekatan itu dengan kemampuan menangani peralihan bahasa di tengah kalimat, dialek, istilah teknis, kondisi audio sulit, dan kerapian teks. Belum ada rincian yang memisahkan kontribusi masing-masing teknik terhadap tiap peningkatan. 5
6
19
Yang dimaksud kondisi audio sulit di sini mencakup kebisingan tinggi dan suara bervolume rendah, selain ucapan cepat dan suara anak-anak. Klaim untuk suara pelan tidak berarti model bisa mentranskripsikan audio yang hening. 5
6
Belum ada jumlah dialek Spark-ASR-2.0 yang dapat dipastikan dari bukti yang tersedia. Satu laporan menyebut 38 varian dialek dan bahasa minoritas, sementara laporan lain menyebut pengenalan dialek dari 202 kota. Dokumentasi iFLYTEK secara terpisah mengiklankan 202 dialek untuk layanan transkripsi waktu nyata, tetapi tidak memastikan angka itu berlaku untuk Spark-ASR-2.0. Ketiganya tidak bisa disatukan menjadi spesifikasi pasti model ini. 3
6
17
Begitu pula, pernyataan bahwa Spark-ASR-2.0 mengungguli sistem terbaik lain untuk dialek, kebisingan, atau suara pelan merupakan perbandingan yang dilaporkan dari perusahaan, bukan peringkat yang telah dibuktikan secara independen. 5
6
Peluncuran bertahap di iFLYTEK Input Method, aplikasi papan ketik perusahaan, dijadwalkan mulai 24 September 2026. Laporan juga menyebut akses API dan tempat mencoba model melalui iFLYTEK Open Platform. Integrasi ke kacamata AI, buku catatan kantor pintar, dan produk transkripsi iFLYTEK Tingjian direncanakan menyusul; itu belum berarti seluruhnya sudah tersedia. 6
9
18
Untuk pengembangan berikutnya, iFLYTEK menyebut tiga sasaran: mengabaikan ucapan dari pembicara yang tidak relevan, menyunting teks hasil pengenalan melalui perintah suara, dan menyajikan hasil dengan mempertimbangkan emosi. Belum ada tanggal rilis terverifikasi untuk kemampuan tersebut. 18
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dirilis pada 23 September 2026, Spark ASR 2.0 diklaim mengurangi kesalahan pengenalan ucapan dan menghasilkan teks lebih lancar daripada versi 1.0, dengan biaya inferensi sekitar 10% lebih tinggi.
Dirilis pada 23 September 2026, Spark ASR 2.0 diklaim mengurangi kesalahan pengenalan ucapan dan menghasilkan teks lebih lancar daripada versi 1.0, dengan biaya inferensi sekitar 10% lebih tinggi. Peningkatan yang dilaporkan mencakup campuran bahasa Mandarin–Inggris, dialek, istilah teknis, serta ucapan di tengah kebisingan atau dengan volume rendah.