Według iFLYTEK Spark ASR 2.0 popełnia mniej błędów niż wersja 1.0 i tworzy płynniejszy tekst, przy koszcie uruchomienia wyższym o około 10%. Firma wskazuje poprawę m.in.
Opublikowane przezEdytowane za pomocą GPT-6 SolObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK zaprezentował Spark-ASR-2.0 23 września 2026 r. Nowy model rozpoznawania mowy ma nie tylko wierniej zamieniać nagranie na tekst, lecz także tworzyć zapis, który czyta się bardziej jak zredagowaną wypowiedź. Informacje o poprawie skuteczności pochodzą jednak z porównań przedstawianych przez firmę, a nie z niezależnych testów, które można odtworzyć na podstawie dostępnych danych. 5
6
Mniej błędów rozpoznawania. iFLYTEK podaje, że spadł wskaźnik błędnych słów, określany skrótem WER. Poprawa ma być szczególnie widoczna, gdy rozmówca przeplata chiński angielskim, mówi dialektem albo nagranie zawiera dużo hałasu. Firma wymienia też terminy specjalistyczne, cichy lub szybki głos oraz mowę dzieci. Dostępne relacje nie pozwalają jednak podać wiarygodnej, ogólnej wartości poprawy dokładności w punktach procentowych. 5
6
Płynniejszy zapis. Model ma wykorzystywać kontekst do ograniczania powtórzeń i porządkowania wypowiedzi. To przydatne, jeśli celem jest tekst do czytania, ale nie musi odpowiadać potrzebom osoby sporządzającej dosłowny zapis rozmowy. W takim zastosowaniu warto sprawdzić, czy system nie wygładził istotnych sformułowań. 5
7
Wyższy koszt działania. Według iFLYTEK koszt inferencji, czyli uruchamiania modelu w celu przetwarzania nagrań, jest o około 10% wyższy niż w Spark-ASR-1.0. Nie oznacza to ogłoszonej podwyżki cen API o 10%. 5
6
W relacjach z premiery wskazano trzy rozwiązania: współpracę rozpoznawania nieautoregresyjnego z przetwarzaniem autoregresyjnym wspomaganym przez duży model językowy, wspólne wzbogacanie chińsko-angielskich danych tekstowych i dźwiękowych oraz dynamiczne dodawanie kontekstu. iFLYTEK wiąże te techniki z lepszą obsługą wypowiedzi mieszających języki, dialektów, fachowego słownictwa i trudnych nagrań. Źródła nie pokazują, jaki udział w poszczególnych wynikach ma każda z technik. 5
6
19
Wśród trudnych warunków firma wymienia duży hałas i cichą mowę, a także szybkie tempo wypowiedzi i głosy dzieci. Lepsza obsługa cichej mowy nie jest deklaracją, że model potrafi odczytać dźwięk, którego nie ma w nagraniu. 5
6
Tego nie da się jednoznacznie ustalić na podstawie dostępnych materiałów. Jedna publikacja mówi o 38 odmianach dialektalnych i językach mniejszości, inna — o rozpoznawaniu dialektów z 202 chińskich miast. Z kolei dokumentacja iFLYTEK podaje liczbę 202 dialektów dla usługi transkrypcji w czasie rzeczywistym, ale nie potwierdza, że jest to specyfikacja Spark-ASR-2.0. Tych trzech opisów nie należy traktować jako jednej, zweryfikowanej liczby obsługiwanych dialektów. 3
6
17
Podobnie twierdzenia o przewadze nad najlepszymi systemami na rynku — zwłaszcza przy dialektach, hałasie i cichej mowie — pozostają porównaniami podawanymi przez firmę, a nie niezależnie potwierdzonym rankingiem. 5
6
Stopniowe udostępnianie Spark-ASR-2.0 w aplikacji klawiaturowej iFLYTEK Input Method zaplanowano od 24 września 2026 r. Relacje z premiery wskazują również na dostęp przez API i możliwość wypróbowania modelu na platformie iFLYTEK Open Platform. Późniejsze integracje mają objąć okulary AI, inteligentne notatniki biurowe oraz produkty do transkrypcji iFLYTEK Tingjian. Zapowiedź nie potwierdza, że każda z tych integracji już działa. 6
9
18
Firma wskazuje też trzy dalsze cele: pomijanie głosu osób, których wypowiedzi nie mają być zapisywane, edytowanie rozpoznanego tekstu poleceniami głosowymi oraz prezentowanie wyników z uwzględnieniem emocji. Dostępne doniesienia nie podają potwierdzonej daty wdrożenia tych funkcji. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Według iFLYTEK Spark ASR 2.0 popełnia mniej błędów niż wersja 1.0 i tworzy płynniejszy tekst, przy koszcie uruchomienia wyższym o około 10%.
Według iFLYTEK Spark ASR 2.0 popełnia mniej błędów niż wersja 1.0 i tworzy płynniejszy tekst, przy koszcie uruchomienia wyższym o około 10%. Firma wskazuje poprawę m.in. przy dialektach, terminach specjalistycznych, hałasie i cichej lub szybkiej mowie.