Presentato il 23 settembre 2026, Spark ASR 2.0 punta a ridurre gli errori e a trasformare il parlato in un testo più fluido rispetto alla versione 1.0. I miglioramenti dichiarati riguardano anche parlato misto cinese inglese, dialetti, termini specialistici e audio difficili.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK ha presentato Spark-ASR-2.0 il 23 settembre 2026. La novità non è soltanto riconoscere meglio le parole: il modello è progettato per restituire una trascrizione che somigli di più a un testo già pronto da leggere. I miglioramenti riportati al lancio, però, si basano sulle dichiarazioni dell’azienda, non su test indipendenti riproducibili. 5
6
Rispetto a Spark-ASR-1.0, iFLYTEK segnala un tasso di errore nella trascrizione (WER) più basso, soprattutto quando si alternano cinese e inglese, si usano dialetti o c’è rumore di fondo. Segnala progressi anche con termini specialistici, voci poco udibili o molto rapide e parlato dei bambini. Le fonti disponibili non consentono però di quantificare un miglioramento complessivo affidabile in punti percentuali. 5
6
La seconda differenza riguarda il testo prodotto: usando il contesto, Spark-ASR-2.0 dovrebbe eliminare espressioni ridondanti e rendere le frasi più coerenti. È utile se si cerca una bozza leggibile, ma non equivale a una trascrizione parola per parola. Chi ha bisogno di un verbale fedele al parlato dovrebbe controllare che la rielaborazione non abbia modificato la formulazione originale. 5
7
Secondo iFLYTEK, il costo di inferenza — cioè il costo di esecuzione del modello — aumenta di circa il 10% rispetto alla versione 1.0. Non è una comunicazione di un rincaro del 10% per le tariffe delle API. 5
6
Le informazioni sul lancio indicano tre approcci: la collaborazione tra riconoscimento non autoregressivo ed elaborazione autoregressiva potenziata da un modello linguistico di grandi dimensioni (LLM); il miglioramento congiunto di testo e audio misti cinese-inglese; e l’inserimento dinamico del contesto. iFLYTEK collega questa combinazione ai risultati dichiarati su cambi di lingua, dialetti, lessico tecnico, condizioni acustiche difficili e forma del testo. Le fonti non misurano il contributo di ciascuna tecnica ai singoli miglioramenti. 5
6
19
Tra le condizioni difficili figurano rumore elevato e voce a basso volume, oltre al parlato veloce e a quello dei bambini. «Basso volume» non significa che il modello possa trascrivere un audio senza voce. 5
6
Non emerge un conteggio verificato per Spark-ASR-2.0. Un articolo parla di 38 varianti tra dialetti e lingue minoritarie; un altro descrive il riconoscimento di dialetti di 202 città. La documentazione iFLYTEK cita inoltre 202 dialetti per un servizio di trascrizione in tempo reale, senza chiarire che quel dato riguardi Spark-ASR-2.0. Sono indicazioni diverse, da non fondere in una specifica certa del modello. 3
6
17
Anche le affermazioni secondo cui Spark-ASR-2.0 supererebbe i migliori sistemi del settore su dialetti, rumore e voci poco udibili restano confronti attribuiti all’azienda, non classifiche confermate da valutazioni indipendenti. 5
6
L’introduzione graduale in iFLYTEK Input Method, il metodo di inserimento testuale dell’azienda, era prevista a partire dal 24 settembre 2026. Le notizie sul lancio indicano anche l’accesso tramite API e una possibilità di prova sulla piattaforma aperta di iFLYTEK. L’integrazione negli occhiali AI, nei dispositivi per gli appunti da ufficio e nei prodotti di trascrizione iFLYTEK Tingjian è prevista successivamente: non significa che ogni integrazione sia già disponibile. 6
9
18
Per il futuro, iFLYTEK indica tre obiettivi: ignorare le voci di interlocutori non pertinenti, modificare il testo riconosciuto con comandi vocali e presentare i risultati tenendo conto dell’emozione. Le fonti citate non forniscono una data di rilascio verificata per queste funzioni. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Presentato il 23 settembre 2026, Spark ASR 2.0 punta a ridurre gli errori e a trasformare il parlato in un testo più fluido rispetto alla versione 1.0.
Presentato il 23 settembre 2026, Spark ASR 2.0 punta a ridurre gli errori e a trasformare il parlato in un testo più fluido rispetto alla versione 1.0. I miglioramenti dichiarati riguardano anche parlato misto cinese inglese, dialetti, termini specialistici e audio difficili.