Lancé le 23 septembre 2026, Spark ASR 2.0 vise à réduire les erreurs de transcription et à produire un texte plus fluide que la version 1.0. Les progrès revendiqués concernent notamment le mélange du chinois et de l’anglais, les dialectes, le bruit, les voix faibles ou rapides et la parole des enfants.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
La nouveauté de Spark-ASR-2.0 ne tient pas seulement à la reconnaissance des mots : iFLYTEK veut aussi transformer la parole en un texte directement plus agréable à lire. Présenté le 23 septembre 2026, le modèle succède à Spark-ASR-1.0. Les gains rapportés lors de son lancement proviennent toutefois des comparaisons de l’entreprise, sans évaluation indépendante reproductible dans les éléments disponibles. 5
6
Moins d’erreurs, selon iFLYTEK. L’entreprise fait état d’une baisse du taux d’erreur sur les mots, surtout lorsque les locuteurs mêlent chinois et anglais, parlent un dialecte ou s’expriment dans le bruit. Elle signale aussi des progrès sur les termes spécialisés, les voix peu audibles, la parole rapide et celle des enfants. Aucun gain global fiable, exprimé en points de pourcentage, ne peut être établi à partir des comptes rendus disponibles. 5
6
Un texte plus fluide. En s’appuyant sur le contexte, le modèle doit supprimer certaines redondances et rendre la transcription plus cohérente. C’est utile si l’on cherche un texte prêt à relire, mais différent d’une restitution mot pour mot : pour un compte rendu qui exige une fidélité stricte aux propos tenus, il faudra vérifier le résultat. 5
7
Un coût de calcul plus élevé. iFLYTEK chiffre à environ 10 % la hausse du coût d’inférence par rapport à Spark-ASR-1.0. Il s’agit du coût annoncé pour faire fonctionner le modèle, pas d’une augmentation publiée de 10 % du tarif de l’API. 5
6
Les comptes rendus du lancement citent trois approches : la combinaison d’une reconnaissance non autorégressive avec un traitement autorégressif renforcé par un grand modèle de langage, l’enrichissement conjoint des données textuelles et audio en chinois et en anglais, et l’injection dynamique de contexte. iFLYTEK les associe à une meilleure gestion des changements de langue, des dialectes, du vocabulaire technique et des conditions acoustiques difficiles. Leur contribution respective n’est pas quantifiée. 5
6
19
Les cas évoqués comprennent un bruit important et une voix de faible volume, ainsi qu’un débit rapide et la parole des enfants. Une voix faible ne signifie pas un son absent. 5
6
Le chiffre n’est pas clairement établi pour Spark-ASR-2.0. Un article mentionne 38 variantes dialectales et de langues minoritaires ; un autre parle de dialectes de 202 villes. La documentation d’iFLYTEK annonce par ailleurs 202 dialectes pour un service de transcription en temps réel, sans démontrer que ce nombre s’applique à Spark-ASR-2.0. Ces chiffres ne doivent donc pas être présentés comme une spécification vérifiée du modèle. 3
6
17
De même, les affirmations selon lesquelles il dépasserait les meilleurs systèmes du marché pour les dialectes, le bruit ou les voix faibles restent des comparaisons rapportées par l’entreprise, et non des classements établis indépendamment. 5
6
Un déploiement progressif dans iFLYTEK Input Method, le clavier de saisie de l’entreprise, était prévu à partir du 24 septembre 2026. Les comptes rendus font aussi état d’un accès par API et d’un point d’essai sur la plateforme ouverte d’iFLYTEK. Des intégrations ultérieures sont annoncées pour ses lunettes à intelligence artificielle, ses carnets de bureau intelligents et ses produits de transcription Tingjian ; cela ne signifie pas que toutes sont déjà disponibles. 6
9
18
iFLYTEK cite enfin trois pistes d’amélioration : ignorer les personnes qui ne sont pas le locuteur visé, modifier le texte reconnu par commande vocale et présenter les résultats en tenant compte de l’émotion. Aucune date de lancement vérifiée n’est fournie pour ces fonctions. 18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Lancé le 23 septembre 2026, Spark ASR 2.0 vise à réduire les erreurs de transcription et à produire un texte plus fluide que la version 1.0.
Lancé le 23 septembre 2026, Spark ASR 2.0 vise à réduire les erreurs de transcription et à produire un texte plus fluide que la version 1.0. Les progrès revendiqués concernent notamment le mélange du chinois et de l’anglais, les dialectes, le bruit, les voix faibles ou rapides et la parole des enfants.