iFLYTEK presentó Spark ASR 2.0 el 23 de septiembre de 2026. Afirma que reduce los errores de reconocimiento y redacta textos más fluidos que la versión 1.0, con un coste de inferencia aproximadamente un 10 % superior.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK presentó Spark-ASR-2.0 el 23 de septiembre de 2026 con una propuesta que va más allá de pasar voz a texto: entregar transcripciones que se lean como un texto ya pulido. Los avances frente a Spark-ASR-1.0 proceden de comparaciones difundidas por la empresa; la información disponible no permite tratarlos como resultados verificados de forma independiente. 5
6
Según iFLYTEK, Spark-ASR-2.0 reduce la tasa de error de palabras —una medida de los fallos en una transcripción—, sobre todo cuando se mezclan chino e inglés, aparecen dialectos o hay ruido de fondo. También comunica mejoras con terminología especializada, voces a bajo volumen o muy rápidas y habla infantil. Los informes del lanzamiento no permiten fijar un porcentaje general y fiable de mejora en la precisión. 5
6
El otro cambio es de estilo: el modelo utiliza el contexto para recortar expresiones redundantes y producir un texto más coherente. Eso puede resultar útil si se busca un borrador legible, pero no equivale necesariamente a una transcripción palabra por palabra. Si importa conservar exactamente lo dicho, conviene comprobar cómo trata las expresiones originales. 5
7
La empresa sitúa el coste de inferencia —el coste de ejecutar el modelo— alrededor de un 10 % por encima del de Spark-ASR-1.0. No se trata de un aumento publicado del 10 % en el precio de la API. 5
6
Los informes del lanzamiento señalan tres líneas técnicas: la colaboración entre reconocimiento no autorregresivo y procesamiento autorregresivo reforzado con un modelo de lenguaje de gran tamaño; el refuerzo conjunto de texto y audio mezclados en chino e inglés; y la incorporación dinámica de contexto. iFLYTEK relaciona el conjunto con una mejor respuesta ante cambios de idioma, dialectos, tecnicismos, condiciones acústicas difíciles y la presentación del texto. Las fuentes no separan cuánto aporta cada técnica a cada resultado. 5
6
19
Entre esas condiciones difíciles figuran el ruido intenso y la voz a bajo volumen, además del habla rápida y las voces infantiles. «Bajo volumen» no significa que el modelo pueda transcribir audio silencioso. 5
6
No hay un recuento de dialectos de Spark-ASR-2.0 bien establecido en la evidencia disponible. Un informe habla de 38 variantes de dialectos y lenguas minoritarias; otro menciona el reconocimiento de dialectos de 202 ciudades. Por separado, la documentación de iFLYTEK anuncia 202 dialectos para un servicio de transcripción en tiempo real, sin demostrar que esa cifra corresponda a Spark-ASR-2.0. No conviene convertir esas descripciones distintas en una especificación única del modelo. 3
6
17
Lo mismo ocurre con las afirmaciones de que supera a los mejores sistemas del sector en dialectos, ruido o voces a bajo volumen: son comparaciones comunicadas por la empresa, no clasificaciones establecidas mediante pruebas independientes y reproducibles. 5
6
El despliegue gradual en iFLYTEK Input Method, la aplicación de teclado de la compañía, estaba previsto a partir del 24 de septiembre de 2026. Los informes también describen acceso mediante API y una opción para probar el modelo en la plataforma abierta de iFLYTEK. Más adelante se prevén integraciones en gafas con IA, cuadernos inteligentes de oficina y productos de transcripción iFLYTEK Tingjian; esos planes no confirman que todas estén ya disponibles. 6
9
18
Como objetivos posteriores, iFLYTEK señala la capacidad de ignorar voces de personas ajenas a la conversación, editar el texto reconocido mediante instrucciones de voz y presentar resultados teniendo en cuenta la emoción. Los informes citados no ofrecen una fecha de lanzamiento verificada para esas funciones. 18
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
iFLYTEK presentó Spark ASR 2.0 el 23 de septiembre de 2026. Afirma que reduce los errores de reconocimiento y redacta textos más fluidos que la versión 1.0, con un coste de inferencia aproximadamente un 10 % superior.
iFLYTEK presentó Spark ASR 2.0 el 23 de septiembre de 2026. Afirma que reduce los errores de reconocimiento y redacta textos más fluidos que la versión 1.0, con un coste de inferencia aproximadamente un 10 % superior. Las mejoras comunicadas abarcan la mezcla de chino e inglés, dialectos, términos especializados, ruido, voz a bajo volumen o rápida y habla infantil.