Lançado em 23 de setembro de 2026, o Spark ASR 2.0 promete menos erros de transcrição e textos mais legíveis que os da versão 1.0, segundo a iFLYTEK. A empresa informa um custo de inferência cerca de 10% maior — não um reajuste anunciado de 10% no preço da API.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A iFLYTEK lançou o Spark-ASR-2.0 em 23 de setembro de 2026 com uma proposta que vai além de converter voz em palavras: entregar uma transcrição que já se pareça com um texto pronto para leitura. Na comparação com o Spark-ASR-1.0, a empresa relata menos erros de reconhecimento e melhor fluidez, mas os resultados divulgados não constituem uma avaliação independente e reproduzível. 5
6
Segundo a iFLYTEK, a taxa de erro por palavra caiu sobretudo em gravações com chinês e inglês misturados, dialetos e ruído. A empresa também aponta avanços no reconhecimento de termos técnicos, fala em volume baixo ou em ritmo acelerado e vozes de crianças. Os relatos de lançamento não permitem calcular um ganho geral confiável de precisão em pontos percentuais. 5
6
A outra mudança é no tipo de resultado. O modelo usa o contexto para reduzir redundâncias e tornar o texto mais coeso. Isso pode ser útil para quem quer uma transcrição fácil de ler, mas não equivale necessariamente a um registro palavra por palavra. Se a formulação exata do que foi dito importa, vale conferir o áudio e verificar como o sistema tratou repetições e outras marcas da fala. 5
7
Há ainda uma diferença de custo: a iFLYTEK afirma que o custo de inferência — o custo de executar o modelo — é cerca de 10% maior que o do Spark-ASR-1.0. O número não deve ser interpretado como um aumento anunciado de 10% no preço cobrado pelo uso da API. 5
6
Os relatos do lançamento citam três abordagens: a combinação de reconhecimento não autorregressivo com processamento autorregressivo apoiado por um grande modelo de linguagem; o aprimoramento conjunto de texto e áudio em chinês e inglês; e a inserção dinâmica de contexto. A iFLYTEK associa esse conjunto ao desempenho com alternância entre idiomas, dialetos, vocabulário especializado e condições acústicas difíceis, além da apresentação do texto. Os dados disponíveis não mostram quanto cada técnica contribui para cada melhora. 5
6
19
Entre as condições difíceis citadas estão ruído elevado e fala em volume baixo, além de fala rápida e vozes infantis. Volume baixo não significa ausência de áudio: não há alegação fundamentada de que o modelo transcreva silêncio. 5
6
Não há um número consolidado para o Spark-ASR-2.0. Uma reportagem menciona 38 variantes de dialetos e línguas minoritárias; outra fala no reconhecimento de dialetos de 202 cidades. Em separado, a documentação da iFLYTEK anuncia suporte a 202 dialetos em um serviço de transcrição em tempo real, sem estabelecer que essa especificação se aplica ao Spark-ASR-2.0. São descrições diferentes, que não devem ser reunidas em uma única contagem verificada para o modelo. 3
6
17
Também devem ser lidas como comparações divulgadas pela empresa, e não como rankings independentes, as afirmações de que o Spark-ASR-2.0 supera os melhores sistemas do setor com dialetos, ruído ou fala em volume baixo. 5
6
A chegada gradual ao iFLYTEK Input Method, aplicativo de digitação da empresa, estava prevista para começar em 24 de setembro de 2026. Os relatos também descrevem acesso por API e uma opção para experimentar o modelo na plataforma aberta da iFLYTEK. Integrações com óculos de IA, dispositivos inteligentes para escritório e produtos de transcrição iFLYTEK Tingjian foram anunciadas para depois; isso não confirma que todas já estejam disponíveis. 6
9
18
Para as próximas etapas, a iFLYTEK aponta três objetivos: ignorar a fala de pessoas que não sejam o usuário-alvo, permitir a edição do texto reconhecido por comandos de voz e apresentar resultados levando em conta a emoção na fala. Não há data de lançamento verificada para essas funções nos relatos citados. 18
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Lançado em 23 de setembro de 2026, o Spark ASR 2.0 promete menos erros de transcrição e textos mais legíveis que os da versão 1.0, segundo a iFLYTEK.
Lançado em 23 de setembro de 2026, o Spark ASR 2.0 promete menos erros de transcrição e textos mais legíveis que os da versão 1.0, segundo a iFLYTEK. A empresa informa um custo de inferência cerca de 10% maior — não um reajuste anunciado de 10% no preço da API.
Há relatos de melhora com fala misturada em chinês e inglês, dialetos e áudio difícil, mas não existe uma contagem de dialetos bem estabelecida para o modelo.