Ra mắt ngày 23/9/2026, Spark ASR 2.0 được iFLYTEK cho là giảm lỗi nhận dạng và tạo bản chép lời mạch lạc hơn bản 1.0, trong khi chi phí suy luận tăng khoảng 10%. Hãng nêu cải thiện ở lời nói xen tiếng Trung–Anh, phương ngữ, thuật ngữ chuyên môn và âm thanh khó nghe; chưa có con số thống nhất, được xác thực rõ ràng v...
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is iFLYTEK Spark-ASR-2.0, released on September 23, 2026, and how does it compare with Spark-ASR-1.0 in recognition accuracy, text flue. Article summary: iFLYTEK released Spark-ASR-2.0 on September 23, 2026, as an upgrade to its speech-to-text model. It aims to produce not just a more accurate transcript than Spark-ASR-1.0, but more fluent, readable text; the reported gai. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
iFLYTEK ra mắt Spark-ASR-2.0 ngày 23/9/2026. Điểm nhấn so với Spark-ASR-1.0 không chỉ là nhận đúng lời nói, mà còn biến kết quả thành đoạn văn liền mạch, dễ đọc hơn. Tuy nhiên, các mức cải thiện được đưa tin hiện là công bố của hãng, chưa phải kết quả từ một phép đánh giá độc lập có thể tái lập. 5
6
Theo thông tin ra mắt, Spark-ASR-2.0 kết hợp nhận dạng phi tự hồi quy với xử lý tự hồi quy được mô hình ngôn ngữ lớn (LLM) hỗ trợ; tăng cường kết hợp dữ liệu văn bản và âm thanh Trung–Anh; đồng thời bổ sung ngữ cảnh một cách linh hoạt. iFLYTEK gắn các cách tiếp cận này với khả năng xử lý lời nói chuyển qua lại giữa hai ngôn ngữ, phương ngữ, thuật ngữ và điều kiện âm thanh phức tạp, cũng như cách trình bày văn bản. Các nguồn hiện có không tách riêng mức đóng góp của từng kỹ thuật. 5
6
19
Những điều kiện âm thanh khó được nêu cụ thể là nhiều tiếng ồn và giọng nói nhỏ, bên cạnh nói nhanh và giọng trẻ em. “Giọng nói nhỏ” không có nghĩa mô hình có thể chép lời từ âm thanh im lặng. 5
6
Chưa có một con số được xác lập rõ cho riêng Spark-ASR-2.0. Một bài viết nói mô hình bao phủ 38 biến thể phương ngữ và ngôn ngữ dân tộc thiểu số; bài khác mô tả khả năng nhận dạng phương ngữ từ 202 thành phố. Trong khi đó, tài liệu iFLYTEK quảng bá 202 phương ngữ cho một dịch vụ chép lời thời gian thực, nhưng không xác nhận con số ấy áp dụng cho Spark-ASR-2.0. Không nên gộp ba cách mô tả này thành một thông số đã được kiểm chứng. 3
6
17
Tương tự, nhận định rằng mô hình vượt các hệ thống tốt nhất trong ngành ở bài toán phương ngữ, tiếng ồn hay giọng nói nhỏ là so sánh do hãng đưa ra, chưa phải thứ hạng được xác lập độc lập. 5
6
Spark-ASR-2.0 dự kiến bắt đầu được triển khai dần từ ngày 24/9/2026 trong iFLYTEK Input Method, tức ứng dụng bàn phím nhập liệu của hãng. Các nguồn cũng đề cập quyền truy cập qua API và một cổng dùng thử trên nền tảng mở iFLYTEK. Việc tích hợp vào kính AI, sổ ghi chép văn phòng thông minh và các sản phẩm chép lời iFLYTEK Tingjian được nêu là kế hoạch tiếp theo, không có nghĩa mọi sản phẩm đã hỗ trợ mô hình. 6
9
18
Về trải nghiệm tương lai, iFLYTEK nêu ba hướng: bỏ qua lời nói của người không liên quan, cho phép sửa văn bản đã nhận dạng bằng lệnh thoại và trình bày kết quả có xét đến cảm xúc. Chưa có ngày phát hành được xác nhận cho các khả năng này. 18
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 23/9/2026, Spark ASR 2.0 được iFLYTEK cho là giảm lỗi nhận dạng và tạo bản chép lời mạch lạc hơn bản 1.0, trong khi chi phí suy luận tăng khoảng 10%.
Ra mắt ngày 23/9/2026, Spark ASR 2.0 được iFLYTEK cho là giảm lỗi nhận dạng và tạo bản chép lời mạch lạc hơn bản 1.0, trong khi chi phí suy luận tăng khoảng 10%. Hãng nêu cải thiện ở lời nói xen tiếng Trung–Anh, phương ngữ, thuật ngữ chuyên môn và âm thanh khó nghe; chưa có con số thống nhất, được xác thực rõ ràng về số phương ngữ riêng của mô hình.