MAI Transcribe 2 Streaming chuyển lời nói thành văn bản liên tục, hỗ trợ 60 ngôn ngữ và có mức giá giới thiệu 0,54 USD mỗi giờ âm thanh. MAI Voice 2.1 ưu tiên giọng đọc giàu biểu cảm; bản Flash hướng tới tốc độ.
Đăng bởiBiên tập bằng GPT-6 LunaHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What are Microsoft’s three new in-house AI models for real-time transcription and voice generation, how do their capabilities, language supp. Article summary: Microsoft’s three models are **MAI-Transcribe-2-Streaming**, which listens and transcribes as speech arrives, and **MAI-Voice-2.1** and **MAI-Voice-2.1-Flash**, which generate spoken responses. Together, they give develo. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Ba mô hình MAI mới của Microsoft đảm nhiệm hai phần của một cuộc trò chuyện bằng giọng nói: MAI-Transcribe-2-Streaming chuyển lời nói trực tiếp thành văn bản, còn MAI-Voice-2.1 và MAI-Voice-2.1-Flash tạo giọng nói từ văn bản. Microsoft hướng bộ mô hình này tới các nhà phát triển xây dựng tác nhân giọng nói; cả ba hiện được cung cấp dưới dạng xem trước công khai trên Microsoft Foundry. 36
39
| Mô hình | Công dụng chính | Ngôn ngữ được báo cáo hỗ trợ | Giá được báo cáo |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | Chuyển lời nói trực tiếp thành văn bản, cập nhật bản chép lời trong lúc người dùng nói | 60 ngôn ngữ, tự động nhận diện ngôn ngữ | 0,54 USD mỗi giờ âm thanh; giá giới thiệu đến hết năm 2026 |
| MAI-Voice-2.1 | Chuyển văn bản thành giọng nói giàu biểu cảm | 23 ngôn ngữ | 22 USD mỗi triệu ký tự |
| MAI-Voice-2.1-Flash | Chuyển văn bản thành giọng nói nhanh hơn, phù hợp ứng dụng cần phản hồi mau | Các mô hình giọng nói được báo cáo hỗ trợ 23 ngôn ngữ | 15 USD mỗi triệu ký tự |
Đây là mức giá và thông tin được các nguồn liệt kê, không phải cam kết rằng giá hoặc khả năng cung cấp sẽ giữ nguyên. Riêng giá chuyển lời nói thành văn bản được mô tả là giá giới thiệu. 4
35
Thay vì đợi người nói kết thúc câu rồi mới trả kết quả, MAI-Transcribe-2-Streaming gửi các bản cập nhật văn bản khi âm thanh vẫn đang được truyền vào. Mô hình nhận luồng âm thanh liên tục qua WebSocket và được báo cáo là tự động nhận diện trong số 60 ngôn ngữ. 1
Các nguồn đưa ra số liệu độ trễ dựa trên những mốc đo khác nhau. Một bài viết cho biết mô hình có thể bắt đầu trả kết quả từng phần chỉ hơn 100 mili giây sau khi nhận âm thanh; một nguồn khác nói từ lúc từ ngữ được nói ra đến khi chúng bắt đầu xuất hiện là khoảng 320 mili giây. Vì điểm bắt đầu được mô tả khác nhau, không nên xem hai con số này là phép so sánh trực tiếp. 2
4
Theo các bài tường thuật về bảng đánh giá chuyển giọng nói trực tiếp của Artificial Analysis, mô hình ra mắt ở vị trí số 1 về độ chính xác. Một nguồn nêu tỷ lệ lỗi từ cuối cùng là 2,5% khi so sánh 38 mô hình. Đây là kết quả benchmark được báo cáo, không đảm bảo độ chính xác tương tự với mọi ngôn ngữ, điều kiện thu âm hay ứng dụng. 34
Mức giá giới thiệu được niêm yết là 0,54 USD cho mỗi giờ âm thanh, áp dụng đến hết năm 2026. Nhà phát triển cần tính đến việc đây là mức giá có thời hạn. 4
35
Cả hai mô hình đều biến văn bản thành âm thanh, nhưng nhắm đến những ưu tiên khác nhau. MAI-Voice-2.1 được mô tả là lựa chọn giàu biểu cảm hơn; bản Flash tập trung vào tốc độ, dành cho ứng dụng cần giảm thời gian chờ giữa các lượt hội thoại. Các nguồn cho biết hai mô hình giọng nói hỗ trợ 23 ngôn ngữ. 6
35
36
Giá được báo cáo là 22 USD cho mỗi triệu ký tự với MAI-Voice-2.1 và 15 USD với bản Flash. Một nguồn cho biết Flash tạo 45 giây âm thanh với độ trễ 150 mili giây. Nên xem đây là số liệu được báo cáo, không phải thước đo phổ quát cho tổng thời gian phản hồi từ đầu đến cuối trong mọi tình huống. 35
36
Các nguồn hiện có không đưa ra điểm benchmark công khai để so sánh trực tiếp chất lượng giọng nói của hai mô hình. Vì vậy, thứ hạng độ chính xác của mô hình chuyển lời nói thành văn bản không thể dùng để xếp hạng các mô hình tạo giọng nói. 32
34
Cả ba mô hình được báo cáo là có mặt trong chương trình xem trước công khai trên Microsoft Foundry. Giai đoạn xem trước cho phép nhà phát triển thử nghiệm, nhưng không đồng nghĩa sản phẩm đã được phát hành rộng rãi. 36
Điểm thực tế là Microsoft đang cung cấp các thành phần do hãng phát triển cho cả nhận dạng lẫn tạo giọng nói trong quy trình xây dựng tác nhân giọng nói. Điều này có thể giúp nhà phát triển thực hiện nhiều phần hơn trong hệ sinh thái công cụ của Microsoft và giảm nhu cầu tìm nhà cung cấp khác cho riêng các thành phần âm thanh đó. Tuy nhiên, thông tin này không chứng minh rằng một tác nhân giọng nói hoàn chỉnh có thể không cần dịch vụ bên ngoài: các khâu như suy luận, điều phối và những chức năng khác vẫn có thể dùng mô hình hoặc dịch vụ riêng. 6
39
Điểm so sánh rõ nhất nằm ở MAI-Transcribe-2-Streaming: mô hình hỗ trợ 60 ngôn ngữ, trả kết quả từng phần trong lúc người dùng nói và được báo cáo đứng đầu bảng độ chính xác của Artificial Analysis, với tỷ lệ lỗi từ cuối 2,5%. Hai mô hình tạo giọng nói mang đến lựa chọn giữa biểu cảm và tốc độ, với thông tin hỗ trợ 23 ngôn ngữ và mức giá khác nhau theo số ký tự. Trước khi đưa vào sản phẩm, nhà phát triển nên kiểm tra lại quyền truy cập xem trước, giá hiện hành và độ trễ trong chính cấu hình dự kiến sử dụng. 1
34
35
36
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
MAI Transcribe 2 Streaming chuyển lời nói thành văn bản liên tục, hỗ trợ 60 ngôn ngữ và có mức giá giới thiệu 0,54 USD mỗi giờ âm thanh.
MAI Transcribe 2 Streaming chuyển lời nói thành văn bản liên tục, hỗ trợ 60 ngôn ngữ và có mức giá giới thiệu 0,54 USD mỗi giờ âm thanh. MAI Voice 2.1 ưu tiên giọng đọc giàu biểu cảm; bản Flash hướng tới tốc độ. Hai mô hình được báo cáo hỗ trợ 23 ngôn ngữ, với giá lần lượt là 22 và 15 USD cho mỗi triệu ký tự.
Cả ba có mặt trong chương trình xem trước công khai của Microsoft Foundry. Chúng bổ sung các thành phần nghe và nói cho ứng dụng giọng nói, nhưng không thay thế mọi mô hình cần thiết để xây dựng một tác nhân hội thoại.