Muse Spark 1.3 được Meta giới thiệu là cải thiện khả năng lập trình và xử lý tác vụ agent, đồng thời dùng ít hơn khoảng 25% token so với thế hệ trước. Muse Voice Transcribe kết hợp phiên âm trực tuyến, tách người nói và phát hiện thời điểm kết thúc lượt nói trong một model thời gian thực, hỗ trợ hơn 20 người nói.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What AI products did Meta release this week, what capabilities, pricing, availability, and performance claims distinguish Muse Spark 1.3 and. Article summary: Meta released two AI products this week: Muse Spark 1.3, an update to its general reasoning model focused on coding and agents, and Muse Voice Transcribe, a hosted real-time speech-recognition model. Together they show M. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Meta vừa công bố hai sản phẩm AI phục vụ hai lớp khác nhau của hệ sinh thái: Muse Spark 1.3 tập trung vào lập trình và các tác vụ nhiều bước, còn Muse Voice Transcribe xử lý âm thanh theo thời gian thực.
Nếu Spark 1.3 là phần “suy nghĩ và hành động”, Voice Transcribe là phần “lắng nghe”. Sự kết hợp này cho thấy Meta không chỉ cạnh tranh ở chatbot, mà còn muốn xây nền tảng cho những agent có thể làm việc liên tục qua văn bản, mã nguồn và giọng nói.
Theo Meta, Muse Spark 1.3 cải thiện hiệu năng trong các tác vụ lập trình và agent, đồng thời sử dụng ít hơn khoảng 25% token so với phiên bản tiền nhiệm. 11
Mức tiết kiệm này đặc biệt đáng chú ý với các công việc đòi hỏi model phải suy luận qua nhiều bước, kiểm tra tệp, gọi công cụ hoặc tự chỉnh sửa kết quả. Ít token hơn có thể giúp giảm chi phí cho những tác vụ chạy dài, dù các tài liệu được cung cấp chưa độc lập xác minh những tuyên bố về benchmark lập trình và agent của Meta.
Spark 1.3 đang được triển khai qua Muse Code và Meta Model API. Sản phẩm được cho là vẫn giữ mức giá trước đó và mở cho người dùng thuộc nhóm contributor, nhưng thông tin hiện có không nêu mức giá cụ thể hay lịch mở rộng quyền truy cập. 12
Meta muốn biến dòng Spark thành nền tảng cho các agent cá nhân hoạt động dai dẳng, thay vì chỉ phản hồi từng câu lệnh riêng lẻ. Hướng đi này đưa Spark vào cùng cuộc đua với các hệ thống agent lập trình và tự động hóa quy trình của Google, Anthropic và OpenAI. Tuy nhiên, dữ liệu hiện có mới chứng minh rõ định hướng Meta công bố, chưa đủ để kết luận Spark 1.3 đã dẫn đầu các đối thủ. 11
12
39
42
Muse Voice Transcribe là model cảm nhận âm thanh thời gian thực đầu tiên của Meta Superintelligence Labs. Thay vì đợi một bản ghi âm kết thúc rồi mới xử lý, model có thể thực hiện ba việc trong cùng một luồng:
Meta cũng giới thiệu Voice Transcribe là model đa ngôn ngữ, có thể xử lý tình huống người nói chuyển đổi ngôn ngữ ngay giữa cuộc hội thoại. Các nguồn đưa tin cho biết model được huấn luyện trên hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ đã được xác thực cho đợt phát hành ban đầu. 1
2
Voice Transcribe có mặt trên Meta Model API, được dùng cho trải nghiệm giọng nói trong phần mềm desktop của Meta và hỗ trợ nhập liệu bằng giọng nói trong Muse Code. 3
7
10 Đây là model lưu trữ trên máy chủ và chỉ cung cấp qua API; Meta không phát hành trọng số để người dùng tự tải về.
9
Mức giá được công bố là 3 USD cho mỗi 1.000 phút âm thanh, tương đương 0,18 USD mỗi giờ. 6
9 Với mức này, Voice Transcribe có thể thu hút các ứng dụng cần đọc chính tả trực tiếp, chép biên bản cuộc họp, xây giao diện điều khiển bằng giọng nói hoặc xử lý âm thanh đa ngôn ngữ.
Trong benchmark tiếng Anh truyền trực tuyến của Artificial Analysis được các nguồn trích dẫn, Voice Transcribe đạt tỷ lệ lỗi từ khoảng 3,1%. Kết quả so sánh được nêu là 3,4% với Cartesia Ink-2, 3,6% với ElevenLabs Scribe v2 Real-time, 3,9% với OpenAI GPT Live Transcribe và 4,0% với Gemini 3.5 Transcribe Live. 9
Những con số này nên được hiểu là kết quả của một bài đánh giá cụ thể, không phải bảng xếp hạng tuyệt đối cho mọi giọng vùng miền, ngôn ngữ, loại micro hay môi trường sử dụng. Ngay cả khả năng tách người nói, vốn là điểm nhấn của sản phẩm, vẫn còn khó ổn định trên toàn ngành. 9
Điểm đáng chú ý nhất nằm ở kiến trúc: Meta gộp phiên âm, phân tách người nói và nhận diện lượt thoại vào một lần gọi model. Điều này có thể giúp nhà phát triển bớt phải ghép nhiều dịch vụ âm thanh riêng lẻ. Dù vậy, độ trễ thực tế, độ ổn định, quyền riêng tư và giới hạn khi đưa vào sản phẩm thương mại vẫn cần được kiểm chứng.
Hai đợt ra mắt diễn ra khi các phòng thí nghiệm AI lớn đồng thời cạnh tranh ở năng lực agent và hạ tầng triển khai:
Vì vậy, khác biệt của Meta không nằm ở việc công ty là bên đầu tiên có agent hay API giọng nói. Nước đi riêng của Meta là nối nhiều kênh phân phối: Muse Code cho nhà phát triển, Meta Model API cho ứng dụng, phần mềm và sản phẩm tiêu dùng để tạo lượng sử dụng, cùng các thiết bị có thể biến tương tác bằng giọng nói thành trải nghiệm liên tục.
Meta đã đồng ý chi tối đa 18 tỷ USD trong 10 năm và áp dụng các biện pháp hạn chế, an toàn nghiêm ngặt hơn đối với người dùng tuổi teen trên Facebook và Instagram trong thỏa thuận với 48 bang và vùng lãnh thổ của Mỹ liên quan đến các cáo buộc an toàn trẻ em. Một phần tổng số tiền phụ thuộc vào những cam kết tương đương từ các nền tảng đối thủ. 17
18
19
20
22
25
Thỏa thuận này không đồng nghĩa Meta sẽ dừng phát hành sản phẩm AI. Các khoản thanh toán được phân bổ theo thời gian, nhưng công ty phải đối mặt với nghĩa vụ tài chính, tuân thủ và quản trị sản phẩm lớn hơn. Thỏa thuận cũng được đặt cạnh kế hoạch chi tiêu vốn năm 2026 lên tới khoảng 145 tỷ USD, phần đáng kể liên quan đến hạ tầng AI. 27
29
Tác động rõ nhất có thể xuất hiện ở các hệ thống hướng tới người tiêu dùng — đặc biệt là agent hoạt động thường trực, ưu tiên giọng nói hoặc có thể tiếp cận người dùng trẻ. Xác minh độ tuổi, kiểm soát của phụ huynh, giới hạn sử dụng, lưu nhật ký và kiểm thử an toàn có thể trở thành những điều kiện quan trọng hơn trước khi sản phẩm được mở rộng.
Một model phiên âm chỉ dùng qua API ít chịu tác động trực tiếp hơn từ các quy định nhắm vào sản phẩm dành cho trẻ vị thành niên. Tuy nhiên, nó vẫn nằm trong khung quản trị, quyền riêng tư và niềm tin người dùng rộng hơn của Meta.
Muse Spark 1.3 và Muse Voice Transcribe tạo thành một chiến lược khá liền mạch: Spark nâng cấp lớp suy luận và lập trình, còn Voice Transcribe cung cấp lớp đầu vào thời gian thực cho các ứng dụng giọng nói.
Nhưng tuyên bố tại thời điểm ra mắt chưa đồng nghĩa với mức độ chấp nhận lâu dài. Meta vẫn phải chứng minh rằng các nhà phát triển sẽ dùng Spark cho công việc nhiều bước một cách đáng tin cậy, Voice Transcribe giữ được hiệu năng ngoài phòng benchmark, và cả hai sản phẩm tạo đủ lượng sử dụng hoặc giá trị chiến lược để biện minh cho khoản đầu tư hạ tầng và nghĩa vụ an toàn ngày càng lớn.
Hiện tại, các sản phẩm mới cho thấy Meta đang mở rộng nền tảng AI thay vì thu hẹp: hướng tới những agent có thể hành động và những giao diện có thể lắng nghe liên tục.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Muse Spark 1.3 được Meta giới thiệu là cải thiện khả năng lập trình và xử lý tác vụ agent, đồng thời dùng ít hơn khoảng 25% token so với thế hệ trước.
Muse Spark 1.3 được Meta giới thiệu là cải thiện khả năng lập trình và xử lý tác vụ agent, đồng thời dùng ít hơn khoảng 25% token so với thế hệ trước. Muse Voice Transcribe kết hợp phiên âm trực tuyến, tách người nói và phát hiện thời điểm kết thúc lượt nói trong một model thời gian thực, hỗ trợ hơn 20 người nói.
API của Voice Transcribe có giá 3 USD cho mỗi 1.000 phút âm thanh, tương đương 0,18 USD mỗi giờ; Meta không mở trọng số model.