Stable Audio 3 là gia đình mô hình diffusion cho âm thanh (Small, Medium, Large) có thể tạo và chỉnh sửa nhạc hoặc hiệu ứng âm thanh với độ dài linh hoạt, tối đa khoảng 6 phút.[1][8] Hệ thống tạo âm thanh trong không gian latent nén bằng semantic‑acoustic autoencoder, giúp giảm chi phí tính toán và cho phép chỉnh sử...

Create a landscape editorial hero image for this Studio Global article: How does Stability AI’s new Stable Audio 3 work, what models are included in the release, what technical improvements does it introduce (suc. Article summary: Stable Audio 3 is Stability AI’s new family of fast latent-diffusion audio models for variable-length music and sound generation, with editing support such as inpainting.[1] The release includes small, medium, and large . Topic tags: general, academic, general web. Reference image context from search candidates: Reference image 1: visual subject "# Announcing Stable Audio: A Generative AI Music Service. We’re pleased to announce the release of Stable Audio, a new generative AI music service. Stable Audio is a collaboration" source context "Announcing Stable Audio: A Generative AI Music Service" Reference image 2: visual subject "## **For** **everywhere** **your
AI tạo nhạc đang phát triển rất nhanh, và Stable Audio 3 là bước tiến mới của Stability AI trong lĩnh vực này. Hệ thống được thiết kế như một gia đình mô hình diffusion cho âm thanh có thể tạo hoặc chỉnh sửa nhạc và hiệu ứng âm thanh trực tiếp từ prompt văn bản, đồng thời đủ hiệu quả để tạo đoạn audio dài nhiều phút. Điểm đáng chú ý là một số mô hình trong bộ này được phát hành với open‑weights và dữ liệu huấn luyện đã được cấp phép, giúp các nhà nghiên cứu và nhà phát triển có nền tảng để tiếp tục xây dựng công cụ mới.
Stable Audio 3 là gia đình mô hình latent diffusion dành cho tạo và chỉnh sửa âm thanh, gồm ba kích thước chính: Small, Medium và Large. Các mô hình này có thể tạo bản nhạc hoặc hiệu ứng âm thanh từ prompt, đồng thời hỗ trợ chỉnh sửa hoặc mở rộng các đoạn audio có sẵn.
Thay vì sinh trực tiếp sóng âm (waveform), hệ thống hoạt động trong không gian biểu diễn latent đã được nén của âm thanh. Cách làm này giảm đáng kể chi phí tính toán và giúp việc tạo audio dài trở nên khả thi hơn.
Hai khả năng quan trọng của hệ thống gồm:
Nhờ đó, Stable Audio 3 không chỉ tạo nhạc từ đầu mà còn có thể chỉnh sửa, tiếp nối hoặc phục hồi audio hiện có.
Stable Audio 3 dựa trên nguyên lý tương tự nhiều mô hình tạo ảnh hiện đại: diffusion model hoạt động trong không gian latent nén.
Trung tâm của hệ thống là semantic‑acoustic autoencoder, một bộ mã hóa giúp chuyển đổi âm thanh thô thành biểu diễn gọn nhẹ nhưng vẫn giữ được cả ý nghĩa âm nhạc (semantic) lẫn chi tiết âm học (acoustic).
Quy trình tổng quát gồm ba bước:
Nhờ thực hiện diffusion trong không gian nén thay vì waveform đầy đủ, hệ thống có thể tạo audio dài hơn với ít tài nguyên tính toán hơn mà vẫn giữ chất lượng âm thanh.
Một mục tiêu thiết kế quan trọng của Stable Audio 3 là khả năng tạo audio với nhiều độ dài khác nhau một cách hiệu quả.
Các mô hình hỗ trợ native variable‑length generation, nghĩa là người dùng có thể yêu cầu:
mà hệ thống không cần tính toán cho độ dài tối đa mỗi lần.
Ngoài ra, audio inpainting cho phép:
Điều này khiến Stable Audio 3 giống một công cụ chỉnh sửa audio tạo sinh (generative audio workstation) hơn là chỉ một hệ thống “prompt → bài hát”.
Stable Audio 3 được phát hành dưới dạng gia đình mô hình với nhiều kích thước, phục vụ các mục đích khác nhau.
Hai biến thể thường được nhắc đến:
Theo Stability AI, các mô hình trong bộ này có thể tạo audio dài tới khoảng 6 phút, tùy cấu hình.
Stable Audio 3 sử dụng quy trình huấn luyện nhiều giai đoạn, xoay quanh autoencoder và mô hình diffusion chính.
Khái quát pipeline:
Các tài liệu công khai xác nhận cấu trúc huấn luyện nhiều bước, nhưng chi tiết kiến trúc từng giai đoạn chưa được công bố đầy đủ trong bản tóm tắt công khai.
Một điểm đáng chú ý của Stable Audio 3 là cách tiếp cận về dữ liệu và giấy phép.
Stability AI cho biết các mô hình được huấn luyện bằng dữ liệu đã được cấp phép đầy đủ, và người dùng sở hữu các nội dung audio được tạo ra.
Các điểm chính gồm:
Cách tiếp cận này nhằm giải quyết các tranh luận đang diễn ra về quyền dữ liệu trong AI tạo sinh.
Thị trường AI tạo nhạc hiện rất cạnh tranh với các nền tảng như Suno và Udio, vốn tập trung vào trải nghiệm người dùng và khả năng tạo bài hát hoàn chỉnh có cả giọng hát.
Stable Audio 3 đi theo hướng khác.
Thay vì chỉ là một sản phẩm đóng cho người dùng cuối, Stability AI nhấn mạnh:
Cách tiếp cận này phù hợp với mục tiêu xây dựng một mô hình nền (foundation model) cho audio, cho phép nghệ sĩ, nhà phát triển và nhà nghiên cứu tạo ra các công cụ mới dựa trên nó.
Stable Audio 3 cho thấy xu hướng mới của AI âm thanh: các mô hình có thể tạo audio dài, chỉnh sửa linh hoạt và tích hợp vào quy trình sáng tạo thực tế.
Ba điểm nổi bật gồm:
Khi công nghệ trưởng thành, các kiến trúc như vậy có thể trở thành nền tảng cho thế hệ phần mềm sáng tác và workstation âm thanh mới dựa trên AI.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Stable Audio 3 là gia đình mô hình diffusion cho âm thanh (Small, Medium, Large) có thể tạo và chỉnh sửa nhạc hoặc hiệu ứng âm thanh với độ dài linh hoạt, tối đa khoảng 6 phút.[1][8]
Stable Audio 3 là gia đình mô hình diffusion cho âm thanh (Small, Medium, Large) có thể tạo và chỉnh sửa nhạc hoặc hiệu ứng âm thanh với độ dài linh hoạt, tối đa khoảng 6 phút.[1][8] Hệ thống tạo âm thanh trong không gian latent nén bằng semantic‑acoustic autoencoder, giúp giảm chi phí tính toán và cho phép chỉnh sửa từng đoạn của audio bằng inpainting.[1][2]
Stability AI định vị Stable Audio 3 như nền tảng mở cho nhà phát triển với open‑weights, dữ liệu huấn luyện được cấp phép và quyền thương mại hóa đầu ra.[4][8]