Stability AI는 이 시스템을 "생성형 오디오(generative audio) 실험 플랫폼"으로 설명하며, 특히 저작권 문제를 줄이기 위해 라이선스가 확보된 데이터셋으로 학습했다고 강조하고 있다.
또한 하나의 모델이 아니라 여러 크기의 모델을 제공하는 구조로 설계돼, 개발자는 자신의 하드웨어 환경이나 필요에 맞게 모델을 선택할 수 있다.
Stable Audio 3.0은 파라미터 규모에 따라 네 가지 모델로 구성된다.
Stable Audio 3.0 Small SFX
Stable Audio 3.0 Small
Stable Audio 3.0 Medium
Stable Audio 3.0 Large
이처럼 여러 모델을 제공하는 이유는 하드웨어 요구사항, 음질, 생성 길이 사이에서 선택할 수 있도록 하기 위해서다.
Stable Audio 3.0에서 가장 눈에 띄는 개선점 중 하나는 생성 가능한 음악 길이의 증가다.
이 길이는 이전 버전과 비교해 두 배 이상 증가한 수준으로, 짧은 루프나 클립이 아니라 실제 곡 구조를 가진 음악을 만들 수 있는 수준에 가까워졌다는 평가가 나온다.
Stability AI는 Stable Audio 3.0에서 하이브리드 배포 전략을 선택했다.
오픈 가중치 모델
이 세 모델은 개발자와 연구자가 다운로드해 로컬 환경에서 실행하거나 수정할 수 있는 형태로 제공된다.
API 전용 모델
가장 큰 모델은 API 또는 호스팅 서비스 형태로 제공되며, 공개 가중치로 배포되지는 않는다.
이는 Stability AI가 이전 모델에서도 사용했던 전략으로, 연구와 실험을 위한 공개 모델과 상업용 고성능 모델을 분리하는 접근이다.
Stability AI는 Stable Audio 3.0이 완전히 라이선스된 데이터셋으로 학습됐다고 강조한다. 이는 과거 일부 AI 음악 모델이 웹에서 수집한 음악 데이터를 사용하면서 발생했던 저작권 논란을 의식한 접근이다.
생성된 결과물에 대해서는 일반적으로 사용자가 소유권을 가지며 배포나 상업적 이용이 가능하다. 다만 라이선스 구조는 다음과 같이 구분된다.
다만 학습 데이터 구성의 세부 내용은 완전히 공개되지 않아, 외부에서 독립적으로 검증할 수 있는 정보는 제한적이라는 지적도 있다.
Stability AI는 데이터 라이선스 문제를 해결하기 위해 대형 음악 회사와 협력을 추진해 왔다.
이 협력은 생성형 음악 AI에서 가장 큰 논쟁 중 하나인 저작권 음악 데이터 사용 문제를 해결하기 위한 시도로 평가된다.
Stable Audio 3.0의 등장은 AI 음악 시장 경쟁이 빠르게 격화되는 시점에 이루어졌다.
현재 다음과 같은 기업들이 이 분야에서 경쟁하고 있다.
Stability AI는 두 가지 전략으로 차별화를 시도하고 있다.
여기에 6분 이상 길이의 곡 생성 능력까지 더해지면서, AI 음악은 이제 짧은 데모 수준을 넘어 완성된 곡 제작 도구에 가까워지고 있다는 평가가 나온다.
Stable Audio 3.0은 생성형 AI의 또 다른 흐름을 보여준다. 하나의 거대한 모델이 아니라 다양한 규모의 모델 패밀리를 제공하는 방식이다.
경량 로컬 모델부터 전문가용 대형 모델까지 선택지를 제공함으로써, 취미 제작자부터 음악 제작자까지 폭넓은 사용자를 겨냥한다.
음악 생성 AI의 품질, 길이, 라이선스 문제가 계속 개선된다면 Stable Audio 같은 시스템은 앞으로 차세대 음악 제작 소프트웨어의 핵심 기술로 자리 잡을 가능성이 있다.