마이크로소프트가 음성 기반 서비스 개발자를 겨냥한 MAI 모델 3종을 공개했습니다. MAI-Transcribe-2-Streaming은 실시간 음성을 텍스트로 바꾸고, MAI-Voice-2.1과 MAI-Voice-2.1-Flash는 텍스트를 음성으로 변환합니다. 세 모델은 Microsoft Foundry에서 공개 프리뷰로 이용할 수 있습니다.
36
39
한눈에 비교
| 모델 |
주요 기능 |
보도된 언어 지원 |
보도된 가격 |
| MAI-Transcribe-2-Streaming |
발화 중 결과를 갱신하는 실시간 음성 인식 |
60개 언어, 자동 언어 감지 |
오디오 1시간당 0.54달러. 2026년 말까지 적용되는 도입 프로모션 가격 4 35 |
| MAI-Voice-2.1 |
표현력 있는 텍스트 음성 변환(TTS) |
23개 언어 |
문자 100만 자당 22달러 35 36 |
| MAI-Voice-2.1-Flash |
응답 속도를 중시하는 텍스트 음성 변환 |
음성 모델 기준 23개 언어로 보도됨 |
문자 100만 자당 15달러 35 36 |
위 가격과 이용 조건은 보도된 모델 등록 정보를 바탕으로 한 것입니다. 특히 받아쓰기 모델의 시간당 요금은 도입 프로모션 가격으로 안내돼 장기 요금과 다를 수 있습니다.
4
35
MAI-Transcribe-2-Streaming: 말하는 동안 이어지는 받아쓰기
일반적인 받아쓰기 기능처럼 발화가 끝날 때까지 기다렸다가 결과를 내놓는 대신, 이 모델은 음성이 들어오는 동안 중간 전사 결과를 계속 전달합니다. 연속 오디오를 WebSocket으로 받아 처리하며, 모델 등록 정보에 따르면 60개 언어를 자동 감지합니다.
1
지연 시간 수치는 보도마다 기준이 다릅니다. 한 보도는 오디오를 받은 뒤 100밀리초를 조금 넘겨 부분 결과를 내기 시작한다고 설명하고, 다른 보도는 말한 뒤 약 320밀리초 만에 단어가 화면에 나타날 수 있다고 전합니다. 측정의 시작점을 서로 다르게 제시한 만큼, 두 수치를 같은 조건의 성능 비교로 보기는 어렵습니다.
2
4
Artificial Analysis의 스트리밍 받아쓰기 벤치마크에서는 정확도 1위로 처음 이름을 올렸다는 보도가 나왔습니다. 한 보도는 38개 모델 가운데 최종 단어 오류율(WER)이 2.5%였다고 전합니다. 이는 특정 벤치마크에서 나온 결과이며, 모든 언어·녹음 환경·서비스에서 같은 정확도를 보장한다는 뜻은 아닙니다.
34
가격은 오디오 1시간당 0.54달러로, 2026년 말까지의 도입 프로모션 요금으로 안내됐습니다. 개발자는 실제 서비스 비용을 계산할 때 이 기간 한정 조건을 고려해야 합니다.
4
35
MAI-Voice-2.1과 Flash: 표현력과 속도 중 선택
두 음성 모델은 모두 텍스트를 말소리로 바꾸지만, 강조점은 다릅니다. MAI-Voice-2.1은 표현력 있는 음성 생성에 초점을 두고, Flash는 대화에서 다음 응답을 기다리는 시간을 줄이려는 서비스에 적합한 빠른 버전으로 소개됐습니다. 두 모델의 언어 지원은 각각 23개 언어로 보도됐습니다.
6
35
36
보도된 가격은 MAI-Voice-2.1이 문자 100만 자당 22달러, Flash가 15달러입니다. Flash가 45초 분량의 음성을 150밀리초 지연으로 생성한다는 수치도 보도됐지만, 이를 모든 환경에서의 전체 응답 시간으로 해석해서는 안 됩니다.
35
36
현재 확인된 보도에는 두 음성 생성 모델의 음질을 서로 직접 비교할 수 있는 공개 벤치마크 점수가 없습니다. 받아쓰기 모델의 정확도 순위를 음성 생성 모델의 품질 순위로 받아들여서도 안 됩니다.
32
34
개발자가 이용할 수 있는 범위와 출시의 의미
세 모델은 Microsoft Foundry에서 공개 프리뷰로 제공되는 것으로 보도됐습니다. 공개 프리뷰는 개발자가 시험해 볼 수 있는 단계이지, 일반 정식 출시를 뜻하지는 않습니다.
36
개발자 입장에서는 마이크로소프트가 음성 인식과 음성 생성 구성 요소를 함께 제공함에 따라, 음성 에이전트의 음성 입·출력 기능을 자사 개발 생태계 안에서 조합하기가 한층 쉬워질 수 있습니다. 해당 음성 기능을 위해 다른 공급업체의 구성 요소를 별도로 찾을 필요가 줄어들 가능성도 있습니다. 다만 이 발표만으로 음성 에이전트 전체를 외부 서비스 없이 구축할 수 있다고 볼 수는 없습니다. 추론이나 작업 조정 등 다른 기능에는 별도 모델이나 서비스가 여전히 필요할 수 있습니다.
6
39
핵심 정리
가장 구체적인 비교 근거가 제시된 제품은 MAI-Transcribe-2-Streaming입니다. 60개 언어를 지원하고 발화 중 결과를 갱신하며, Artificial Analysis 평가에서 1위를 기록했다는 보도와 최종 WER 2.5%라는 수치가 있습니다. 두 음성 모델은 표현력과 속도 중 무엇을 우선할지에 따라 선택하는 구조이며, 보도된 언어 지원은 23개, 가격은 모델별로 다릅니다. 실제 도입 전에는 사용하려는 환경에서 프리뷰 접근 여부와 최신 가격, 지연 시간을 확인하는 것이 좋습니다.
1
34
35
36