30B 모델을 로컬에서 구동할 때 발생하는 지연 문제를 해결하기 위해, 메타는 뮤즈 글리머와 함께 DFlash를 제공한다. 이는 5개 레이어로 구성된 소형 추측 디코딩 드래프터로, 한 번에 16개 토큰 블록을 제안하면 메인 모델이 이를 병렬로 검증하는 방식이다 .
| 하드웨어 | 기본 (tok/s) | DFlash 적용 (tok/s) | 속도 향상 |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1배 |
| Apple M5 Max | 26.6 | 50.2 | 1.9배 |
| Apple M4 Max | 23.7 | 37.8 | 1.6배 |
SGLang은 별도 출시일 측정에서 동일한 RTX 5090 하드웨어에서 초당 236.4 토큰을 기록했다 . 초기 독립 테스트(예: llama.cpp 기반 RTX 5090)에서는 약 137 tok/s로 더 낮은 수치가 보고되기도 하는데, 이는 233+ tok/s 수치가 특정 최적화를 필요로 한다는 점을 시사한다
.
뮤즈 글리머는 단순한 챗봇이 아니다. 로컬 AI 에이전트로 설계되어 자율적인 워크플로를 수행한다 . 메타는 이 모델이 스스로 계획을 세우고, 도구를 호출하며, 자체 오류를 복구할 수 있도록 특별히 튜닝했다
. 또한 MCP(Model Context Protocol)를 기본 지원하며, 주요 에이전트 프레임워크와의 통합도 지원한다
.
뮤즈 글리머는 MCP Atlas(75.5 대 62.5), DeepSearch QA(74.6 대 71.1) 등 대부분의 에이전트 벤치마크에서 선두를 차지했다 . AIME 2026에서 94.7점을 기록하며 경쟁 모델을 모두 앞섰다
.
주의할 점: 한 서드파티 분석에 따르면 글리머는 터미널벤치 2.1(51.7 대 60.7)과 OSWorld-Verified(65.9 대 75.6)에서 큐원 3.6 27B에 뒤쳐지며, 특정 OS 수준 자동화 작업을 거부하는 경향이 있다 .
뮤즈 글리머는 메타의 더 크고 비공개 프론티어 모델인 **뮤즈 스파크(Muse Spark)**로부터 사전 훈련 중 로짓 증류 방식을 통해 증류되었으며, 이후 지도 미세 조정과 RLHF 과정을 거쳤다 . 뮤즈 스파크 자체는 여전히 비공개 상태로, 호스팅 API로만 이용 가능하다. 즉, 글리머는 로컬 배포를 원하는 사용자를 위한 오픈웨이트 증류 버전인 셈이다
. 메타는 향후 뮤즈 스파크를 오픈할 가능성도 시사했다
.
뮤즈 글리머는 마크 저커버그의 '개인용 슈퍼인텔리전스(personal superintelligence)' 비전을 가장 명확하게 보여주는 결과물이다. 이는 강력한 AI를 클라우드 비용, 구독료, 데이터 유출 걱정 없이 개인 기기에서 로컬로 실행하겠다는 구상이다 . TechCrunch는 이 모델을 "해당 비전의 가장 명확한 그림"이라고 평가했다
.
2025년 6월, 메타는 데이터 라벨링 기업 **스케일 AI(Scale AI)**에 143억 달러를 투자하며 약 49%의 지분을 확보했다 . 이 거래를 통해 스케일 AI의 28세 CEO **알렉산드르 왕(Alexandr Wang)**이 메타의 새로운 '슈퍼인텔리전스' 부문을 이끌게 되었다
. 이 투자는 뮤즈 모델 제품군을 위한 고품질 훈련 데이터와 인재 확보를 목표로 한 것으로 분석된다
. CNBC는 2026년 1월 보도에서 왕이 라마의 후속 모델(코드명 '아보카도')을 개발하는 메타의 TBD AI 유닛을 이끌고 있다고 전했다
.
뮤즈 글리머는 **허깅 페이스(Hugging Face)**에서 meta-models/Muse-Glimmer-30B 저장소를 통해 아파치 2.0 라이선스로 다운로드할 수 있다 . 출시일부터 다음과 같은 주요 도구 및 프레임워크를 지원한다:
초기 커뮤니티 보고에 따르면, **RTX 3090(24GB)**에서도 Q4_K_XL 양자화 모델과 DFlash, 262K 컨텍스트 윈도우를 사용해 약 22-23GB의 VRAM으로 실행할 수 있다 .