Muse Glimmer de Meta, lanzado el 10 de agosto de 2026, es un modelo abierto de 29.6B parámetros (licencia Apache 2.0) que funciona íntegramente en una GPU de consumo, sin necesidad de nube. Destilado del modelo cerrado Muse Spark de Meta, Glimmer está optimizado para flujos de trabajo de agentes locales y siempre ac...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Meta's Muse Glimmer, a 30-billion-parameter open-weight AI model, and what are its key features, specifications (including offline c. Article summary: I need to verify this information about a model called "Muse Glimmer" from Meta. Let me search for it. Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustra
El 10 de agosto de 2026, Meta Superintelligence Labs lanzó Muse Glimmer, un modelo de inteligencia artificial de pesos abiertos con unos ~29.6 mil millones de parámetros que se ejecuta por completo en una sola GPU de consumo, sin necesidad de conexión a la nube . Es el primer lanzamiento de código abierto de Meta en más de un año, lo que marca un regreso a sus raíces abiertas en IA tras el decepcionante lanzamiento de Llama 4
.
Muse Glimmer es un transformador causal denso (no es Mezcla de Expertos) con un codificador de percepción dedicado ViT-G/14 de ~1.8B parámetros para entrada multimodal . Cuenta con 52 capas, una dimensión oculta de 6,656 y 32 cabezas de consulta con un patrón de Atención Agrupada de Consultas 16:1
.
El modelo en precisión completa requiere ~55 GB de VRAM, pero Meta lo distribuye con cuantización de 4 bits que comprime el modelo a menos de 20 GB .
Meta distribuye dos configuraciones cuantizadas, ambas construidas con K-Quant y medidas a través de 15 puntos de referencia :
Laboratorios independientes aún no han reproducido estas cifras agregadas de degradación .
Para resolver el problema de latencia de ejecutar un modelo de 30B localmente, Meta combina Muse Glimmer con DFlash, un pequeño redactor de decodificación especulativa de cinco capas que propone bloques de 16 tokens a la vez, que el modelo principal verifica en paralelo .
Meta informa el siguiente rendimiento en el modelo cuantizado de 17 GB con tamaño de lote 1 y decodificación voraz :
| Hardware | Línea base (tok/s) | Con DFlash (tok/s) | Aceleración |
|---|---|---|---|
| NVIDIA RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M5 Max | 26.6 | 50.2 | 1.9x |
| Apple M4 Max | 23.7 | 37.8 | 1.6x |
SGLang reportó 236.4 tok/s en el mismo hardware RTX 5090 en una medición del día de lanzamiento . Las primeras pruebas independientes en una RTX 5090 con llama.cpp a veces reportan cifras más bajas (ej., ~137 tok/s), lo que sugiere que la cifra de 233+ tok/s requiere optimizaciones específicas
.
Muse Glimmer no es principalmente un chatbot — es un agente de IA local diseñado para flujos de trabajo autónomos . Meta lo ajustó explícitamente para planificar, llamar herramientas y recuperarse de sus propios errores
. Es compatible de forma nativa con el Protocolo de Contexto de Modelo (MCP) y se integra con marcos de agentes populares
.
Los casos de uso clave incluyen: llamadas a funciones, codificación local, sesiones largas de uso de herramientas, evaluación de IA como juez, análisis de documentos y asistentes personales .
Meta publicó comparaciones directas contra Gemma 4 31B de Google y Qwen 3.6 27B de Alibaba (ambos en modo de razonamiento/pensamiento) :
Muse Glimmer lidera en la mayoría de los puntos de referencia de agentes, incluyendo MCP Atlas (75.5 frente a 62.5 de Qwen) y DeepSearch QA (74.6 frente a 71.1) . También obtiene 94.7 en AIME 2026, superando a ambos competidores
.
Advertencia: Un análisis de terceros señala que Glimmer va por detrás de Qwen 3.6 27B en TerminalBench 2.1 (51.7 frente a 60.7) y OSWorld-Verified (65.9 frente a 75.6), y tiene tendencia a rechazar ciertas tareas de automatización a nivel de sistema operativo .
Muse Glimmer fue destilado de Muse Spark (el modelo frontera cerrado más grande de Meta) mediante destilación de logits durante el preentrenamiento, seguido de ajuste fino supervisado y RLHF . El propio Muse Spark permanece cerrado — disponible solo como API alojada — lo que convierte a Glimmer en la destilación de pesos abiertos para usuarios que desean una implementación local
. Meta ha indicado que podría seguir un lanzamiento abierto de Muse Spark
.
Muse Glimmer es el producto más claro hasta la fecha de la visión de Mark Zuckerberg de "superinteligencia personal": una IA potente que se ejecuta localmente en dispositivos personales, libre de costos de nube, tarifas de suscripción o de que los datos salgan del dispositivo . TechCrunch lo calificó como "la imagen más clara hasta ahora" de esa visión
.
El lanzamiento se produce después de meses de agitación interna tras el decepcionante lanzamiento de Llama 4 en la primavera de 2026, después del cual Meta pareció abandonar la IA de pesos abiertos. Muse Glimmer reabre esa estrategia .
En junio de 2025, Meta invirtió $14,300 millones de dólares en la firma de etiquetado de datos Scale AI, adquiriendo una participación de ~49% . El acuerdo trajo al CEO de Scale, Alexandr Wang, de 28 años, para liderar la nueva división de "Superinteligencia" de Meta
. La inversión tenía como objetivo asegurar datos de entrenamiento de alta calidad y talento para la familia de modelos Muse
. CNBC informó en enero de 2026 que Wang estaba liderando la unidad de IA TBD de Meta que construye un sucesor de Llama, con el nombre en clave Avocado
.
Muse Glimmer se puede descargar desde Hugging Face en meta-models/Muse-Glimmer-30B bajo la licencia Apache 2.0 . Tiene soporte desde el día de lanzamiento en:
Los primeros informes de la comunidad muestran que incluso una RTX 3090 (24 GB) puede ejecutar el modelo cuantizado Q4_K_XL con DFlash y una ventana de contexto de 262K usando aproximadamente 22-23 GB de VRAM .
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Muse Glimmer de Meta, lanzado el 10 de agosto de 2026, es un modelo abierto de 29.6B parámetros (licencia Apache 2.0) que funciona íntegramente en una GPU de consumo, sin necesidad de nube.
Muse Glimmer de Meta, lanzado el 10 de agosto de 2026, es un modelo abierto de 29.6B parámetros (licencia Apache 2.0) que funciona íntegramente en una GPU de consumo, sin necesidad de nube. Destilado del modelo cerrado Muse Spark de Meta, Glimmer está optimizado para flujos de trabajo de agentes locales y siempre activos: planificación, llamada a herramientas, recuperación de errores y comprensión multim...
Meta combina el modelo con cuantización de 4 bits (menos de 20 GB de VRAM) y decodificación especulativa DFlash, lo que permite inferencia en tiempo real en hardware desde una RTX 5090 hasta un Apple M5 Max.