Importante: El nombre “M3 Pro” no aparece textualmente en el artículo de Reuters R. La evidencia solo confirma que hay un modelo de 2,7 billones de parámetros en desarrollo; su nombre final podría ser diferente.
MiniMax ha escalado rápidamente su familia de modelos:
| Modelo | Lanzamiento | Parámetros | Arquitectura | Características clave |
|---|---|---|---|---|
| MiniMax-M1 | Junio 2025 | 456B total / 45,9B activos | MoE + atención híbrida | Primer modelo de razonamiento open-weight con atención híbrida; 1M de contexto; licencia Apache 2.0; supera a DeepSeek R1 en ciertas tareas BPW |
| MiniMax-M3 | 1 de junio de 2026 | ~428B total / ~23B activos | MoE (Sparse Attention) | Codificación de frontera (59,0% en SWE-bench Pro); contexto de 1M de tokens; multimodalidad nativa (imagen, video, uso de computadora); pesos abiertos en Hugging Face BBP |
| M3 Pro (planeado) | TBD (¿Q3 2026?) | 2,7T total (probablemente MoE) | TBD | Potencialmente el modelo open-weight más grande jamás creado R |
El salto de los ~428 mil millones de parámetros del M3 a los 2,7 billones representa un incremento de ~6,3 veces en el total de parámetros. Si MiniMax continúa con su enfoque MoE (Mezcla de Expertos), la cantidad de parámetros activos por inferencia podría mantenerse en decenas o cientos de miles de millones, pero la huella total de parámetros sería sin precedentes para un modelo de peso abierto R.
DeepSeek V4 Pro es el modelo insignia de DeepSeek, lanzado el 23 de abril de 2026 D. Aquí tienes las diferencias clave:
La mayoría de los análisis señalan que MiniMax M3 y DeepSeek V4 Pro “apenas compiten”: están optimizados para diferentes cargas de trabajo. M3 es para codificación agente multimodal y tareas de contexto largo; V4 Pro es para rendimiento algorítmico de texto puro a menor costo DD.
Los laboratorios chinos han lanzado una oleada de modelos open-weight muy potentes en 2025-2026:
Esto refleja una estrategia deliberada de los laboratorios chinos de lanzar modelos como open-weight (a menudo bajo licencias Apache 2.0 o MIT), en contraste con muchos laboratorios occidentales (OpenAI, Anthropic, Google) que mantienen sus modelos de frontera cerrados RPD.
La rápida sucesión de modelos chinos open-weight envía varias señales:
Un modelo open-weight de 2,7 billones de parámetros plantea desafíos de implementación extremos:
Dicho esto, MiniMax ha demostrado una ingeniería de eficiencia sólida: M1 se entrenó con un 70% menos de cómputo que DeepSeek R1 mientras lograba benchmarks competitivos PW, y M3 usa mecanismos de atención dispersa B. Es probable que empleen innovaciones similares para el modelo de 2,7 billones.
Los modelos chinos open-weight han ganado una tracción significativa a nivel mundial por varias razones:
La tendencia indica que China ya no es solo un seguidor con limitaciones de hardware en IA: es un líder en lanzamientos de modelos open-weight, utilizando la apertura como un foso competitivo frente a los líderes occidentales de modelos cerrados. El modelo planeado de 2,7 billones, si se materializa, sería la declaración más fuerte en esa dirección.