Según Xiaomi, Pro y Flash completaron 30 pasos de aprendizaje por refuerzo cada uno en menos de seis días, con costes aproximados de 2,62 millones y 850.000 dólares, respectivamente.[2] Cada actualización empleó 1.568 instrucciones y 16 intentos por instrucción: 25.088 trayectorias posibles por paso, unas 750.000 po...
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What does Xiaomi’s public MiMo-V2.6 Pro and Flash reinforcement-learning post-training dashboard show about the live runs’ steps, tokens, re. Article summary: Xiaomi’s dashboard exposed unusually detailed *post-training* reinforcement-learning telemetry for MiMo-V2.6 Pro and Flash—not their pretraining runs or a complete audit of every job on its infrastructure. The runs have . Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
El interés del panel público de Xiaomi no estaba solo en ver subir una puntuación. Permitió observar, mientras se ejecutaban, dos procesos de posentrenamiento mediante aprendizaje por refuerzo: los de MiMo-V2.6 Pro y Flash. Es una ventana a los datos que Xiaomi decidió mostrar sobre esas ejecuciones, no al preentrenamiento ni a todos los trabajos de su infraestructura.1
18
Las vistas de Pro y Flash mostraban pasos de entrenamiento completados, generaciones de intentos en curso —rollouts—, tokens procesados, curvas de recompensa, tasas de éxito en tareas, duración de los pasos, gasto acumulado y evaluaciones intermedias de programación. Los contadores de entrenamiento y de rollouts no tenían por qué coincidir: los intentos se generaban de forma asíncrona respecto a las actualizaciones del modelo.1
18
22
También aparecieron señales operativas. Diversos informes describieron reinicios, errores de memoria de GPU e incidencias con conjuntos de datos. Las definiciones de las métricas permiten distinguir los intentos fallidos por la tarea de los perdidos por problemas de infraestructura. Eso aporta contexto, pero no prueba que se publicara cada incidente.18
23
Una captura temprana situaba ambos modelos en el paso 10 de entrenamiento y señalaba el paso 16 de generación de intentos. Indicaba unos 2.200 millones de tokens por paso para Pro y 2.600 millones para Flash, con gastos acumulados cercanos a 741.000 y 322.000 dólares. Eran cifras de aquel momento: no el coste final ni una tarifa diaria estable.25
Cada actualización partía de 1.568 instrucciones, con 16 intentos por cada una: 25.088 trayectorias posibles. La generación asíncrona permitía solapar los intentos y la ejecución de tareas con su evaluación y las actualizaciones del modelo. En una misma ejecución se combinaban tareas de programación, agentes de propósito general, trabajo visual y ciberseguridad mediante distintos entornos de ejecución, o harnesses, en lugar de entrenar exclusivamente con una clase de tarea.4
10
19
La calificación tampoco se reducía a «supera la prueba» o «no la supera». El método descrito por Xiaomi combinaba resultados de pruebas ejecutables, rúbricas específicas y comparaciones entre intentos de una misma tarea para distinguir la calidad de soluciones que sí funcionaban. Evaluar esos intentos consumía recursos: un análisis del informe técnico cifra esa parte en torno al 12,7 % del coste de aprendizaje por refuerzo de Pro.44
47
La descripción inicial de «unos 2.000 millones de tokens por paso» expresaba una escala aproximada, no un cupo fijo. Los recuentos por paso comunicados posteriormente fueron mayores.4
19
20
La recompensa de entrenamiento resume las trayectorias utilizadas en una actualización; no es una prueba independiente de capacidad. Según la definición del panel, dynsam/avg@n calcula, para cada instrucción muestreada, la proporción de intentos exitosos y después promedia esas proporciones. La variante _no_infra excluye los intentos fallidos por causas de infraestructura. Compararlas ayuda a no atribuir al modelo un fallo del sistema, aunque ninguna mide su rendimiento en todas las tareas posibles.18
La captura temprana registraba en DeepSWE v1.1 62,24 para Pro y 60,77 para Flash. Eran evaluaciones intermedias. Xiaomi comunicó después resultados finales cercanos a 72,6 y 65,7, respectivamente. Esas cifras corresponden al marco de evaluación utilizado por Xiaomi: no deben presentarse como resultados de una clasificación pública reproducidos de forma independiente.25
17
45
Xiaomi afirma que cada modelo completó 30 pasos en menos de seis días, con un coste aproximado de 2,62 millones de dólares para Pro y 850.000 dólares para Flash: unos 3,47 millones entre ambos por las ejecuciones de aprendizaje por refuerzo comunicadas. La referencia a unas 750.000 trayectorias se entiende mejor por modelo: 25.088 trayectorias posibles por paso multiplicadas por 30 dan 752.640 para cada ejecución. Esos gastos no incluyen el preentrenamiento ni todo el resto del desarrollo.2
4
44
45
Lo distintivo fue publicar datos de entrenamiento y funcionamiento a lo largo del tiempo, en vez de mostrar únicamente los modelos terminados. Xiaomi anunció después los pesos de Pro y Flash, un modelo destilado de 9B, un informe técnico, más de 7.000 entornos de tareas para aprendizaje por refuerzo, un marco integral para ese entrenamiento y mini-harnesses combinables.1
15
Pero el panel no permite verificar de forma independiente que la publicación fuese continua y sin filtros, ni conocer toda la actividad simultánea de la infraestructura. Tampoco cabe deducir de la existencia del modelo destilado de 9B que hubiera tráfico de destilación no mostrado detrás de las ejecuciones de Pro y Flash, o que su coste estuviera incluido en las cifras publicadas.18
15
2
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Según Xiaomi, Pro y Flash completaron 30 pasos de aprendizaje por refuerzo cada uno en menos de seis días, con costes aproximados de 2,62 millones y 850.000 dólares, respectivamente.[2]
Según Xiaomi, Pro y Flash completaron 30 pasos de aprendizaje por refuerzo cada uno en menos de seis días, con costes aproximados de 2,62 millones y 850.000 dólares, respectivamente.[2] Cada actualización empleó 1.568 instrucciones y 16 intentos por instrucción: 25.088 trayectorias posibles por paso, unas 750.000 por modelo a lo largo de 30 pasos.[2][4]
Las puntuaciones de DeepSWE y las curvas de recompensa describen evaluaciones y tareas concretas; no demuestran por sí solas el rendimiento general del modelo ni verifican toda la actividad de la infraestructura.[18][45]