Em vez de divulgar apenas o resultado final, a Xiaomi abriu um painel para acompanhar duas execuções de pós-treinamento por aprendizado por reforço dos modelos MiMo-V2.6 Pro e Flash. É uma janela para essa fase específica do trabalho, não para o pré-treinamento nem para todas as atividades da infraestrutura da empresa.
1
18
O que aparecia na tela?
O painel mostrava etapas de treinamento concluídas, tentativas de execução (rollouts) em andamento, volume de tokens processados, curvas de recompensa, taxas de sucesso nas tarefas, tempo por etapa, custos acumulados e avaliações intermediárias de programação. Como a geração das tentativas ocorria de forma assíncrona, o contador de rollouts podia estar à frente do contador de atualizações do modelo.
1
18
22
Também havia sinais operacionais. Relatos sobre o painel mencionaram reinicializações, erros de falta de memória nas GPUs e problemas em conjuntos de dados. As definições das métricas distinguem tentativas malsucedidas por causa da tarefa daquelas perdidas por falhas de infraestrutura. Isso ajuda a interpretar quedas nos gráficos, mas não prova que todos os incidentes tenham sido exibidos.
18
23
Um registro inicial mostrava os dois modelos na etapa 10 de treinamento, enquanto a etapa 16 de rollouts estava em andamento. Naquele momento, os valores exibidos eram de cerca de 2,2 bilhões de tokens por etapa para Pro e 2,6 bilhões para Flash, com gastos acumulados de aproximadamente US$ 741 mil e US$ 322 mil. Eram retratos daquele instante, não custos finais nem taxas diárias estáveis.
25
Como funcionavam as etapas?
Cada atualização usava 1.568 tarefas, com 16 tentativas por tarefa — até 25.088 trajetórias por etapa. A configuração assíncrona permitia sobrepor geração, execução das tarefas, avaliação das respostas e atualizações do modelo. As execuções misturavam tarefas de programação, agentes de uso geral, atividades visuais e cibersegurança, com diferentes estruturas de execução (harnesses).
4
10
19
A avaliação não se limitava a marcar uma resposta como certa ou errada. A abordagem descrita combinava resultados de testes executáveis, critérios específicos de cada tarefa e comparações entre tentativas da mesma tarefa. Assim, duas soluções aprovadas podiam receber avaliações de qualidade diferentes. Esse processo também consumia recursos computacionais: segundo uma análise do relatório técnico da Xiaomi, a avaliação respondeu por cerca de 12,7% do custo de aprendizado por reforço do Pro.
44
47
A descrição inicial de “cerca de 2 bilhões de tokens por etapa” indicava uma ordem de grandeza, não uma cota fixa. Relatos posteriores apontam volumes maiores por etapa.
4
19
20
Como interpretar recompensas, notas e custos?
A recompensa de treinamento resume as trajetórias usadas para atualizar o modelo; não é, por si só, um teste independente de capacidade. No painel, dynsam/avg@n representa a média, entre as tarefas selecionadas, da fração de tentativas bem-sucedidas em cada uma. A variante _no_infra exclui tentativas que falharam por problemas de infraestrutura. Compará-las ajuda a não confundir uma execução interrompida com um erro do modelo — sem transformar essas métricas em medida de desempenho para qualquer tarefa possível.
18
No registro inicial, Pro e Flash apareciam com 62,24 e 60,77 no DeepSWE v1.1. Eram avaliações intermediárias. Depois, a Xiaomi informou resultados finais de aproximadamente 72,6 e 65,7, respectivamente. Essas notas devem ser lidas dentro da configuração de avaliação da empresa, não como resultados reproduzidos de forma independente em um ranking público.
25
17
45
Segundo a Xiaomi, cada modelo completou 30 etapas em menos de seis dias, com custo aproximado de US$ 2,62 milhões para Pro e US$ 850 mil para Flash — cerca de US$ 3,47 milhões pelas duas execuções relatadas. A referência a aproximadamente 750 mil trajetórias faz sentido por modelo: 25.088 trajetórias potenciais por etapa × 30 etapas = 752.640 em cada execução. Os valores divulgados se referem a esse pós-treinamento, não ao pré-treinamento ou a todo o desenvolvimento dos modelos.
2
4
44
45
O que ainda não dá para concluir?
O diferencial do painel foi expor séries de dados de treinamento e operação enquanto as execuções aconteciam. Depois, a Xiaomi anunciou os pesos dos modelos Pro e Flash, um modelo destilado de 9 bilhões de parâmetros, um relatório técnico, mais de 7 mil ambientes de tarefas para aprendizado por reforço, um framework para o processo completo e componentes menores de execução que podem ser combinados.
1
15
Essa visibilidade tem limites: as fontes disponíveis não verificam de forma independente se a transmissão foi contínua e sem filtros, nem mostram toda a atividade simultânea da infraestrutura. A existência do modelo destilado também não demonstra que houve tráfego de destilação não divulgado por trás das duas execuções exibidas ou incluído em seus custos.
18
15
2