샤오미의 MiMo-V2.6 공개 대시보드는 Pro와 Flash 두 모델의 강화학습(RL) 후훈련이 진행되는 동안 그 경과를 보여줬다. 완성된 모델의 점수만 발표하는 방식과 달리 훈련 중 수치와 운영 기록을 볼 수 있었다는 점이 핵심이다. 하지만 이는 샤오미가 공개한 두 훈련 작업의 기록이지, 사전훈련이나 전체 인프라 활동을 들여다보는 창은 아니다.
1
18
대시보드에는 무엇이 표시됐나
화면에는 완료된 훈련 단계와 진행 중인 롤아웃(모델이 과제를 수행하며 생성하는 시도)의 단계, 토큰 수, 보상 곡선, 과제 통과율, 단계별 소요 시간, 누적 비용, 훈련 중간의 코딩 평가 결과가 표시됐다. 롤아웃 생성과 모델 업데이트가 비동기적으로 진행돼 두 단계의 숫자는 서로 다를 수 있다.
1
18
22
재시작, GPU 메모리 부족, 데이터셋 문제 등 일부 운영상 문제도 보도됐다. 대시보드의 지표 설명은 과제 자체에 실패한 경우와 인프라 문제로 시도가 무효가 된 경우를 구분한다. 그렇다고 모든 사고가 빠짐없이 공개됐다고 단정할 수는 없다.
18
23
초기 화면을 기록한 한 자료에서는 두 모델 모두 훈련 10단계를 마쳤고 롤아웃 16단계가 진행 중이었다. 당시 단계당 토큰은 Pro 약 22억 개, Flash 약 26억 개였으며 누적 비용은 각각 약 74만 1,000달러와 32만 2,000달러였다. 이는 그 시점의 기록이지 최종 비용이나 일정한 하루 지출액이 아니다.
25
한 번의 업데이트는 어떻게 이뤄졌나
각 업데이트에는 프롬프트 1,568개가 쓰였고, 프롬프트마다 16번씩 시도했다. 모두 실행된다면 한 단계에서 25,088개의 학습 궤적이 만들어지는 구성이다. 비동기 롤아웃 방식에서는 답변 생성과 과제 수행이 채점 및 모델 업데이트와 겹쳐 진행될 수 있다. 코딩뿐 아니라 범용 에이전트, 시각, 사이버보안 과제를 여러 실행·평가 환경과 섞어 사용했다.
4
10
19
채점도 단순한 성공·실패 판정에 그치지 않았다. 샤오미가 설명한 방식은 실행 가능한 테스트 결과에 과제별 평가 기준과 동일 과제에 대한 시도 간 비교를 결합해, 성공한 답변 사이에도 품질 차이를 반영한다. 이 과정 역시 연산 자원을 쓴다. 기술 보고서를 분석한 자료에 따르면 채점은 Pro 강화학습 비용의 약 12.7%를 차지했다.
44
47
초기에 언급된 ‘단계당 약 20억 토큰’은 규모를 가늠하기 위한 수치이지 고정된 할당량이 아니다. 이후 자료에는 이보다 많은 단계당 토큰 수가 보고됐다.
4
19
20
보상·DeepSWE 점수·최종 비용은 어떻게 읽어야 하나
훈련 보상은 해당 단계의 업데이트에 사용된 학습 궤적을 평가한 값으로, 독립적인 성능 검증 결과와는 다르다. 대시보드에서 dynsam/avg@n은 표본으로 뽑은 각 프롬프트의 시도 중 성공한 비율을 구한 뒤 이를 평균한 값이다. _no_infra 지표는 인프라 문제로 실패한 시도를 제외한다. 둘을 함께 보면 실행 환경의 오류를 모델의 과제 수행 실패로 오인하는 일을 줄일 수 있지만, 어느 쪽도 모든 가능한 과제에서의 성능을 뜻하지는 않는다.
18
초기 기록의 DeepSWE v1.1 점수는 Pro 62.24, Flash 60.77이었다. 이는 훈련 중간 체크포인트의 평가 결과다. 샤오미가 이후 발표한 훈련 종료 시점의 결과는 각각 약 72.6과 65.7이다. 이 수치 역시 샤오미의 평가 설정을 전제로 읽어야 하며, 외부에서 독립적으로 재현된 공개 리더보드 성적으로 받아들여서는 안 된다.
25
17
45
샤오미에 따르면 두 모델은 각각 6일 미만에 30단계를 마쳤다. 보고된 강화학습 비용은 Pro 약 262만 달러, Flash 약 85만 달러로, 합계 약 347만 달러다. ‘약 75만 개의 학습 궤적’은 두 모델의 합계가 아니라 모델당 수치로 해석하는 것이 계산과 맞는다. 한 단계의 잠재적 궤적 25,088개에 30단계를 곱하면 모델당 752,640개다. 이 비용에는 사전훈련과 그 밖의 모든 모델 개발 작업이 포함되지 않는다.
2
4
44
45
공개 범위가 넓어졌지만, 여전히 모르는 것
이번 대시보드의 차별점은 완성된 모델만 공개한 것이 아니라 훈련 도중의 시계열 지표와 일부 운영 정보를 보여줬다는 데 있다. 이후 샤오미는 Pro·Flash 모델 가중치와 9B 증류 모델, 기술 보고서, 7,000개 이상의 강화학습 과제 환경, 강화학습 프레임워크와 조합 가능한 소형 실행·평가 도구의 공개를 발표했다.
1
15
공개 화면만으로는 데이터가 중단이나 선별 없이 계속 표시됐는지, 같은 인프라에서 진행된 다른 작업까지 모두 드러났는지 독립적으로 확인할 수 없다. 9B 증류 모델이 공개됐다는 사실만으로 대시보드 뒤에서 별도의 증류 작업이 실행됐거나 그 비용이 Pro·Flash의 보고액에 포함됐다고 추정할 수도 없다.
18
15
2