Xiaomi открыла панель, на которой во время работы двух моделей — MiMo-V2.6 Pro и Flash — были видны показатели их дообучения методом обучения с подкреплением (RL). Это редкая возможность проследить не только итоговый результат, но и ход отдельных запусков. Однако панель отражает данные, опубликованные самой Xiaomi: она не показывает предварительное обучение моделей или всю работу вычислительной инфраструктуры компании.
1
18
Что было видно на панели
Для Pro и Flash показывались завершённые шаги обучения, попытки выполнения заданий — rollouts — в процессе, количество обработанных токенов, графики вознаграждения, доля успешно выполненных задач, длительность шагов, накопленные затраты и промежуточные оценки на задачах по программированию. Счётчики обучения и попыток могли не совпадать: генерация попыток шла асинхронно, параллельно с обновлением модели.
1
18
22
Публиковались и отдельные сведения о сбоях: перезапусках, нехватке памяти графических процессоров и проблемах с данными. В описании метрик ошибки инфраструктуры отделены от неудачных решений модели. Это помогает интерпретировать графики, но не доказывает, что панель показывала каждый инцидент.
18
23
На одном из ранних снимков обе модели завершили по 10 шагов обучения, тогда как счётчик попыток показывал 16-й шаг в работе. На шаг приходилось около 2,2 млрд токенов у Pro и 2,6 млрд у Flash; накопленные затраты составляли примерно $741 тыс. и $322 тыс. Это показатели на конкретный момент, а не окончательная стоимость или постоянный темп расходов.
25
Как были устроены обучение и оценка
Каждое обновление использовало 1568 запросов с 16 попытками на каждый — всего 25 088 потенциальных траекторий. Асинхронная схема позволяла выполнять задания и генерировать ответы параллельно с их оценкой и обновлением модели. В одном запуске сочетались задачи по написанию кода, работе ИИ-агентов общего назначения, обработке визуальной информации и кибербезопасности. Для них применялись разные хarnesses — программные среды, в которых агент выполняет задание и проверяется результат.
4
10
19
Оценка не сводилась к «прошёл тест или нет». Описанный Xiaomi подход сочетал результаты исполняемых тестов с критериями качества для конкретной задачи и сравнением попыток между собой. Поэтому два успешных решения могли получить разные оценки. По изложению технического отчёта Xiaomi, на саму оценку пришлось около 12,7% затрат на RL-дообучение Pro.
44
47
Ранняя формулировка «около 2 млрд токенов на шаг» обозначала масштаб работы, а не фиксированный лимит: в более поздних описаниях число токенов на шаг было выше.
4
19
20
Что означают графики и результаты DeepSWE
Вознаграждение при обучении — не независимый тест возможностей модели. Оно относится к траекториям, использованным для обновления. Метрика dynsam/avg@n, согласно определению на панели, усредняет по выбранным запросам долю успешных попыток для каждого из них. Вариант _no_infra исключает попытки, сорвавшиеся из-за инфраструктуры. Сравнение двух значений помогает не принять технический сбой за ошибку модели, но ни одно из них не измеряет качество работы на всех возможных задачах.
18
На раннем снимке оценки DeepSWE v1.1 составляли 62,24 у Pro и 60,77 у Flash. Это были промежуточные результаты. Позднее Xiaomi сообщила об итоговых значениях около 72,6 и 65,7 соответственно. Их следует рассматривать в рамках процедуры оценки Xiaomi, а не как независимо воспроизведённые результаты публичного рейтинга.
25
17
45
По данным компании, каждый запуск завершился после 30 шагов менее чем за шесть дней. Затраты на RL-дообучение составили примерно $2,62 млн для Pro и $850 тыс. для Flash — около $3,47 млн суммарно. Указанные примерно 750 тыс. траекторий разумно читать как число для каждой модели: 25 088 потенциальных траекторий на шаг × 30 шагов = 752 640 на запуск. В эти суммы не входят предварительное обучение и все прочие работы по созданию моделей.
2
4
44
45
Что остаётся за кадром
От обычной публикации готовой модели эта панель отличалась тем, что показывала временной ряд показателей обучения и часть операционных событий ещё во время запусков. Впоследствии Xiaomi объявила о публикации весов Pro и Flash, дистиллированной модели на 9 млрд параметров, технического отчёта, более 7000 сред с задачами для RL, сквозного RL-фреймворка и модульных мини-сред для запуска задач.
1
15
Но открытость панели не равна независимому аудиту. Доступные источники не подтверждают, что поток данных шёл непрерывно и без отбора, и не раскрывают всю параллельную работу инфраструктуры. Публикация модели на 9 млрд параметров также не доказывает, что её дистилляция скрыто выполнялась рядом с показанными заданиями Pro и Flash или входила в заявленные расходы.
18
15
2