В таблице Vals AI для AIME модель Gemini 3.1 Pro Preview стоит на первом месте с результатом 98,13% точности. Поэтому, если вопрос звучит узко — «какая модель лидирует именно в этом AIME-рейтингe?» — ответ достаточно прямой: Gemini 3.1 Pro Preview.
Однако этот результат не означает, что та же модель автоматически будет лучшей во всех математических сценариях: от объяснения дробей пятикласснику до длинного доказательства или программного расчета.
Разные площадки могут показывать разных лидеров. Vals AI ставит Gemini 3.1 Pro Preview первым в своем AIME-бенчмарке, а LLM Stats показывает GPT-5.2 Pro и GPT-5.2 в строках с первым местом в лидерборде AIME 2025.
Общая картина такая: верхушка рейтингов стала очень плотной. BenchLM сообщает, что лучшие модели набирают более 95% на AIME 2025 и более 90% на HMMT 2025. Когда результаты настолько близки, практическая разница для пользователя может зависеть не от долей процента в таблице, а от того, как модель объясняет ход решения, насколько часто ошибается в рассуждениях и подходит ли она под ваш формат задач.
AIME полезен как ориентир, но это не безупречная проверка «чистого» мышления. Vals AI прямо отмечает, что вопросы и ответы AIME публично доступны, поэтому есть риск, что модели встречали их на этапе предварительного обучения.
Кроме того, по данным Vals AI, модели обычно лучше справляются со старыми заданиями 2024 года, чем с более новым набором 2025 года. Это поднимает вопрос о попадании данных в обучение и о том, насколько хорошо модель обобщает решение на действительно новые задачи.
Проще говоря: высокий балл AIME — сильный сигнал, но не гарантия, что модель столь же надежно решит свежую, закрытую или нестандартно сформулированную задачу.
| Если вам нужно... | Как разумнее выбирать |
|---|---|
| Лучший результат именно в AIME среди этих источников | Начать с Gemini 3.1 Pro Preview: Vals AI ставит его первым в AIME с точностью 98,13%. |
| Подготовка к олимпиадной математике | Сравнивать результаты не только AIME, но и HMMT: BenchLM пишет, что топовые модели выше 95% на AIME 2025 и выше 90% на HMMT 2025. |
| Более широкий рейтинг математических и количественных способностей | Смотреть композитные рейтинги. LLMBase указывает, что его математический рейтинг использует индекс Artificial Analysis, включая AIME и MATH 500. |
| Проверка на другом формате продвинутой математики | Рассмотреть бенчмарки вроде FrontierMath: в Tier 4 от Epoch AI модель должна для каждого вопроса отправить Python-функцию answer(), возвращающую ответ. |
| Надежность в реальной работе | Сделать небольшой закрытый тест на собственных свежих задачах, особенно с учетом риска, что публичные задания AIME могли попасть в обучающие данные. |
Для учебы, репетиторства, олимпиадной подготовки или рабочего процесса с расчетами разумная схема такая:
Это особенно важно потому, что «математика» — слишком широкое слово. Модель может отлично отвечать на короткие олимпиадные задачи, но быть менее удобной для пошагового обучения, символьных преобразований, длинных доказательств или расчетов через код.
Для AIME-стиля самый ясный источник-backed выбор — Gemini 3.1 Pro Preview, который Vals AI ставит на первое место с точностью 98,13%.
Для более широкого вопроса «какой ИИ лучше для математики?» честный ответ осторожнее: универсального победителя источники не показывают. Топовые модели близки друг к другу на олимпиадных бенчмарках, разные рейтинги называют разных лидеров, а публичность AIME создает риск завышенных результатов из-за попадания задач в обучающие данные. Поэтому лидерборд стоит использовать как фильтр, а окончательный выбор делать на свежих задачах из вашего реального сценария.