Então, se a pergunta for bem específica — “qual modelo lidera esta tabela do AIME da Vals AI?” — a resposta é Gemini 3.1 Pro Preview. O cuidado é não transformar esse resultado em uma conclusão ampla demais.
Rankings diferentes podem apontar líderes diferentes. A Vals AI coloca o Gemini 3.1 Pro Preview em primeiro no seu benchmark AIME, enquanto o LLM Stats mostra GPT-5.2 Pro e GPT-5.2 em entradas de 1º lugar no leaderboard AIME 2025.
Além disso, os modelos de fronteira estão muito próximos em provas desse tipo. A BenchLM relata que os principais modelos ficam acima de 95% no AIME 2025 e acima de 90% no HMMT 2025. Quando a diferença é pequena, a escolha prática pode depender menos de alguns décimos no placar e mais de fatores como:
O AIME é um sinal útil, mas não é uma prova perfeita de raciocínio inédito. A própria Vals AI observa que as perguntas e respostas do AIME estão publicamente disponíveis, o que cria o risco de os modelos já terem visto esse material durante o pré-treinamento.
A Vals AI também relata que os modelos tendem a ir melhor nas questões mais antigas, de 2024, do que no conjunto mais novo de 2025, levantando dúvidas sobre contaminação de dados e generalização real. Em termos práticos: uma pontuação altíssima no AIME mostra força naquele benchmark, mas não garante a mesma confiabilidade em problemas novos, privados ou com formatos incomuns.
| Se você precisa de... | Como decidir melhor |
|---|---|
| O melhor resultado único no AIME entre estas fontes | Comece pelo Gemini 3.1 Pro Preview, porque a Vals AI o lista em primeiro no AIME, com 98,13% de acerto. |
| Treino para matemática competitiva | Compare resultados em AIME e HMMT, já que a BenchLM relata modelos de ponta acima de 95% no AIME 2025 e acima de 90% no HMMT 2025. |
| Um ranking mais amplo de raciocínio quantitativo | Veja leaderboards compostos. A LLMBase diz que seu ranking de matemática usa o índice de matemática da Artificial Analysis, incluindo AIME e MATH 500. |
| Avaliações de matemática avançada em outro formato | Considere benchmarks no estilo FrontierMath; no FrontierMath Tier 4 da Epoch AI, cada modelo precisa enviar uma função Python answer() para cada questão. |
| Confiabilidade no mundo real | Monte um pequeno teste privado, especialmente porque questões públicas do AIME podem ter aparecido nos dados de treino. |
Para estudo, tutoria, preparação para competições ou um produto que dependa de matemática, use os rankings públicos como ponto de partida — não como decisão final. Um teste simples costuma revelar mais:
Isso importa porque uma IA excelente em questões curtas de competição pode não ser a melhor para ensinar passo a passo, escrever demonstrações longas, manipular expressões simbólicas ou trabalhar com código e análise quantitativa.
Para matemática no estilo AIME, o Gemini 3.1 Pro Preview é o líder no ranking da Vals AI, com 98,13% de acerto. Para a pergunta mais ampla — “qual é a melhor IA para matemática?” — as fontes não sustentam uma campeã universal: os modelos de fronteira estão muito próximos em benchmarks competitivos, os rankings variam e o uso de questões públicas no AIME cria um bom motivo para testar com problemas novos antes de confiar demais em qualquer placar.