C’est donc la réponse la mieux étayée si la question est : « quel modèle mène ce classement AIME ? ». En revanche, ce résultat ne tranche pas la question plus large de la meilleure IA pour expliquer, vérifier, enseigner ou résoudre tous les types de problèmes mathématiques.
Les classements ne racontent pas toujours la même histoire. Vals AI place Gemini 3.1 Pro Preview en tête sur son benchmark AIME, tandis que LLM Stats affiche GPT-5.2 Pro et GPT-5.2 dans des entrées de rang 1 sur son classement AIME 2025.
Le tableau d’ensemble est surtout celui d’un peloton de tête très dense. BenchLM indique que les meilleurs modèles dépassent 95 % sur AIME 2025 et 90 % sur HMMT 2025. Quand les scores sont aussi élevés, le choix pratique dépend souvent moins d’un petit écart de benchmark que de la qualité des explications, de la régularité, du coût, de la vitesse et de la capacité du modèle à traiter votre format exact de problème.
AIME reste un indicateur utile, mais ce n’est pas un test parfait de raisonnement inédit. Vals AI souligne que les questions et réponses AIME sont publiques, ce qui crée un risque que certains modèles les aient rencontrées pendant leur pré-entraînement.
Vals AI observe aussi que les modèles réussissent généralement mieux les questions plus anciennes de 2024 que l’ensemble plus récent de 2025, ce qui pose la question de la contamination des données et de la généralisation réelle. Autrement dit : un très haut score AIME montre une force sur ce benchmark, mais ne garantit pas la même fiabilité sur des problèmes nouveaux, privés ou formulés de manière inhabituelle.
| Votre besoin | Comment décider |
|---|---|
| Le meilleur résultat AIME dans les sources disponibles | Commencez par Gemini 3.1 Pro Preview, puisque Vals AI le classe premier sur AIME avec 98,13 % d’exactitude. |
| Préparation à des concours de type olympiades | Comparez les résultats AIME et HMMT : BenchLM indique que les meilleurs modèles dépassent 95 % sur AIME 2025 et 90 % sur HMMT 2025. |
| Classement plus large en raisonnement quantitatif | Regardez les classements composites : LLMBase indique que son classement mathématique utilise l’indice mathématique d’Artificial Analysis, incluant AIME et MATH 500. |
| Évaluation avancée dans un format différent | Examinez des benchmarks de type FrontierMath : le Tier 4 d’Epoch AI demande à chaque modèle de soumettre une fonction Python answer() pour chaque question. |
| Fiabilité dans votre cas concret | Construisez un petit test privé, surtout parce que les questions AIME publiques peuvent avoir été présentes dans les données d’entraînement. |
Pour des devoirs, du tutorat, une préparation de concours ou un produit qui dépend fortement des maths, utilisez les classements pour établir une présélection. Ensuite, testez les modèles sur vos propres problèmes.
Cette étape compte parce que les usages mathématiques diffèrent fortement. Un modèle excellent sur des questions courtes de concours peut ne pas être le meilleur tuteur pas à pas, le meilleur assistant de preuve ou le meilleur outil pour un workflow quantitatif avec du code.
Si vous cherchez le leader AIME dans les sources fournies, la réponse est Gemini 3.1 Pro Preview : Vals AI le classe premier avec 98,13 % d’exactitude. Si vous cherchez la meilleure IA pour toutes les maths, les données ne permettent pas de désigner un vainqueur universel : les modèles de pointe sont très proches sur les benchmarks de compétition, les classements varient selon les sites et le caractère public d’AIME impose de tester sur des problèmes frais avant de faire confiance à un score.