Selon le rapport d'OpenAI, les résultats couvrent huit domaines et incluent des preuves, des contre-exemples et des bornes améliorées :
OpenAI ne s'est pas contenté des sorties du modèle. Chaque résultat a été accompagné d'un certificat de preuve formelle Lean 4 — un fichier de preuve vérifiable par machine que tout lecteur peut contrôler indépendamment sur un ordinateur portable . Lean est un assistant de preuve qui vérifie chaque étape logique, des axiomes à la conclusion, repérant les lacunes, les erreurs de type et les incohérences . OpenAI a publié tous les fichiers Lean sur GitHub, et le nombre de « sorry » dans le dépôt — indiquant des étapes non prouvées — est nul pour les dix preuves .
Cependant, de nombreux commentateurs ont souligné que la vérification formelle a des limites importantes : Lean peut confirmer qu'un énoncé formel découle de ses définitions formelles, mais il ne peut pas certifier qu'un résumé de communiqué de presse reflète fidèlement le théorème formel, que les définitions formelles correspondent au problème souhaité par la communauté mathématique, ou que la nouveauté et le cadre historique du résultat sont corrects . Les experts doivent encore vérifier la fidélité des énoncés, les définitions, les réductions, et le pont entre l'informel et le formel .
OpenAI a révélé que le coût de calcul total pour générer les dix solutions était d'environ 2 000 $ en coûts de tokens au tarif de l'API Sol . Ce chiffre est un prix équivalent API pour les tokens de recherche de solutions uniquement — il exclut les tentatives infructueuses, les explorations parallèles et le calcul interne dépensé avant d'aboutir à un certificat . En comparaison, la bourse annuelle d'un seul doctorant en mathématiques dans une grande université peut dépasser 50 000 $, ce qui rend l'efficacité de coût l'aspect le plus frappant de l'annonce pour de nombreux observateurs .
La communauté mathématique et les chercheurs en IA ont soulevé plusieurs points de prudence :