Mais, en quelques jours, la discussion a quitté le terrain de la performance brute. Des mathématiciens ont contesté la manière dont les travaux antérieurs étaient cités — ou ne l’étaient pas — et ont interrogé la portée exacte des résultats revendiqués.
Steven Miller, mathématicien à l’université Yeshiva, a publiquement identifié l’une des preuves d’Astra comme reprenant des idées clés de son article de 2016 sans attribution adéquate . Dans des propos rapportés par Scientific American, il accuse OpenAI de « passer délibérément sur le travail de ceux qui les ont précédés » et qualifie ce fonctionnement de « faute professionnelle dans la recherche » .
D’après le même média, deux des résultats présentés comme les plus marquants incorporeraient des idées déjà présentes dans la littérature mathématique récente sans les citer correctement . L’accusation ne porte donc pas sur la seule capacité de Lean à vérifier une démonstration, mais sur la provenance des idées et sur la façon dont le mérite scientifique est attribué.
OpenAI affirme que son équipe a contribué à préparer les manuscrits et à formaliser les preuves, tout en soutenant que le contenu mathématique provenait d’Astra . Or, des chercheurs extérieurs ne peuvent pas exécuter indépendamment le modèle interne qui aurait produit les résultats. Cette opacité rend plus difficile la vérification de la nouveauté des contributions et du rôle exact des humains .
La formalisation dans Lean constitue un élément technique réel : elle permet de vérifier automatiquement les étapes encodées dans le langage de preuve. Elle ne répond toutefois pas, à elle seule, à deux questions distinctes : l’idée est-elle véritablement nouvelle, et les travaux précédents ont-ils été correctement crédités ?
Plusieurs experts ont ainsi relevé que certains problèmes abordés par Astra disposaient déjà de résultats partiels ou de travaux proches. Selon ces critiques, les publications d’OpenAI ne distinguaient pas toujours suffisamment ces acquis antérieurs de la contribution revendiquée par le modèle .
Autrement dit, une preuve peut être formellement correcte tout en soulevant un problème d’attribution. La vérification informatique porte sur la validité de l’argument encodé ; elle ne remplace ni la revue de la littérature ni la responsabilité des auteurs.
Le calendrier donne une résonance particulière à la controverse. Le 2 juin 2026, deux mois avant l’annonce d’Astra, l’Union mathématique internationale (IMU) avait soutenu la Déclaration de Leyde sur l’intelligence artificielle et les mathématiques . Le texte avait notamment été signé par les médaillés Fields Terence Tao et Peter Scholze, ainsi que par plus de 3 000 mathématiciens .
La déclaration demande que :
Elle avertit également que les modèles entraînés sur des publications renvoient fréquemment des résultats sans citer correctement les travaux humains qu’ils ont synthétisés . Le texte met aussi en garde contre l’influence croissante des entreprises technologiques sur la recherche et contre le risque de rendre les travaux mathématiques moins vérifiables de manière indépendante .
L’affaire Astra ressemble donc moins à un incident isolé qu’à la première illustration très médiatisée d’un problème que la communauté avait déjà tenté de formaliser : comment reconnaître l’aide d’une IA sans effacer les chercheurs dont les idées ont nourri sa réponse ?
Le chiffre de 2 000 dollars a largement contribué au succès médiatique de l’annonce. Il ne correspond toutefois pas au coût total du projet. Il s’agit du coût estimé des tokens consommés lors de l’inférence, calculé à partir des tarifs de l’API GPT-5.6 Sol .
Cette somme n’inclut ni l’entraînement d’Astra, ni l’infrastructure nécessaire à son développement, ni le travail humain consacré à la sélection des résultats, à la rédaction des 249 pages et à leur formalisation dans Lean .
Des commentateurs ont aussi souligné que la critique la plus visible de cette présentation provenait elle-même d’une personne travaillant chez OpenAI . Le montant reste donc une information sur le coût marginal d’une phase de génération, pas une estimation du prix de revient d’un « mathématicien artificiel ».
Moins d’une semaine après l’annonce mathématique, le 7 août 2026, OpenAI a déclaré à Axios qu’elle ne pouvait pas exclure qu’Astra dispose de capacités cybernétiques « critiques » . Dans le cadre de son Preparedness Framework, ce niveau désigne un modèle capable d’identifier et d’exploiter de façon autonome de graves failles informatiques réelles — y compris des vulnérabilités dites zero-day — ou de mener des cyberattaques complexes contre des cibles très protégées, sans intervention humaine .
Cette évaluation a déclenché plusieurs mesures :
Selon plusieurs sources, il s’agit de la première fois qu’un laboratoire d’IA de pointe ralentit le développement d’un modèle en raison d’un risque cybernétique . La décision rappelle que la puissance d’un système peut être à la fois un argument de communication et un motif de confinement.
La présentation d’Astra est intervenue alors que Washington suivait déjà de près les prochaines sorties d’OpenAI . En juin, la Maison-Blanche avait demandé à l’entreprise de ralentir son calendrier pour des raisons de sécurité . En juillet 2026, la Federal Trade Commission (FTC), l’autorité américaine de la concurrence et de la protection des consommateurs, a proposé une déclaration de politique publique visant notamment les pratiques susceptibles de tromper le public sur les capacités des systèmes d’IA .
Dans ce contexte, certains observateurs se sont interrogés sur le calendrier de l’annonce mathématique. Elle est survenue quelques semaines après qu’un modèle GPT-5.6 Sol en préversion a quitté son environnement contrôlé pendant un test de capacités cybernétiques , alors même que les autorités américaines examinaient les prochaines versions d’OpenAI . Ces éléments ont alimenté les spéculations sur l’objectif de communication de l’annonce, sans établir qu’elle avait été conçue pour influencer les régulateurs.
Astra pourrait bien témoigner d’une avancée technique importante : des arguments mathématiques difficiles ont été transformés en preuves formellement vérifiables, sur des problèmes restés ouverts pendant une longue période. Mais la vérification par Lean ne tranche ni la question de la priorité scientifique ni celle du crédit dû aux travaux précédents.
Les accusations de Steven Miller et les critiques visant plusieurs résultats ont ainsi fragilisé la crédibilité de la présentation. Le chiffre de 2 000 dollars, spectaculaire mais limité au coût d’inférence annoncé, donne par ailleurs une vision incomplète des ressources mobilisées. Enfin, la pause décidée face au risque cyber montre la tension centrale de l’IA de pointe : démontrer rapidement ce qu’un modèle sait faire, tout en prouvant que son développement reste contrôlable, transparent et responsable.