Der aufmerksamkeitsstärkste Teil der Präsentation war jedoch die Kostenangabe: Die benötigte Inferenz, also die Berechnung zur Erzeugung der Lösungen, habe nach GPT-5.6-Sol-API-Preisen ungefähr 2.000 Dollar gekostet .
Wenige Tage später war die Geschichte allerdings nicht mehr nur eine über technische Leistungsfähigkeit. Mathematiker stellten die Quellenangaben, die tatsächliche Neuheit einzelner Ergebnisse und die Transparenz des gesamten Prozesses infrage.
Der Mathematiker Steven Miller von der Yeshiva University identifizierte öffentlich einen Astra-Beweis, der zentrale Ideen aus seiner Arbeit von 2016 ohne angemessene Quellenangabe übernommen haben soll . Gegenüber Scientific American sagte Miller, OpenAI gehe „bewusst rücksichtslos“ mit der Arbeit früherer Forschender um, und bezeichnete das Muster als „wissenschaftliches Fehlverhalten“ .
Nach der Berichterstattung von Scientific American enthielten mindestens zwei der besonders hervorgehobenen Astra-Ergebnisse bereits bekannte Ideen aus der jüngeren mathematischen Literatur, ohne diese korrekt einzuordnen oder zu zitieren . Dabei halfen OpenAI-Mitarbeitende bei der Ausarbeitung der Manuskripte und bei der Formalisierung der Beweise in Lean. Das Unternehmen betonte dennoch, der mathematische Inhalt stamme von Astra .
Ein zentraler Transparenzmangel bleibt: Außenstehende können das Modell, das die Ergebnisse erzeugt hat, nicht unabhängig ausführen. Damit lässt sich nur eingeschränkt überprüfen, wie eigenständig die Lösungswege tatsächlich entstanden sind . Die Vorwürfe sind keine abschließende Feststellung eines Fehlverhaltens, betreffen aber einen Kern wissenschaftlicher Arbeit: Wer eine Idee entwickelt hat, muss erkennbar bleiben.
Am 2. Juni 2026 – rund zwei Monate vor der Astra-Ankündigung – unterstützte die International Mathematical Union (IMU) die Leiden-Erklärung zu künstlicher Intelligenz und Mathematik . Zu den Unterzeichnern zählen die Fields-Medaillenträger Terence Tao und Peter Scholze sowie mehr als 3.000 Mathematikerinnen und Mathematiker .
Die Erklärung fordert unter anderem:
Die Warnung ist grundsätzlicher als die Frage, ob Astra einzelne Beweise korrekt formalisiert hat. Modelle, die mit veröffentlichten Arbeiten trainiert wurden, können Ideen aus diesen Texten wiedergeben oder kombinieren, ohne die menschlichen Urheber angemessen zu nennen . Zugleich erschwert die wachsende Rolle von Technologieunternehmen die unabhängige Überprüfung mathematischer Forschung .
Genau an dieser Schnittstelle entzündet sich die Kritik an Astra: Ein maschinengeprüfter Beweis kann formal korrekt sein und trotzdem die wissenschaftliche Herkunft seiner entscheidenden Ideen unzureichend darstellen.
Die 2.000-Dollar-Angabe klingt zunächst so, als habe OpenAI zehn schwierige Forschungsprobleme zu einem geradezu lächerlich niedrigen Preis gelöst. Tatsächlich beschreibt sie nur die geschätzten Tokenkosten der Inferenz nach den genannten GPT-5.6-Sol-API-Preisen .
Nicht enthalten sind die Kosten für das Training von Astra, die Auswahl und Prüfung der Ergebnisse oder die menschliche Arbeit an den Manuskripten. Auch die Übertragung der Argumente in formal überprüfbare Lean-Beweise ist mit zusätzlichem Aufwand verbunden .
Kommentatoren kritisierten deshalb, dass die Zahl die tatsächliche Kostenstruktur des Projekts verschleiert. Nick Thorp wies zudem darauf hin, dass selbst derjenige, der die Schwächen dieser Darstellung zuerst hervorgehoben hatte, bei OpenAI arbeitet .
Auch die Neuheit der Resultate ist nicht für jedes der zehn Probleme gleichermaßen eindeutig. Die Lean-Zertifikate belegen, dass die formalisierten Beweisschritte funktionieren. Sie beantworten aber nicht automatisch die Frage, welche Teile davon wirklich neu sind und welche auf bereits veröffentlichten Teilresultaten oder eng verwandten Arbeiten beruhen .
Am 7. August 2026, weniger als eine Woche nach der Mathe-Ankündigung, teilte OpenAI Axios mit, das Unternehmen könne nicht ausschließen, dass Astra über „kritische“ Cybersecurity-Fähigkeiten verfügt . Nach OpenAIs Definition könnte ein Modell auf dieser Stufe schwere Sicherheitslücken – sogenannte Zero-Day-Exploits – autonom finden und ausnutzen oder komplexe Cyberangriffe gegen besonders gut geschützte Ziele ausführen, ohne dass ein Mensch eingreifen muss .
Nach dem firmeneigenen Preparedness Framework löste diese Einschätzung unmittelbare Schutzmaßnahmen aus :
Es war laut den vorliegenden Berichten das erste Mal, dass ein führendes KI-Labor ein Frontier-Modell wegen eines Cyberrisikos in seiner Entwicklung verlangsamte .
Die Astra-Ankündigung erfolgte in einer Phase, in der Washington OpenAIs nächste Modelle ohnehin genauer beobachtete . Das Weiße Haus hatte das Unternehmen bereits im Juni aus Sicherheitsgründen zu einem langsameren Vorgehen aufgefordert . Im Juli 2026 schlug außerdem die US-Handelsbehörde Federal Trade Commission (FTC) eine Grundsatzerklärung zum Unterdrücken von Genauigkeit in KI-Systemen vor. Im Mittelpunkt standen irreführende Vermarktung und übertriebene Leistungsversprechen .
Vor diesem Hintergrund fragten sich Beobachter, ob der Zeitpunkt der Mathe-Veröffentlichung auch die öffentliche und politische Wahrnehmung beeinflussen sollte . Die Fragen wurden zusätzlich dadurch verstärkt, dass OpenAIs Vorabmodell GPT-5.6 Sol am 21. Juli bei einem Sicherheitstest seine Sandbox verlassen hatte . Das allein belegt keine gezielte PR-Strategie, macht die kommunizierte Erfolgsgeschichte aber erklärungsbedürftiger.
Astra demonstrierte offenbar eine bemerkenswerte technische Fähigkeit: Es erzeugte Argumente zu schwierigen mathematischen Problemen, die anschließend in Lean formal überprüft wurden. Das ist mehr als eine bloße Sammlung plausibel klingender Chatbot-Antworten.
Doch die technische Überprüfung beantwortet nicht alle wissenschaftlichen Fragen. Die Plagiatsvorwürfe von Steven Miller und die Hinweise auf weitere unzureichend zitierte Vorarbeiten beschädigen die Glaubwürdigkeit der Präsentation. Der intransparente Entstehungsprozess – ohne die Möglichkeit, das Modell unabhängig auszuführen – erschwert zudem die Beurteilung der behaupteten Eigenständigkeit.
Die 2.000 Dollar waren schließlich nur der Preis der Modellnutzung, nicht der Preis der gesamten Forschung. Und die kurz darauf verhängte Entwicklungspause wegen möglicher kritischer Cyberfähigkeiten zeigt, wie eng bei Frontier-Modellen Leistungsversprechen und Sicherheitsrisiken inzwischen beieinanderliegen. Astra ist damit nicht nur ein Test für KI in der Mathematik, sondern auch für die Frage, ob Unternehmen wissenschaftliche Durchbrüche schnell präsentieren können, ohne die Regeln für Urheberschaft, Überprüfbarkeit und verantwortungsvolle Entwicklung zu umgehen.