Це гучна заява, але її важливо читати уважно: наявність машинної перевірки підвищує рівень доказовості, проте не замінює повноцінної наукової оцінки.
Результати охоплюють вісім напрямів і включають докази, контрприклади та покращені оцінки . Серед заявлених досягнень:
Ідеться не про розв’язання стандартних тестів чи олімпіадних прикладів. OpenAI стверджує, що модель працювала з відкритими дослідницькими питаннями, де раніше не було прогресу в основній частині задачі щонайменше десять років .
OpenAI не обмежилася публікацією текстових відповідей моделі. Для кожного результату компанія надала формальний сертифікат доказу Lean 4 — файл, який можна перевірити комп’ютером незалежно від самої моделі .
Lean — це помічник для формалізації доказів. Він перевіряє логічні переходи від аксіом і визначень до висновку, допомагаючи виявляти пропущені кроки, помилки типів та суперечності . У репозиторії OpenAI кількість позначок sorry, які в Lean використовують для непідтверджених частин доказу, за повідомленнями компанії, дорівнює нулю для всіх десяти формалізацій .
Однак «доказ перевірено Lean» не означає автоматично, що всі широкі формулювання пресрелізу вже підтверджені. Система перевіряє, чи випливає формальне твердження з конкретних формальних визначень і припущень. Вона не може самостійно встановити:
Тому фахівцям ще належить перевірити відповідність формулювань, редукції, новизну та історичний контекст кожного результату .
Найяскравіша цифра в оголошенні OpenAI — приблизно $2 000. Але це не вартість створення Astra, не загальний бюджет дослідження і не рахунок за весь процес підготовки публікації.
Компанія оцінила лише вартість токенів, використаних для пошуку десяти успішних розв’язань, за тарифами Sol API . У цю цифру, за оцінками спостерігачів, не входять невдалі спроби, паралельні запуски для пошуку рішень, внутрішні обчислення, навчання моделі, робота дослідників, формалізація доказів і підготовка рукопису .
Саме тому порівнювати $2 000 безпосередньо з річною стипендією аспіранта з математики — яка в провідному університеті може перевищувати $50 000 — варто обережно . Цифра показує потенційну дешевизну окремого етапу пошуку, але не повну економіку наукової роботи.
Математична спільнота оцінює заяву неоднозначно. Сертифікати Lean можуть підтвердити коректність формалізованого доказу, але не гарантують, що результат є несподіваним, значущим або правильно поданий як розв’язання саме тієї відкритої проблеми, про яку йдеться .
Когнітивний науковець і дослідник ШІ Гарі Маркус назвав успіхи Astra вражаючими, але застеріг, що «успіх у математиці — це окремий випадок». На його думку, сильні результати в одній галузі не свідчать автоматично про загальну здатність міркувати в усіх сферах. Маркус також наголосив, що математика особливо придатна для зовнішньої символічної перевірки й створення синтетичних даних із гарантовано правильними відповідями .
Публікація формальних файлів зробила заяву значно більш перевірюваною, але не усунула питання незалежного аудиту. Дослідникам потрібно з’ясувати, чи не відтворює модель уже відомі результати без належного зазначення джерел, а також наскільки прозорим був шлях від пошуку ідеї до фінального доказу .
Astra досі не доступна широкому загалу. OpenAI не опублікувала модельну картку чи дані про частку невдалих спроб, що стоять за оцінкою в $2 000 . Оголошення також пролунало невдовзі після «Лейденської декларації» у червні 2026 року, автори якої критикували компанії зі сфери ШІ за заміну незалежного рецензування гучними пресрелізами .
Деякі оглядачі нагадали й про попередні заяви щодо математичних можливостей систем Google DeepMind, які згодом стали предметом детальнішої перевірки. На їхню думку, говорити про зміну наукової парадигми зарано .
Якщо результати Astra витримають незалежну перевірку, вони можуть мати кілька важливих наслідків.
Математик Манчестерського університету Томас Блум назвав результати «великими новинами», але водночас відкинув ідею, що ШІ вже замінює математиків. Він зазначив, що модель спирається на понад століття математичної теорії, а саму систему створювали математики .
Обережний висновок наразі такий: OpenAI опублікувала десять конкретних математичних тверджень із незвично детальними матеріалами для машинної перевірки. Це суттєво сильніша основа, ніж просто оцінка на тесті або презентація в лабораторному блозі. Але остаточно назвати десять відомих відкритих задач розв’язаними можна буде лише після незалежної перевірки фахівцями.