Bu iddia, yapay zekânın matematikteki rolü açısından önemli bir eşik olarak görülürken, açıklamanın sunuluş biçimi ve maliyet hesabının kapsamı konusunda da ciddi tartışmalar başlattı .
OpenAI’nin raporuna göre sonuçlar matematik ve teorik bilgisayar biliminin sekiz alanına yayılıyor. Ortaya konan çalışmalar kanıtlar, karşı örnekler ve daha iyi sınırlar içeriyor . Öne çıkan başlıklar şöyle:
Buradaki “çözüm” ifadesi her problem için aynı türden bir sonuç anlamına gelmiyor. Bazı başlıklarda bir varsayımın çürütüldüğü, bazılarında yeni bir yapı kurulduğu, bazılarında ise mevcut sınırların iyileştirildiği aktarılıyor .
OpenAI, Astra’nın ürettiği metinleri tek başına yeterli kanıt olarak sunmadı. Her sonuç için Lean 4 içinde biçimsel bir kanıt sertifikası hazırlandı. Lean, matematiksel bir ifadenin belirli tanımlar ve aksiyomlar altında gerçekten takip edilip edilmediğini adım adım kontrol eden bir kanıt yardımcısıdır. Bu süreç, biçimsel kanıttaki mantık boşluklarını, tür hatalarını ve tutarsızlıkları yakalayabilir .
Şirket, tüm Lean dosyalarını GitHub’da yayımladı. Depodaki “sorry” sayısının 10 kanıtın tamamında sıfır olduğu bildiriliyor; Lean dünyasında “sorry”, henüz kanıtlanmamış bir adımın geçici olarak bırakıldığını gösteren bir işarettir . Bu nedenle araştırmacılar, yayımlanan dosyaları uygun araçlarla kendi bilgisayarlarında bağımsız biçimde kontrol edebilir.
Ancak biçimsel doğrulama, iddianın bütün yönlerini otomatik olarak onaylamıyor. Lean’in gösterebildiği şey, biçimsel olarak tanımlanmış bir teoremin, o tanımlar ve aksiyomlar altında geçerli olduğudur. Sistem tek başına şu sorulara yanıt veremez:
Bu nedenle uzmanların tanımları, indirgemeleri, yenilik iddiasını ve gayriresmî matematiksel argümanla biçimsel kanıt arasındaki bağlantıyı ayrıca incelemesi gerekiyor .
OpenAI’nin açıkladığı 2.000 dolar, Astra’nın geliştirilmesi veya tüm araştırma programının toplam faturası değil. Bu rakam, 10 başarılı çözümü üretmek için kullanılan tokenların Sol API fiyatları üzerinden hesaplanan yaklaşık maliyetini ifade ediyor .
Hesaba başarısız denemeler, paralel arama süreçleri, farklı yönlerin denenmesi ve son kanıta ulaşmadan önce harcanan dahili işlem gücü dahil değil . Ayrıca araştırmacıların problem seçmesi, sonuçları 249 sayfalık bir metne dönüştürmesi, kanıtları biçimselleştirmesi ve yayıma hazırlaması gibi insan emeği de bu sayının parçası değil.
Bu ayrım önemli. “10 zor problem 2.000 dolara çözüldü” başlığı, token maliyetini çarpıcı biçimde özetliyor; fakat bir araştırma projesinin gerçek ekonomik maliyetini göstermiyor. Yine de yapay zekânın belirli türdeki matematiksel arama ve kanıt üretimini çok düşük bir marjinal maliyetle yapabilmesi, açıklamanın en dikkat çekici taraflarından biri olarak öne çıkıyor .
Astra duyurusu hem heyecan hem de kuşkuyla karşılandı. Eleştirilerin başlıca noktaları şunlar:
Lean sertifikasının çalışması, ilgili biçimsel kanıtın teknik açıdan tutarlı olduğunu gösterir. Ancak bu durum, sonucun mutlaka önemli, özgün veya açık problemin hedeflediği soruya verilmiş doğru yanıt olduğu anlamına gelmez . Bu değerlendirmeler için matematikçilerin bağımsız incelemesi ve hakem değerlendirmesi gerekiyor.
Bilişsel bilimci ve yapay zekâ araştırmacısı Gary Marcus, matematikteki başarının özel bir durum olabileceğini savundu. Marcus’a göre matematik, sembolik araçlarla dışarıdan doğrulanabildiği ve doğru sonuçların sentetik verilerle üretilebildiği için yapay zekâ sistemlerinin güçlü göründüğü alanlardan biri. Bu performansın biyoloji, tarih, strateji veya açık uçlu gerçek dünya sorunlarına otomatik olarak taşınamayacağı konusunda uyarıda bulundu .
Bir diğer soru, sonucu üreten modelin akıl yürütme süreci yeterince şeffaf değilse uzmanların bunu nasıl değerlendireceği. Ayrıca bir modelin mevcut literatürü kaynak göstermeden yeniden kurup kurmadığını veya hangi katkının Astra’ya, hangisinin insan araştırmacılara ait olduğunu belirlemek için ortak kabul görmüş bir yöntem henüz bulunmuyor .
Duyurunun, matematikçilerin yapay zekâ şirketlerinin bilimsel sonuçları hakemli dergiler yerine basın açıklamalarıyla duyurmasına itiraz ettiği Haziran 2026 tarihli Leiden Bildirgesi sonrasında gelmesi de tartışmayı büyüttü . Astra henüz kamuya açılmış değil; şirket model kartı, tekrarlanabilir kamuya açık kıyaslamalar veya 2.000 dolarlık rakama ulaşmak için kaç başarısız deneme yapıldığına ilişkin bir başarı oranı yayımlamadı .
Bazı gözlemciler, önceki yapay zekâ matematiği iddialarının (örneğin Google DeepMind’ın AlphaGeometry çalışmasının) sonradan daha ayrıntılı incelemeye tabi tutulduğunu hatırlatarak, hemen bir “paradigma değişimi” ilan edilmemesi gerektiğini belirtiyor .
Mevcut tablo, insan matematikçilerin ortadan kalkmasından çok araştırma sürecinin bazı aşamalarının ucuzlayabileceğine işaret ediyor. Yapay zekâ; fikir üretme, olası karşı örnekleri arama, teknik yolları tarama ve biçimsel kanıt hazırlama gibi görevlerde güçlü bir yardımcıya dönüşebilir.
Manchester Üniversitesi’nden matematikçi Thomas Bloom sonuçları “büyük haber” olarak nitelendirirken, bunun matematikçilerin yerini aldığı anlamına gelmediğini söyledi. Bloom’a göre Astra, bir asırdan uzun sürede birikmiş matematiksel teoriden yararlanıyor ve kendisi de matematikçiler tarafından geliştirildi .
Bununla birlikte, araştırma kapasitesinin küçük ekipler ve bireysel araştırmacılar için daha erişilebilir hâle gelmesi ihtimali gerçek bir değişim yaratabilir. Yaklaşık 2.000 dolarlık token hesabı, başarılı bir araştırma fikrinin denenmesi için gereken ilk maliyetin gelecekte önemli ölçüde düşebileceğini düşündürüyor .
Astra örneği, yalnızca “yapay zekâ matematik yapabiliyor mu?” sorusunu değil, bilimsel üretimin nasıl örgütleneceğini de gündeme getiriyor:
Şimdilik en temkinli sonuç şu: OpenAI, sıradan bir kıyaslama skorundan çok daha güçlü biçimde incelenebilecek 10 somut matematiksel iddia ve bunlara eşlik eden biçimsel materyaller yayımladı. Fakat bu iddiaların matematik dünyasında gerçekten yerleşmesi için bağımsız uzman incelemesi, özgünlük kontrolü ve hakemlik sürecinin tamamlanması gerekiyor .