Namun, pengumuman tersebut tidak diterima bulat-bulat. Ada yang melihatnya sebagai kemajuan besar dalam penggunaan AI untuk penyelidikan asas, sementara yang lain mengingatkan bahawa “bukti boleh disemak komputer” tidak semestinya bermaksud setiap dakwaan dalam pengumuman itu sudah disahkan sepenuhnya oleh komuniti matematik .
Menurut laporan OpenAI, 10 keputusan itu meliputi lapan bidang dan merangkumi bukti, contoh balas serta had yang dipertingkatkan . Antara hasil utama ialah:
Ringkasnya, ini bukan sekadar keputusan daripada ujian standard seperti Olimpik Matematik Antarabangsa atau penanda aras MATH. Dakwaan OpenAI ialah Astra membantu menghasilkan keputusan baharu untuk masalah penyelidikan yang belum mempunyai jawapan, sekali gus menaikkan aras perbincangan tentang maksud “AI melakukan matematik” .
OpenAI tidak hanya meminta orang ramai mempercayai jawapan yang dijana model. Setiap hasil disertakan sijil bukti formal Lean 4 — fail yang boleh disemak oleh komputer dan, secara prinsipnya, diperiksa secara bebas pada komputer riba .
Lean ialah pembantu bukti (proof assistant) yang memeriksa langkah logik daripada aksiom hingga kesimpulan. Sistem ini boleh mengesan jurang hujah, kesilapan jenis data serta ketidakselarasan dalam bukti formal . OpenAI menerbitkan fail Lean tersebut secara terbuka di GitHub. Repositori berkenaan dilaporkan mempunyai kiraan “sorry” sifar bagi kesemua 10 bukti; dalam Lean, “sorry” biasanya menandakan langkah yang belum dibuktikan .
Tetapi terdapat had penting. Lean hanya boleh mengesahkan bahawa satu pernyataan formal mengikuti definisi dan aksiom formal yang diberikan. Ia tidak boleh menentukan sama ada ringkasan dalam siaran akhbar benar-benar sepadan dengan teorem formal, sama ada definisi itu mencerminkan persoalan yang dimaksudkan oleh komuniti matematik, atau sama ada hasil tersebut benar-benar baharu dan signifikan dari segi sejarah .
Justeru, pakar manusia masih perlu menilai ketepatan pernyataan, definisi, pengurangan masalah, kebaharuan hasil serta hubungan antara hujah tidak formal dengan versi formalnya .
OpenAI menyatakan bahawa jumlah token yang diperlukan untuk mencari kesemua 10 penyelesaian itu akan berharga kira-kira AS$2,000 pada kadar API Sol . Angka ini menjadikan penemuan matematik berasaskan AI kelihatan amat murah berbanding tempoh bertahun-tahun yang biasanya diperlukan untuk mengkaji masalah sukar.
Namun, angka tersebut perlu dibaca dengan tepat. Ia merujuk kepada kos token bagi penyelesaian yang berjaya, bukan kos keseluruhan program penyelidikan. Ia tidak termasuk percubaan yang gagal, proses penerokaan selari, pengiraan dalaman sebelum mendapatkan sijil bukti, latihan model, penyediaan manuskrip atau kerja penyelidik manusia .
Dengan kata lain, AS$2,000 ialah anggaran harga API yang berkaitan dengan pencarian 10 penyelesaian — bukannya bil penuh untuk membina Astra atau menjalankan keseluruhan projek.
Sebahagian penyelidik menganggap sijil Lean sebagai peningkatan besar dari segi kebolehujian. Namun, sijil itu tidak dengan sendirinya membuktikan bahawa hasil berkenaan penting, mengejutkan atau benar-benar menjawab masalah terbuka seperti yang difahami oleh pakar .
Saintis kognitif Gary Marcus berhujah bahawa “kejayaan dalam matematik ialah kes khusus”. Menurut pandangan ini, kemahiran model dalam domain yang mudah diformalisasikan dan disemak secara simbolik tidak semestinya menunjukkan keupayaan penaakulan umum dalam semua bidang sains .
Satu persoalan yang belum ada jawapan dipersetujui ialah cara terbaik untuk mengaudit hasil yang dijana model kotak hitam. Walaupun bukti akhirnya boleh diformalkan, komuniti masih perlu menentukan sama ada hasil itu merupakan penemuan baharu, pembinaan semula karya sedia ada yang tidak diberi atribusi, atau tafsiran yang terlalu luas terhadap masalah asal .
Pengumuman OpenAI muncul tidak lama selepas “Deklarasi Leiden” pada Jun 2026, apabila ahli matematik mengkritik syarikat AI kerana mengumumkan hasil melalui siaran akhbar dan bukannya proses semakan rakan sebaya . Astra juga belum tersedia kepada umum; OpenAI belum menerbitkan kad model atau mendedahkan kadar kegagalan yang mendasari angka AS$2,000 itu .
Pemerhati turut mengingatkan bahawa dakwaan terdahulu tentang AI dan matematik, termasuk berkaitan AlphaGeometry oleh Google DeepMind, pernah melalui penelitian lanjut. Oleh itu, pengumuman ini belum semestinya membuktikan berlakunya perubahan paradigma .
Jika hasil Astra bertahan selepas penelitian bebas, kesan paling segera mungkin bukan penggantian ahli matematik, tetapi pengurangan kos pencarian bukti dan eksperimen teknikal . Thomas Bloom, ahli matematik di University of Manchester, menyifatkan hasil itu sebagai “berita besar”, namun menolak gambaran bahawa AI sedang menggantikan ahli matematik. Beliau menegaskan bahawa Astra dibina oleh ahli matematik dan bergantung pada lebih satu abad teori matematik .
Pengumuman ini tetap membawa beberapa implikasi besar:
Kesimpulan paling berhati-hati buat masa ini ialah OpenAI telah menerbitkan 10 dakwaan matematik konkrit dengan bahan pengesahan yang lebih kukuh daripada sekadar skor penanda aras atau demonstrasi makmal . Sama ada ia benar-benar menyelesaikan 10 masalah terkenal seperti yang difahami komuniti matematik masih perlu ditentukan melalui audit pakar dan semakan rakan sebaya.