BootLoops 1.0 ialah kit alat sumber terbuka yang membantu model bahasa membuat pengiraan saintifik dengan semakan terbina dalam. Ahli fizik Harvard, Matthew Schwartz, membangunkannya bersama Claude. Namun, alat ini tidak terikat pada satu model tertentu. Matlamatnya bukan untuk menjadikan setiap jawapan AI boleh dipercayai secara automatik, tetapi untuk memudahkan hasil tertentu diuji.
11
2
Bagaimana BootLoops menyemak pengiraan
Kit ini menghimpunkan perisian saintifik dengan protokol yang menetapkan cara sesuatu hasil perlu diuji. Antaranya ialah membandingkan jawapan dengan kaedah pengiraan bebas pada titik yang tidak digunakan untuk memadankan hasil, serta menggunakan kawalan positif untuk membuktikan bahawa semakan itu mampu mengesan hasil yang salah. Panduannya turut menekankan rekod asal-usul kerja, supaya alat yang membantu mendapatkan sesuatu jawapan tidak menjadi satu-satunya pihak yang mengesahkannya.
2
11
Pendekatan ini sesuai untuk tugasan yang hasilnya boleh ditakrifkan dengan jelas, seperti pengiraan dalam fizik matematik. Ia boleh menunjukkan bahawa sesuatu hasil telah melepasi ujian yang ditetapkan, tetapi bukan membuktikan bahawa semua dakwaan yang dijana model adalah betul atau bahawa soalan penyelidikannya penting.
2
5
Hasil kerja yang dilaporkan bersama Claude
Pasukan Schwartz melaporkan pengiraan 30 kamiran fizik matematik, termasuk 15 hasil yang disifatkan sebagai baharu, antaranya kamiran Feynman eliptik. Kerja itu turut merangkumi penyelesaian kepada perkara yang disebut Schwartz sebagai “masalah terakhir” Watson—pengiraan yang berkaitan dengan hasil kerja terdahulu ahli matematik George Watson.
14
16
4
Secara lebih luas, usaha itu dilaporkan menghasilkan 36 manuskrip dengan 19 pengarang bersama merentas 18 bidang, termasuk ekologi dan genetik populasi. Angka tersebut merujuk kepada hasil penyelidikan yang dilaporkan, bukan bukti bahawa semuanya sudah melalui pengesahan bebas. Schwartz berkata beberapa hasil masih sedang diperiksa.
3
15
4
Mengapa kepakaran manusia masih penting
Schwartz menggunakan istilah “ketidakpadanan impedans” untuk menerangkan jurang antara keperluan saintis dengan perkara yang dapat dilakukan oleh model bahasa semasa. Model boleh berguna untuk tugasan pengiraan yang skopnya jelas dan semakannya boleh ditentukan. Namun, kerja saintifik juga memerlukan pertimbangan tentang soalan mana yang berbaloi diterokai dan sama ada sesuatu jawapan benar-benar bermakna.
1
5
Menurut Schwartz, Claude menemui kaitan merentas bidang yang mungkin tepat dari segi teknikal tetapi pada mulanya tidak begitu penting dari sudut saintifik. Pakar dalam bidang berkenaan membantu mengarahkan kerja kepada persoalan yang lebih bermakna. Perbezaannya penting: pengesahan komputasi boleh menunjukkan sama ada pengiraan melepasi ujian tertentu, manakala pertimbangan saintifik membantu menentukan apa yang patut dikira dan bagaimana hasilnya perlu ditafsirkan.
5
Apa yang dibuktikan oleh BootLoops—dan apa yang tidak
BootLoops menyediakan cara untuk menyusun kerja yang dibantu AI berasaskan tugasan yang boleh diuji, semakan bebas dan kepakaran manusia. Hasil yang dilaporkan menunjukkan potensi pendekatan ini, tetapi bukan jaminan menyeluruh bahawa semua jawapan tepat atau tidak memerlukan pengesahan lanjut. Pengiraan yang sudah disemak sahaja tidak memadai untuk menyokong keputusan berisiko tinggi; soalan, andaian dan kesannya tetap perlu diteliti manusia.
2
4
5