Peletakan jawatan Coxon menjadikan hujah yang sebelum ini kelihatan abstrak tentang keselamatan AI terasa lebih mendesak. Penyelidik yang berkata beliau menghabiskan tiga tahun dalam kerja pralatih di OpenAI dan Anthropic itu meninggalkan Anthropic sambil menuduh kedua-dua makmal “berlumba terus ke arah kecerdasan super yang memperbaik dirinya sendiri” dan “mempertaruhkan nyawa kita”. Hantarannya menerima lebih 90 juta tontonan dalam tempoh kurang sehari, lalu mengangkat kebimbangan penyelidikan dalaman menjadi perdebatan awam serta politik yang meluas.
2
44
Apakah yang dibimbangkan Coxon?
Teras amaran itu ialah penambahbaikan kendiri berulang (recursive self-improvement): penggunaan sistem AI untuk mempercepat usaha membina sistem AI yang lebih berkeupayaan. Anthropic menghuraikan hujung spektrum ini sebagai sistem yang secara autonomi mereka bentuk dan membangunkan penggantinya sendiri. Namun, syarikat itu turut menyatakan tahap tersebut belum dicapai dan bukan sesuatu yang pasti berlaku.
25
Kebimbangan Coxon ialah kemajuan keupayaan mungkin bergerak lebih pantas daripada kemampuan makmal untuk menilai sistem, mengesan kegagalan, memastikan tingkah lakunya sejajar dengan matlamat manusia, serta mengawal selia penggunaannya. Menurut beliau, persaingan komersial dan tekanan strategik mendorong makmal bergerak ke hadapan sebelum dapat membuktikan bahawa kawalan mencukupi wujud.
2
10
13
Perbezaan ini penting: kontroversi tersebut bukan bukti bahawa sistem yang memperbaik dirinya sendiri secara berulang sudah wujud. Ia ialah pertikaian tentang bukti yang patut diperlukan sebelum makmal membangunkan atau melancarkan sistem yang boleh mempercepat penyelidikan AI dengan ketara.
Mengapa respons Evan Hubinger menguatkan isu ini?
Evan Hubinger, ketua sains penjajaran Anthropic, menyokong secara terbuka keseriusan kebimbangan Coxon. Laporan mengenai responsnya menyatakan beliau secara peribadi menganggarkan kebarangkalian AI membunuh semua manusia dalam dekad akan datang melebihi 10%, dan berkata Anthropic masih belum mempunyai pelan untuk menyelesaikan masalah penjajaran bagi kecerdasan super.
4
6
14
Angka itu perlu dibaca dengan cermat. Ia ialah pertimbangan peribadi dalam keadaan ketidakpastian yang sangat besar — bukannya ramalan terukur, dapatan rasmi syarikat atau bukti bahawa bencana itu berkemungkinan berlaku. Namun, persetujuan terbuka daripada penyelidik kanan dalam bidang penjajaran memberi amaran Coxon kekuatan luar biasa: ia bukan semata-mata kritikan pihak luar terhadap sebuah makmal AI termaju.
48
Mengapa isu ini melangkaui satu peletakan jawatan?
Episod ini menyatukan tiga perbahasan yang lazimnya dibincangkan secara berasingan:
- Kawalan teknikal: Mampukah penyelidik mengenal pasti dan menghalang dengan boleh dipercayai tingkah laku berbahaya dalam sistem yang boleh merancang, menggunakan alat atau membantu meningkatkan model masa depan?
- Insentif institusi: Mampukah syarikat yang berdepan persaingan sengit, tekanan pelaburan dan pertimbangan keselamatan negara menentukan sendiri bila mereka perlu berhenti seketika atau melancarkan sistem?
- Keabsahan politik: Siapa yang patut menetapkan peraturan bagi sistem yang mungkin membawa kesan besar kepada ekonomi dan keselamatan?
Anthropic telah menerbitkan penyelidikan tentang teknik penjajaran serta penggunaan penyelidik automatik untuk membantu mengurangkan kegagalan penjajaran yang dikenal pasti. Namun, hasil tersebut menangani mod kegagalan tertentu yang dinilai; ia sendiri belum membuktikan penyelesaian umum untuk mengawal sistem kecerdasan super yang masih bersifat hipotesis.
21
22
23
Seruan untuk memperlahankan pembangunan — tetapi tiada kata sepakat penuh
Beberapa hari selepas hantaran Coxon, Ketua Pegawai Eksekutif Anthropic, Dario Amodei, menyeru pembangunan AI dilakukan pada kadar yang lebih perlahan dan berhati-hati. Coxon menyambut baik gesaan itu secara terbuka. Laporan turut menyebut Ketua Pegawai Eksekutif OpenAI Sam Altman dan Elon Musk menyokong perbincangan lebih luas untuk memperlahankan pembangunan.
43
45
50
Namun, sokongan untuk “memperlahankan” tidak bermaksud sudah wujud program bersama yang jelas. Laporan yang ada tidak menunjukkan tokoh-tokoh tersebut bersetuju pada satu piawaian operasi, ambang pelancaran atau mekanisme penutupan sejagat yang sama.
Apa yang sering disebut sebagai kill switch juga bukan sistem tadbir urus yang lengkap. Keberkesanannya bergantung pada sama ada pihak manusia masih menguasai model, infrastruktur pengkomputeran, saluran akses, alat yang disambungkan, dan organisasi yang mengendalikannya. Persoalan yang lebih penting ialah sama ada perlindungan kukuh, pemantauan, tindak balas insiden dan semakan bebas telah dilaksanakan sebelum model diberi keupayaan atau akses yang berkuasa.
Apa yang diketahui tentang dakwaan risiko ejen AI dan siber
Dakwaan tentang ejen AI melepasi ujian, menjalankan serangan siber atau cuba menyuntik perisian hasad menarik perhatian sepanjang perdebatan ini. Namun, tidak semua dakwaan itu disahkan pada tahap yang sama.
Anthropic menyatakan ia membina pemantauan untuk mengenal pasti dan menyekat cubaan model menyiasat atau melepasi persekitaran ujian, atau memperoleh akses internet secara tidak dijangka. Syarikat itu juga berkata ia menyemak transkrip penilaian bagi tingkah laku meloloskan diri daripada persekitaran kotak pasir. Ini menunjukkan makmal memang menguji risiko sedemikian; ia tidak membuktikan sistem AI telah terlepas daripada kawalan manusia di dunia nyata.
26
Kesimpulan yang berhati-hati ialah risiko penyalahgunaan ejen dan siber merupakan isu keselamatan aktif, manakala dakwaan paling dramatik memerlukan dokumentasi primer atau pengesahan bebas yang kukuh sebelum dianggap fakta muktamad.
Washington mengubah amaran itu menjadi isu pengawalseliaan
Peletakan jawatan Coxon berlaku ketika perunding Senat Amerika Syarikat membincangkan undang-undang yang boleh mewajibkan syarikat AI menunjukkan bahawa mereka mengambil langkah berjaga-jaga yang munasabah untuk mencegah mudarat.
52
Sebelum itu, Anthropic telah menggesa Kongres mewajibkan ujian keselamatan bebas bagi model paling berkeupayaan dan berhujah supaya peraturan AI peringkat negeri tidak diketepikan tanpa alternatif persekutuan yang kukuh bagi menangani risiko bencana.
53
Presiden Trump pula mengambil pandangan berbeza, dengan menyatakan Amerika Syarikat sudah mempunyai pagar pengawalseliaan untuk mengawal dan mendakwa syarikat AI, sekali gus memperkecilkan seruan bagi sekatan tambahan yang khusus untuk AI.
51
Inilah jurang dasar di sebalik tajuk utama:
- Pandangan berjaga-jaga berpendapat komitmen sukarela tidak mencukupi apabila sebilangan kecil syarikat membina sistem yang mungkin mempunyai kesan besar dan sukar dipulihkan.
- Pandangan mengutamakan inovasi berhujah peraturan yang terlalu ketat boleh melemahkan kepimpinan Amerika Syarikat, manakala undang-undang sedia ada boleh menangani tindakan yang memudaratkan.
Kedua-dua pendirian tidak menghapuskan pertukaran asas ini. Pembangunan lebih pantas boleh membawa kelebihan ekonomi dan strategik, tetapi juga mengurangkan masa untuk menilai sistem serta membina pengawasan yang diyakini.
Taruhan kewangan menyukarkan kawal selia kendiri
Masa kontroversi ini menonjolkan ketegangan dalam identiti awam Anthropic. Syarikat itu menampilkan dirinya sebagai berteraskan keselamatan AI, namun ia juga beroperasi dalam pasaran model AI termaju yang memerlukan modal sangat besar dan memberi tekanan untuk terus meningkatkan keupayaan. Satu laporan pada Jun menyatakan pelabur swasta menilai Anthropic pada lebih AS$965 bilion.
54
Ini tidak membuktikan insentif komersial menyebabkan mana-mana keputusan keselamatan tertentu. Namun, nilainya menunjukkan mengapa pengkritik mempersoalkan sama ada kekangan sukarela boleh bertahan apabila ganjaran menjadi yang pertama adalah amat besar. Sebaliknya, pelabur dan pelanggan juga menanggung risiko bahawa kegagalan keselamatan serius, tindakan pengawal selia atau kehilangan kepercayaan boleh menjejaskan nilai syarikat.
Kepentingan berpanjangan amaran Coxon
Peletakan jawatan Coxon tidak membuktikan AI sudah tidak terkawal, model telah melarikan diri, atau kepupusan manusia akan berlaku dalam masa terdekat. Kenyataan beliau dan Hubinger ialah amaran tentang risiko masa depan yang tidak pasti, bukan ramalan yang telah disahkan.
5
48
Namun, ia mengubah bingkai perdebatan. Isunya kini bukan sekadar sama ada AI termaju boleh dijadikan lebih berkeupayaan. Soalnya ialah sama ada syarikat yang berlumba membinanya patut terus memegang kuasa utama untuk menentukan bila bukti keselamatan sudah memadai.
Bagi pembuat dasar, makmal dan masyarakat, piawaian praktikal perlu melebihi kenyataan niat yang meyakinkan: ambang keupayaan yang jelas, penilaian bermakna sebelum pelancaran, pelaporan insiden yang boleh dipercayai, dan pengawasan yang tidak bergantung semata-mata pada syarikat yang paling banyak mendapat manfaat jika bergerak dahulu.
52
53