Berikan ejen hanya kebenaran, data dan alat yang diperlukan untuk tugasan yang ditakrifkan dengan jelas. Asingkan persekitaran pembangunan, pementasan dan produksi. Elakkan satu identiti ejen mempunyai akses serentak kepada pangkalan data produksi, sistem sandaran, kawalan identiti, sistem pembayaran dan infrastruktur pelancaran.
Prinsip akses minimum atau least privilege turut dikenal pasti dalam Singapore Consensus 2026, bersama identiti yang boleh dijejaki, kebolehauditan, pelancaran yang disahkan, jaminan masa operasi, kebolehhentian dan pengawasan manusia.
Kebenaran akses hendaklah bersifat sementara, terhad kepada sumber tertentu dan dibatalkan secara automatik selepas tugasan selesai. Ejen juga tidak boleh meluaskan aksesnya sendiri atau mengubah sistem yang bertanggungjawab memantaunya.
Kelulusan manusia perlu diwajibkan sebelum ejen memadam data, mengubah skema pangkalan data, menukar kelayakan, menghantar komunikasi luaran berimpak tinggi, memindahkan wang atau mengubah infrastruktur kritikal. Untuk tindakan paling besar kesannya, gunakan kelulusan dua pihak atau pengasingan tugas.
Kelulusan itu mesti berlaku di luar gelung penaakulan ejen. Meminta AI “mengesahkan” niatnya tidak sama dengan pintu kawalan pada infrastruktur yang menyekat pelaksanaan sehingga orang yang diberi kuasa meluluskan operasi tertentu.
Sandaran yang berkongsi kelayakan atau laluan rangkaian dengan sistem produksi mungkin terpadam bersama data yang sepatutnya dilindunginya. Gunakan sandaran terpencil, jenis sekali tulis atau sebaliknya tidak boleh diubah, dengan kelayakan yang tidak boleh dicapai ejen. Ujian pemulihan juga perlu dilakukan secara berkala.
Soalannya bukan hanya sama ada ejen boleh merosakkan sistem produksi, tetapi sama ada ia boleh mencapai sistem pemulihan selepas kerosakan berlaku.
Setiap tindakan ejen mesti boleh dikaitkan dengan identiti ejen dan pelancaran tertentu. Log, jika bersesuaian, perlu merekodkan:
Log perlu disimpan berasingan daripada ejen dan dilindungi daripada pengubahsuaian. Bengio secara khusus menekankan keperluan jejak digital supaya tindakan autonomi boleh dikesan, di samping tanggungjawab yang lebih jelas tentang pihak yang mengawal sistem.
Setiap pelancaran memerlukan pemilik perniagaan, pemilik teknikal, laluan eskalasi dan ketua insiden yang dinamakan. Tanggungjawab itu merangkumi kelulusan akses, pemantauan, tindak balas insiden serta keputusan untuk menjeda atau menamatkan sistem.
“AI yang buat” bukanlah model akauntabiliti. Organisasi tetap bertanggungjawab menentukan tempat ejen boleh beroperasi, data yang boleh dicapainya dan perlindungan yang tersedia apabila ia gagal.
Ejen tidak boleh mengawal sistem pemantauan, kelayakan, proses penggantian atau mekanisme penutupannya sendiri. Penyahaktifan perlu berlaku dari luar, dengan segera dan boleh dikuatkuasakan secara teknikal — termasuk keupayaan membatalkan kelayakan serta mengasingkan alat yang disambungkan walaupun ejen tidak memberi respons atau melaporkan status yang mengelirukan.
Fungsi henti perlu diuji sebagai senario kegagalan, bukan dianggap berfungsi hanya kerana sistem mematuhi arahan biasa. Penyelidik Anthropic dan pihak lain telah menguji keadaan simulasi yang melibatkan pemeliharaan diri, pemerasan dan cubaan mengelak pengawasan. Penilaian sabotaj Anthropic menyifatkan risikonya sangat rendah, tetapi bukan sifar.
Penanda aras yang menunjukkan ejen boleh menyelesaikan tugasan tidak membuktikan bahawa ia akan menghormati batasan ketika berbuat demikian. Sebelum pelancaran, uji keseluruhan sistem ejen bersama alatnya dalam keadaan arahan bercanggah, objektif kabur dan persekitaran bermusuhan.
Ujian wajar menilai sama ada ejen:
Cadangan “Scientist AI” oleh Bengio menawarkan satu kemungkinan: sistem bukan ejen yang menerangkan pemerhatian dan menilai cadangan tindakan, bukannya mengejar matlamat operasi sendiri. Lapisan penyelia ini boleh digunakan untuk menilai perkara yang benar serta kesan tindakan yang dicadangkan oleh ejen.
Keputusan keselamatan memerlukan ambang operasi, bukan sekadar keyakinan umum. Organisasi boleh menjejaki kadar tindakan tanpa kebenaran, pelanggaran dasar, dakwaan palsu bahawa tugasan selesai, kekerapan eskalasi, kejayaan pemulihan, masa mengesan dan masa menghentikan sistem.
Pelancaran perlu dijeda, akses dikurangkan atau sistem dikembalikan kepada keadaan sebelumnya apabila ambang yang ditetapkan dilampaui. Pemantauan mesti diteruskan selepas pelancaran kerana alat, data dan insentif dunia sebenar boleh mewujudkan keadaan yang tiada semasa ujian.
Singapore Consensus menggunakan model pertahanan berlapis yang merangkumi tiga bidang berkait rapat: membangunkan sistem boleh dipercayai, menilai risikonya dan mengawal sistem selepas digunakan.
Mulakan dengan akses baca sahaja, data sintetik dan alat dalam persekitaran kotak pasir. Kemudian beralih kepada projek rintis kecil, tugasan produksi yang terhad dan peluasan kebenaran secara beransur-ansur — hanya selepas ejen memenuhi keperluan keselamatan yang didokumenkan.
Pasukan red team bebas perlu menguji keseluruhan sistem operasi, termasuk pengurusan identiti, API, pangkalan data, pemantauan dan prosedur pemulihan. Menguji model bahasa sahaja tidak mencukupi kerana alat serta kebenaranlah yang menentukan kesan sebenar apabila berlaku kegagalan.
Bagi ejen yang boleh menjejaskan sistem perniagaan kritikal, ujian luar dan audit selepas pelancaran perlu melengkapkan penilaian dalaman. Insiden serius hendaklah didokumenkan dan dilaporkan melalui saluran tadbir urus serta kawal selia yang berkaitan.
Bengio berpendapat banyak teknik keselamatan sebenarnya sudah tersedia, tetapi penerimaan, pengesahan bebas dan ketelusan memerlukan sokongan institusi yang lebih kukuh. Penelitian perlu tertumpu pada perkara yang boleh dilakukan ejen dan sistem yang boleh dicapainya, bukan semata-mata pada label “pembantu AI”.
Sebelum memberikan akses produksi, syarikat sepatutnya mampu menjawab lima soalan ini:
Jika jawapannya bergantung pada ejen untuk mematuhi arahan secara sukarela, pelancaran itu belum dikawal dengan secukupnya.
Tiada ejen autonomi patut menerima kuasa yang tidak boleh dipulihkan sehingga ia terbukti mempunyai batasan, boleh diperhatikan, boleh dihentikan, diuji secara bebas dan ditugaskan kepada organisasi manusia yang jelas bertanggungjawab.
Garis panduan antarabangsa bersama boleh membantu menetapkan jangkaan minimum, tetapi syarikat masih perlu menguatkuasakannya dalam infrastruktur sendiri. Pengajaran daripada kegagalan operasi dan penilaian penjajaran terkawal adalah mudah: autonomi mesti diperoleh melalui bukti. Ejen yang berkeupayaan mungkin berguna dalam produksi, tetapi keupayaan semata-mata bukanlah bukti keselamatan.