Diumumkan pada 27 Ogos 2026, Google DeepMind menyifatkan projek Gemini 2.5 Flash Lite ini sebagai penilaian ‘double blind’ pertama bagi model AI proprietari bertaraf frontier. Ujian menggunakan sebahagian kecil soalan sulit daripada penanda aras keselamatan AILuminate, meliputi bantuan serangan siber, bahaya kimia d...
Research answer

Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Google DeepMind telah memperkenalkan kaedah untuk menguji model AI proprietari tanpa memberikan soalan penilaian sulit kepada pembangun model atau mendedahkan pemberat model kepada penilai luar. Projek perintis yang diumumkan pada 27 Ogos 2026 itu menguji Gemini 2.5 Flash-Lite bersama Institut Keselamatan AI Singapura, OpenMined, AVERI dan MLCommons. Google menyifatkannya sebagai penilaian ‘double-blind’ pertama bagi model AI proprietari bertaraf frontier. 1213
Idea asasnya mudah: kedua-dua pihak menyimpan aset sensitif masing-masing dalam keadaan terlindung, tetapi pengiraan yang diluluskan masih boleh dijalankan. Ini penting kerana kaedah ujian keselamatan biasa sering memerlukan satu kompromi. Jika pembangun menerima soalan persendirian, soalan itu mungkin direkodkan, digunakan secara sengaja atau tidak sengaja dalam latihan kemudian, atau mencemarkan ujian masa depan. Jika penilai menerima pemberat model, mereka pula mendapat akses kepada harta intelek bernilai tinggi dan keupayaan yang mungkin sensitif.
Projek perintis tersebut menggunakan sebahagian kecil soalan persendirian daripada keluarga penanda aras AILuminate milik MLCommons. Menurut AVERI, soalan itu belum pernah didedahkan kepada Google DeepMind dan digunakan untuk menilai tingkah laku keselamatan model dalam bidang seperti bantuan serangan siber, bahaya kimia dan biologi, ucapan kebencian, mencederakan diri serta dorongan untuk melakukan jenayah ganas. 1
Bahan penanda aras kekal sulit sepanjang proses. AVERI menyulitkan soalan, persekitaran terlindung menjalankan model dan proses penilaian, kemudian output yang terhasil dinyahsulit serta dinilai berdasarkan kriteria yang dipersetujui. Projek ini bertujuan menunjukkan keberkesanan kaedah penilaian tersebut, bukannya menerbitkan papan pendahuluan awam biasa. Skor utama model dan soalan asas tidak didedahkan. 1
Penilaian dijalankan dalam Confidential Space, sebahagian daripada Google Cloud Confidential Computing, menggunakan mesin maya A3 Confidential VM. Menurut laporan teknikal, Intel TDX menyulitkan dan mengasingkan memori hos, manakala GPU sulit NVIDIA H100 melindungi pemberat model dalam memori GPU melalui penyulitan berasaskan perkakasan. Sambungan yang disulitkan membawa soalan penilai dan aset model Google ke dalam persekitaran terlindung itu. 13
Reka bentuk ini turut menggunakan beberapa kawalan untuk mengehadkan perkara yang boleh dilakukan oleh beban kerja serta jenis data yang boleh dikeluarkan. Antaranya ialah laluan data yang disulitkan, tembok api perkakasan, kitar hayat enclave yang sementara dan lapisan dasar PySyft daripada OpenMined. Model, kod inferens, soalan dan kod penilaian hanya disatukan di dalam enclave yang diluluskan, tempat pengiraan yang dipersetujui dijalankan sebelum output yang terhad dikembalikan. 13
Penyulitan sahaja tidak dapat memberitahu peserta tentang perisian yang sedang berjalan. Di sinilah pengesahan jarak jauh, atau remote attestation, memainkan peranan.
Sebelum menyerahkan aset terlindung mereka, Google dan penilai boleh memeriksa beban kerja yang diisytiharkan serta mengesahkan bukti pengesahan yang mengenal pasti perkakasan dan konfigurasi enclave. Hanya selepas pengesahan itu dibuat, soalan dan aset model yang disulitkan dilepaskan ke dalam persekitaran tersebut. 13
Selepas proses selesai, enclave mengembalikan output penilaian yang dibenarkan sebelum dinyahaktifkan. Dalam model kepercayaan yang dirancang, Google tidak boleh membaca soalan di dalam enclave, manakala penilai luar tidak boleh mengeluarkan pemberat model. Ini lebih kukuh daripada hanya bergantung pada janji kontrak untuk tidak merekod atau menggunakan semula data penilaian, walaupun ia tidak menghapuskan semua andaian kepercayaan. 13
Pencemaran penanda aras ialah masalah berterusan dalam penilaian AI. Sesuatu ujian menjadi kurang bermakna jika model pernah melihat soalannya ketika latihan, penalaan halus atau penilaian terdahulu. MLCommons menyatakan bahawa penanda aras yang boleh dipercayai memerlukan data yang bersih, asal-usul yang didokumenkan, persampelan yang teliti serta ketelusan yang mencukupi supaya pihak lain dapat memahami bagaimana keputusan dihasilkan. 2024
Penilaian ‘double-blind’ menawarkan pilihan ketiga antara dua susunan yang tidak sempurna:
Justeru, projek perintis ini menunjukkan mekanisme yang munasabah untuk mengekalkan kerahsiaan kedua-dua pihak sambil membolehkan penilaian luar dijalankan. Namun, ia sendiri tidak membuktikan bahawa kesimpulan keselamatan yang diperoleh sudah lengkap atau muktamad.
Walaupun signifikan dari sudut teknikal, projek ini mempunyai beberapa batasan yang mengehadkan kesimpulan yang boleh dibuat.
Pertama, penilai boleh mengesahkan beban kerja enclave dan antara muka model yang diisytiharkan, tetapi tidak boleh memeriksa secara bebas pemberat proprietari Google atau pelaksanaan inferensnya. Ini mengehadkan keupayaan mereka untuk mengaudit sama ada persekitaran masa jalan bertindak tepat seperti yang dimaksudkan dalam semua aspek. 13
Kedua, keseluruhan persekitaran operasi tidak boleh dihasilkan semula secara bebas dari hujung ke hujung. Pelaksanaan dan infrastruktur awan kekal di bawah kawalan Google, bukannya dibina semula dan dijalankan oleh pihak yang tidak berafiliasi. Proses pengesahan itu juga masih bergantung pada perkakasan, perisian tegar, sistem penyampaian dan infrastruktur pengesahan Google Cloud. Pengesahan berasaskan perkakasan sememangnya lebih kukuh daripada janji kontrak untuk tidak merekod data, tetapi ia tidak menghapuskan pergantungan pada rantaian bekalan yang lebih luas. 13
Ketiga, soalan sulit dan keputusan berangka tidak diterbitkan. Kerahsiaan soalan membantu mengekalkan nilainya untuk ujian masa depan, tetapi pada masa yang sama mengehadkan penelitian awam, perbandingan antara model dan pengesahan bebas terhadap dapatan substantif. AVERI menyifatkan kerja ini sebagai penilaian kualitatif dan kuantitatif berskala kecil, bukannya keputusan penanda aras awam yang lengkap. 1
Perkakasan selamat hanya menyelesaikan sebahagian daripada masalah penilaian. Untuk ujian ‘double-blind’ menjadi amalan industri yang berkekalan, rangka tadbir urus di sekelilingnya juga perlu diperkukuh.
Perlindungan undang-undang dan institusi perlu menetapkan pengendalian data, jenis output yang dibenarkan, peraturan pendedahan, liabiliti dan kawalan akses—terutamanya apabila penilaian melibatkan keupayaan berbahaya.
Pengurusan penanda aras perlu merangkumi asal-usul soalan, persampelan, pelabelan, dokumentasi, prosedur penyegaran dan pemantauan pencemaran. MLCommons menekankan bahawa penanda aras tidak menjadi boleh dipercayai hanya kerana datanya dirahsiakan; pembinaan dan penyelenggaraannya juga mesti boleh dipertahankan. 2025
Kebolehulangan bebas memerlukan pengesahan yang bermakna terhadap binaan sistem, rantaian pengesahan, dasar pelaksanaan dan keputusan yang dilaporkan oleh pihak di luar pembekal model serta pengendali awan.
Kebolehskalaan juga penting. Standard yang berguna perlu berfungsi merentasi pembangun model, seni bina, persekitaran awan, penilai, jenis penanda aras dan keluaran model yang berbeza—bukan hanya dalam kerjasama khusus yang menggunakan satu susunan perkakasan.
Secara paling tepat, projek Gemini Google DeepMind ini boleh dilihat sebagai usaha membina infrastruktur untuk bentuk penilaian AI yang lebih sukar, bukannya jawapan muktamad kepada persoalan kepercayaan terhadap penanda aras. Ia menunjukkan bagaimana pengkomputeran sulit boleh mengurangkan konflik antara melindungi data ujian dan melindungi model proprietari. Namun, sama ada pendekatan ini mampu menghasilkan bukti yang benar-benar dipercayai pada skala industri akan bergantung pada pengawasan bebas, tadbir urus penanda aras yang kukuh, perlindungan undang-undang, kebolehulangan dan kepraktisan operasi—bukan kriptografi enclave semata-mata. 1320
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Diumumkan pada 27 Ogos 2026, Google DeepMind menyifatkan projek Gemini 2.5 Flash Lite ini sebagai penilaian ‘double blind’ pertama bagi model AI proprietari bertaraf frontier.
Diumumkan pada 27 Ogos 2026, Google DeepMind menyifatkan projek Gemini 2.5 Flash Lite ini sebagai penilaian ‘double blind’ pertama bagi model AI proprietari bertaraf frontier. Ujian menggunakan sebahagian kecil soalan sulit daripada penanda aras keselamatan AILuminate, meliputi bantuan serangan siber, bahaya kimia dan biologi, ucapan kebencian, mencederakan diri serta jenayah ganas.
Teknologi enclave sulit mengurangkan risiko pencemaran penanda aras, namun perlindungan undang undang, pengurusan penanda aras, kebolehulangan bebas dan kebolehskalaan masih diperlukan.