DeepSeek V4 Pro menemui 28 daripada 32 kerentanan apabila tiga larian digabungkan, dengan kos kira kira AS$295 — tetapi angka itu ialah keputusan pooled pass@3, bukan jaminan satu larian. Keputusan ini memihak kepada sistem keselamatan yang tersusun: gunakan model pantas dan murah untuk mencari secara meluas, model...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Ujian Aikido pada Ogos 2026 membandingkan 10 model AI terhadap 32 kerentanan yang baru didedahkan. Setiap model dijalankan sebanyak tiga kali, dengan jumlah penggunaan kira-kira 11.7 bilion token. DeepSeek V4 Pro 0813 mencatat liputan gabungan tertinggi — 28 daripada 32 kerentanan pada kos sekitar AS$295. Namun, pengajaran paling penting bukanlah bahawa satu model telah menang mutlak. Sebaliknya, keputusan itu menunjukkan nilai sistem yang menggabungkan siasatan berulang, pengesahan bukti dan pengkhususan peranan model. 3
DeepSeek V4 Pro 0813 mencapai 28 daripada 32 kerentanan, bersamaan 87.5% pooled recall, apabila hasil tiga larian digabungkan. Ini menjadikannya model paling kuat pada peringkat penemuan dalam ujian tersebut.
Namun, angka 28/32 perlu difahami sebagai keputusan pass@3. Ia tidak bermaksud satu panggilan kepada model itu akan menemui 28 kerentanan secara konsisten. Setiap larian boleh meneroka fail, laluan kod dan andaian eksploit yang berbeza. Apabila hasilnya dikumpulkan, liputan meningkat kerana sistem mendapat manfaat daripada kepelbagaian carian.
Secara praktikal, keputusan ini menyokong penggunaan beberapa siasatan bebas — bukan menganggap jawapan pertama model sebagai audit keselamatan yang lengkap. 3
Tiga larian DeepSeek Pro menemui 28 daripada 32 kerentanan dengan kos kira-kira AS$295. Kelebihannya terletak pada keluasan carian: lebih banyak isu dapat dikesan apabila semua larian digabungkan.
Ini menjadikannya calon yang baik untuk peringkat awal aliran kerja keselamatan. Bagaimanapun, setiap penemuan masih perlu disahkan berdasarkan bukti, digabungkan jika berulang dan dinilai tahap keterukannya sebelum dijadikan amaran produksi.
Tiga larian Flash menemui 24 daripada 32 kerentanan dengan kos kira-kira AS$108. Dari segi liputan berbanding kos, keputusan ini amat menarik dan sesuai untuk imbasan selari atau larian tambahan dalam bajet yang terhad.
Flash tidak semestinya pilihan terbaik untuk menjadi penyemak akhir. Nilai utamanya ialah membolehkan lebih banyak percubaan siasatan dibuat dengan kos rendah, sebelum hasilnya diserahkan kepada peringkat pengesahan yang lebih selektif. 3
Grok 4.6 menonjol dari segi kebolehulangan. 21 kerentanan muncul dalam ketiga-tiga lariannya.
Konsistensi seperti ini penting untuk pasukan yang memerlukan laporan stabil, tingkah laku yang boleh dijangka dan perbezaan minimum antara satu imbasan dengan imbasan berikutnya. Kekuatan Grok berbeza daripada DeepSeek Pro: model yang sangat konsisten mungkin lebih sesuai untuk pemantauan berkala, walaupun model yang lebih eksploratif memperoleh recall gabungan yang lebih tinggi.
Claude Opus 5 mencapai 26 daripada 32 kerentanan secara gabungan, manakala GPT-5.6 Sol mencapai 25 daripada 32. Kedua-duanya kekal sebagai pilihan berprestasi tinggi, tetapi keputusan itu mencabar andaian bahawa model tertutup paling mahal semestinya memberikan liputan kerentanan terbaik.
Pasukan keselamatan wajar memilih model ini berdasarkan nilai tambah dalam penaakulan, pelaporan atau semakan — bukan semata-mata reputasi umum atau nama jenama. 3
Keputusan paling menonjol Kimi K3 ialah 92.3% pooled precision. Precision mengukur berapa banyak penemuan yang dilaporkan diterima sebagai sah, bukan jumlah keseluruhan kerentanan yang berjaya ditemui.
Perbezaan ini penting. Ejen dengan recall tinggi boleh mencari secara meluas walaupun menghasilkan lebih banyak bunyi atau positif palsu. Sebaliknya, model dengan precision tinggi seperti Kimi boleh membantu mengesahkan penemuan, menyediakan laporan dan mengurangkan jumlah amaran yang sampai terus kepada jurutera.
Aikido mendapati Qwen3.8-Max kadangkala mengulangi CVE atau laluan penaakulan yang sama. Pengulangan menjadi tidak cekap apabila ia menggunakan giliran siasatan tanpa menambah liputan.
Namun, pemeriksaan kedua juga boleh berguna jika ia mendedahkan syarat eksploit, laluan pelaksanaan atau butiran pengesahan yang terlepas sebelum ini. Penyelesaian praktikalnya ialah penjejakan keadaan pada peringkat harness: ejen perlu mengetahui perkara yang telah diuji, mempunyai had untuk cabang berulang dan menghantar kes yang belum selesai kepada siasatan baharu — bukan mengulang laluan yang sama secara automatik.
GLM-5.3 meningkat daripada 24/32 kepada 25/32 dalam perbandingan yang dikemas kini, sambil mengekalkan profil kos yang lebih rendah berbanding beberapa model tertutup berprestasi tinggi dalam ujian itu.
Ini menjadikannya pekerja volum tinggi atau komponen ensemble yang munasabah. Kelebihannya paling ketara apabila organisasi menggunakan kos yang lebih rendah dan fleksibiliti pelaksanaan untuk menjalankan lebih banyak siasatan, bukannya bergantung pada satu larian sahaja.
Sistem penemuan kerentanan tidak wajar dinilai berdasarkan satu nombor papan pendahulu sahaja:
Penemuan awal biasanya memerlukan recall tinggi dan tingkah laku siasatan yang pelbagai. Amaran produksi pula memerlukan precision tinggi, bukti yang boleh diulang, penggabungan pendua dan kedudukan risiko yang berguna.
Justeru, model yang hebat untuk mencari kemungkinan masalah mungkin tidak sesuai menghantar amaran tanpa semakan terus kepada pembangun. Sebaliknya, model yang lebih berhati-hati mungkin menghasilkan lebih sedikit penemuan, tetapi laporan yang lebih mudah dipercayai.
Pengajaran utama daripada ujian ini ialah prestasi model bersifat stokastik. Satu larian hanya mengambil satu laluan siasatan. Beberapa larian bebas meningkatkan peluang sistem meneroka hipotesis yang berbeza.
Sebab itu tiga larian DeepSeek yang agak murah boleh menyaingi atau mengatasi liputan keseluruhan satu larian model berprestasi tinggi yang lebih mahal. Unit yang relevan bukan sekadar satu panggilan model, tetapi keseluruhan siasatan: model, alat, arahan, had giliran, memori, larian semula dan proses pengesahan. 3
Sistem yang dibina berdasarkan keputusan ini boleh memisahkan proses mencari daripada proses membuat keputusan:
Pendekatan penghalaan model ini lebih kukuh berbanding menganggap model terbuka atau tertutup sebagai pengganti terus antara satu sama lain.
Keputusan Aikido berguna, tetapi ia bukan kedudukan sejagat untuk semua model keselamatan AI. Ujian itu meliputi 32 kerentanan yang baru didedahkan, tiga percubaan bagi setiap model dan satu agent harness tertentu. Prestasi boleh berubah mengikut bahasa pengaturcaraan, struktur repositori, akses kepada alat, model ancaman, bajet siasatan dan toleransi organisasi terhadap positif palsu. 3
Kesimpulan yang lebih berhati-hati — dan lebih berguna — ialah dalam keadaan ini, model dengan berat terbuka, khususnya DeepSeek V4 Pro, mampu menyaingi atau mengatasi model tertutup berprestasi tinggi apabila disokong oleh pengulangan dan orkestrasi yang baik.
Produk keselamatan yang menang bukan semestinya model dengan skor tajuk berita tertinggi. Ia ialah sistem yang menggabungkan penemuan luas, pengesahan yang boleh dipercayai dan bukti yang boleh terus diambil tindakan oleh jurutera.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro menemui 28 daripada 32 kerentanan apabila tiga larian digabungkan, dengan kos kira kira AS$295 — tetapi angka itu ialah keputusan pooled pass@3, bukan jaminan satu larian.
DeepSeek V4 Pro menemui 28 daripada 32 kerentanan apabila tiga larian digabungkan, dengan kos kira kira AS$295 — tetapi angka itu ialah keputusan pooled pass@3, bukan jaminan satu larian. Keputusan ini memihak kepada sistem keselamatan yang tersusun: gunakan model pantas dan murah untuk mencari secara meluas, model yang konsisten atau tepat untuk pengesahan, serta semakan manusia bagi penemuan berisiko...