DeepSeek V4 Pro 0813 menemukan 28 dari 32 kerentanan dalam tiga pengujian gabungan dengan biaya sekitar US$295—hasil recall tertinggi dalam benchmark tersebut, tetapi bukan jaminan bahwa satu kali pemanggilan akan men... Hasil ini mendukung sistem keamanan yang terorkestrasi: gunakan model murah dan luas untuk penem...
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Benchmark Aikido pada Agustus 2026 menguji 10 model AI terhadap 32 kerentanan yang baru diungkap. Setiap model menjalani tiga investigasi, lalu hasilnya dibandingkan berdasarkan recall, precision, konsistensi, perilaku investigasi, dan biaya. 3
Kesimpulan terbesarnya bukan bahwa satu model adalah pemenang mutlak. Justru, efektivitas pencarian kerentanan sangat bergantung pada sistem yang menggabungkan beberapa investigasi, pelacakan konteks, validasi bukti, dan pembagian tugas antarmodel.
DeepSeek V4 Pro 0813 mencapai 28 dari 32 kerentanan, atau 87,5% pooled recall, ketika hasil dari tiga pengujian digabungkan. Ini menjadikannya model terkuat pada tahap penemuan dalam benchmark tersebut.
Namun, angka 28/32 harus dipahami sebagai hasil pass@3, bukan bukti bahwa satu kali penggunaan model akan menemukan 28 kerentanan. Setiap pengujian dapat menelusuri berkas, jalur kode, dan hipotesis eksploitasi yang berbeda. Dengan menggabungkan beberapa pengujian, sistem memperoleh cakupan yang lebih luas karena memanfaatkan keragaman pencarian. 3
Dalam praktiknya, temuan DeepSeek Pro tetap perlu divalidasi berdasarkan bukti, digabungkan jika merupakan duplikasi, dan ditinjau tingkat keparahannya sebelum dikirim sebagai peringatan kepada tim pengembang.
Tiga pengujian DeepSeek Pro menemukan total 28/32 kerentanan dengan biaya sekitar US$295. Keunggulan utamanya adalah keluasan cakupan ketika hasil investigasi digabungkan.
Karena itu, model ini cocok ditempatkan di tahap pertama alur keamanan untuk mencari kandidat kerentanan sebanyak mungkin. Model ini belum tentu menjadi pemeriksa akhir terbaik tanpa dukungan validasi dan deduplikasi.
Tiga pengujian DeepSeek Flash menemukan 24 dari 32 kerentanan dengan biaya sekitar US$108. Hasil tersebut membuatnya menarik dari sisi cakupan per dolar.
Flash dapat digunakan untuk menjalankan banyak pemindaian paralel atau pengujian ulang dengan biaya lebih rendah. Perannya tidak harus sebagai penilai terakhir, melainkan sebagai penambah jumlah upaya investigasi sebelum temuan diteruskan ke tahap verifikasi. 3
Grok 4.6 menonjol dalam hal konsistensi. Sebanyak 21 kerentanan muncul dalam ketiga pengujiannya. Konsistensi seperti ini penting bagi organisasi yang membutuhkan laporan stabil, perilaku yang mudah diprediksi, dan hasil pemantauan berulang yang tidak terlalu berubah-ubah.
Keunggulan Grok berbeda dari DeepSeek Pro. Model yang konsisten dapat lebih cocok untuk pemantauan rutin, meskipun model yang lebih eksploratif mampu menghasilkan pooled recall yang lebih tinggi.
Claude Opus 5 mencapai 26/32 pooled recall, sedangkan GPT-5.6 Sol mencapai 25/32. Keduanya tetap termasuk opsi berkinerja tinggi.
Akan tetapi, hasil ini menantang anggapan bahwa model tertutup dengan biaya paling mahal pasti memberikan cakupan kerentanan terbaik. Pemilihan model seharusnya mempertimbangkan apakah kemampuan penalaran, kualitas pelaporan, atau perilaku peninjauannya benar-benar menambah nilai dalam keseluruhan pipeline keamanan. 3
Kimi K3 mencatat 92,3% pooled precision. Precision mengukur seberapa banyak temuan yang dilaporkan dan kemudian diterima sebagai temuan valid, bukan jumlah kerentanan yang berhasil ditemukan secara keseluruhan.
Perbedaan ini penting. Agen dengan recall tinggi dapat mencari secara luas meski menghasilkan lebih banyak noise. Sebaliknya, model dengan precision tinggi seperti Kimi dapat membantu memverifikasi temuan, menyiapkan laporan, dan mengurangi jumlah peringatan yang akhirnya harus ditangani oleh engineer.
Aikido mengamati bahwa Qwen3.8-Max beberapa kali kembali ke CVE atau jalur penalaran yang sama. Pengulangan menjadi tidak efisien jika hanya menghabiskan giliran investigasi tanpa memperluas cakupan.
Namun, pemeriksaan kedua juga dapat mengungkap kondisi, jalur eksekusi, atau detail validasi yang terlewat sebelumnya. Solusi praktisnya berada pada tingkat harness, yaitu lapisan sistem yang mengatur interaksi agen dengan kode dan alat: catat apa yang sudah diuji, batasi percabangan berulang, dan arahkan kasus yang belum terselesaikan ke investigasi baru.
Dalam perbandingan terbaru, GLM-5.3 meningkat dari 24/32 menjadi 25/32, sambil mempertahankan profil biaya yang lebih rendah dibandingkan model frontier tertutup yang dibahas dalam benchmark.
Posisi ini membuatnya layak digunakan sebagai pekerja bervolume tinggi atau bagian dari ensemble. Manfaatnya akan paling terasa jika biaya yang lebih rendah dipakai untuk menjalankan lebih banyak investigasi, bukan sekadar menggantikan satu model dengan satu kali pemindaian.
Sistem penemuan kerentanan tidak seharusnya dinilai hanya dari satu angka di papan peringkat:
Penemuan awal membutuhkan recall tinggi dan perilaku investigasi yang beragam. Sebaliknya, peringatan produksi membutuhkan precision, bukti yang dapat direproduksi, deduplikasi, serta pemeringkatan risiko yang berguna.
Dengan demikian, model yang bagus untuk mencari sebanyak mungkin kemungkinan belum tentu cocok untuk langsung mengirim peringatan tanpa pemeriksaan kepada pengembang.
Performa model dalam tugas ini bersifat stokastik. Satu pengujian hanya mengambil satu jalur investigasi, sementara beberapa pengujian independen meningkatkan peluang sistem menjelajahi hipotesis yang berbeda.
Itulah sebabnya tiga pengujian DeepSeek yang relatif murah dapat menyamai atau melampaui cakupan total dari satu pengujian model frontier yang lebih mahal. Unit yang relevan bukan hanya satu pemanggilan model, melainkan keseluruhan investigasi: model, alat, prompt, batas giliran, memori, pengujian ulang, dan proses validasi. 3
Berdasarkan hasil tersebut, organisasi dapat memisahkan tahap penemuan dari tahap pengambilan keputusan:
Pendekatan berbasis routing seperti ini lebih tangguh daripada memperlakukan model open-weight dan model tertutup sebagai pengganti langsung satu sama lain.
Hasil Aikido berguna, tetapi bukan peringkat universal untuk semua model keamanan AI. Pengujian hanya mencakup 32 kerentanan nyata yang baru diungkap, tiga percobaan per model, dan harness agen tertentu. Hasilnya dapat berubah berdasarkan bahasa pemrograman, struktur repositori, akses alat, model ancaman, anggaran investigasi, serta toleransi organisasi terhadap false positive. 3
Kesimpulan yang paling dapat dipertanggungjawabkan lebih sempit, tetapi juga lebih berguna: dalam kondisi pengujian ini, model open-weight—terutama DeepSeek V4 Pro—dapat menyaingi atau melampaui model frontier tertutup jika didukung pengulangan dan orkestrasi yang baik.
Produk keamanan terbaik bukan selalu model dengan skor utama tertinggi. Yang lebih penting adalah sistem yang mampu menggabungkan penemuan luas, validasi yang andal, dan bukti yang dapat langsung ditindaklanjuti oleh engineer.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
DeepSeek V4 Pro 0813 menemukan 28 dari 32 kerentanan dalam tiga pengujian gabungan dengan biaya sekitar US$295—hasil recall tertinggi dalam benchmark tersebut, tetapi bukan jaminan bahwa satu kali pemanggilan akan men...
DeepSeek V4 Pro 0813 menemukan 28 dari 32 kerentanan dalam tiga pengujian gabungan dengan biaya sekitar US$295—hasil recall tertinggi dalam benchmark tersebut, tetapi bukan jaminan bahwa satu kali pemanggilan akan men... Hasil ini mendukung sistem keamanan yang terorkestrasi: gunakan model murah dan luas untuk penemuan awal, model yang konsisten atau presisi untuk validasi, serta tinjauan manusia untuk temuan yang berdampak besar.