DeepSeek V4 Pro 0813 löysi kolmen yhdistetyn ajon aikana 28 Aikidon testaamasta 32 haavoittuvuudesta noin 295 dollarin kustannuksella. Vertailu suosii koordinoitua tietoturvajärjestelmää: edulliset mallit etsivät laajasti, tarkat mallit varmistavat löydöt ja ihmiset arvioivat merkittävät havainnot.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikidon elokuussa 2026 tekemässä vertailussa kymmenen tekoälymallia testattiin 32 hiljattain julkistetulla haavoittuvuudella. Jokainen malli sai kolme internetistä eristettyä, enintään 30 vuoron tutkimusajoa. Kun ajot yhdistettiin, DeepSeek V4 Pro 0813 löysi 28 haavoittuvuutta eli 87,5 prosenttia testijoukon löydöistä noin 295 dollarin kustannuksella. 3
Tulos on näyttävä, mutta sitä ei pidä tulkita niin, että malli löytäisi 28 haavoittuvuutta luotettavasti yhdellä käynnistyksellä. Kyseessä on kolmen ajon yhteenlaskettu pass@3-tulos: eri ajot voivat tutkia eri tiedostoja, koodipolkuja ja hyväksikäyttöhypoteeseja. Keskeinen opetus ei siis ole yhden voittajamallin valinta, vaan se, miten koko tutkimusjärjestelmä rakennetaan.
DeepSeek V4 Pro 0813 saavutti kolmen ajon yhteistuloksena 28/32 haavoittuvuutta eli 87,5 prosentin recall-arvon. Recall kertoo, kuinka suuren osan tunnetuista haavoittuvuuksista järjestelmä löytää uudelleen.
Mallin vahvuus oli ennen kaikkea laaja kattavuus. Kun tutkimuksia ajettiin useita kertoja, järjestelmä sai mahdollisuuden kokeilla toisistaan poikkeavia etenemisreittejä. Tämä tukee käytännössä ajatusta, että tietoturvatarkastuksessa kannattaa tehdä useita itsenäisiä tutkimuksia sen sijaan, että ensimmäistä mallin vastausta pidetään valmiina auditointina. 3
Löydöt on silti vielä validoitava, yhdistettävä päällekkäisyyksien poistamiseksi ja arvioitava vakavuuden mukaan ennen kuin niistä tehdään tuotantohälytyksiä.
DeepSeek V4 Flash 0731 löysi kolmella ajolla 24 haavoittuvuutta 32:sta noin 108 dollarilla. Se tekee mallista kiinnostavan vaihtoehdon rinnakkaisiin, edullisiin skannauksiin ja lisäajoihin.
Flash ei välttämättä ole paras lopullinen tarkastaja. Sen arvo on siinä, että samalla budjetilla voidaan tehdä useampia tutkimusyrityksiä ja siirtää yhdistetyt havainnot tarkempaan varmennusvaiheeseen. 3
Grok 4.6 erottui toistettavuudellaan: 21 haavoittuvuutta löytyi kaikissa kolmessa ajossa. Tämä on tärkeää organisaatioille, jotka tarvitsevat ennakoitavaa toimintaa, vakaita raportteja ja mahdollisimman vähän vaihtelua tarkastuksesta toiseen.
Grok vahvistaa eri asiaa kuin DeepSeek Pro. Tutkivassa haussa korkeampi kokonaiskattavuus voi olla tärkeintä, mutta jatkuvassa valvonnassa johdonmukainen malli voi olla käytännöllisempi.
Claude Opus 5 saavutti yhdistetyissä ajoissa 26/32 ja GPT-5.6 Sol 25/32. Molemmat olivat vahvoja vaihtoehtoja, mutta tulokset haastavat oletuksen, jonka mukaan kalleimman suljetun mallin pitäisi automaattisesti löytää eniten haavoittuvuuksia.
Mallia ei siksi kannata valita pelkän brändin tai yleisten vertailutulosten perusteella. Olennaista on, tuoko se tietoturvaputkeen lisäarvoa esimerkiksi päättelyssä, raportoinnissa tai löydösten arvioinnissa. 3
Kimi K3:n vahvin tulos oli 92,3 prosentin yhdistetty precision-arvo. Precision kertoo, kuinka suuri osa raportoiduista löydöistä hyväksyttiin oikeiksi – ei sitä, kuinka monta haavoittuvuutta malli löysi kaiken kaikkiaan.
Ero on käytännössä tärkeä. Korkean recallin malli voi etsiä laajasti ja tuottaa enemmän kohinaa, kun taas korkean precisionin malli voi auttaa varmistamaan havainnot, laatimaan raportteja ja vähentämään kehittäjille päätyvien turhien hälytysten määrää.
Aikido havaitsi Qwen3.8-Maxin palaavan ajoittain samaan CVE-haavoittuvuuteen tai päättelypolkuun. Se on tehotonta, jos tutkimusvuoroja kuluu jo testattujen hypoteesien toistamiseen. Toisaalta uusi tarkastelu voi joskus paljastaa aiemmin huomaamatta jääneen ehdon, suorituspolun tai varmennustiedon.
Ratkaisu löytyy agentin ohjauskerroksesta eli harnessista. Järjestelmän pitäisi seurata, mitä on jo testattu, rajoittaa toistuvia haaroja ja ohjata ratkaisemattomat tapaukset uuteen tutkimukseen automaattisen uudelleenajon sijaan.
GLM-5.3 paransi tulostaan päivitetyssä vertailussa 24/32:sta 25/32:een ja säilytti samalla suljettuja lippulaivamalleja matalamman kustannusprofiilin. Se sopii siten uskottavasti suuren volyymin työkaluksi tai yhdeksi osaksi mallien muodostamaa kokonaisuutta.
Sen hyöty kasvaa erityisesti silloin, kun matalampaa hintaa käytetään useampien tutkimusten ajamiseen yhden kalliin kertayrityksen sijaan.
Tietoturvajärjestelmää ei kannata arvioida yhden pisteluvun perusteella:
Laaja etsintä suosii korkeaa recallia ja erilaisia tutkimusstrategioita. Tuotantohälytykset puolestaan vaativat tarkkuutta, todisteita, päällekkäisten ilmoitusten yhdistämistä ja toimivaa riskien priorisointia.
Malli, joka on erinomainen mahdollisten ongelmien löytämisessä, voi siksi olla huono valinta suoraan kehittäjille lähetettävien, vahvistamattomien hälytysten tuottamiseen.
Vertailun tärkein järjestelmätason havainto oli mallien stokastisuus: yksi ajo näkee vain yhden tutkimuspolun. Useampi itsenäinen ajo kasvattaa todennäköisyyttä, että järjestelmä kokeilee erilaisia hypoteeseja.
Siksi kolme suhteellisen edullista DeepSeek-ajoa saattoi kilpailla kalliimpien lippulaivamallien yksittäisen ajon kanssa tai ylittää sen kokonaiskattavuudessa. Merkityksellinen yksikkö ei ole pelkkä mallikutsu, vaan koko tutkimus: malli, työkalut, kehote, vuorobudjetti, muisti, uusinta-ajot ja validointiprosessi. 3
Aikidon tulosten perusteella toimiva tietoturvatyönkulku erottaisi etsinnän ja päätöksenteon toisistaan:
Tällainen mallien roolitus on kestävämpi ratkaisu kuin avointen ja suljettujen mallien käsitteleminen toistensa yksinkertaisina korvaajina.
Aikidon tulokset ovat hyödyllisiä, mutta ne eivät muodosta yleispätevää tekoälymallien rankingia. Testissä käytettiin 32 hiljattain julkistettua todellista haavoittuvuutta, kolmea yritystä mallia kohden ja tiettyä agenttijärjestelmää. Tulokset voivat muuttua ohjelmointikielen, koodivaraston rakenteen, käytettävissä olevien työkalujen, uhkamallin, tutkimusbudjetin ja väärien positiivisten hälytysten sietokyvyn mukaan. 3
Kapeampi mutta perustellumpi johtopäätös on tämä: tässä testiasetelmassa avoimilla painoilla toimivat mallit, erityisesti DeepSeek V4 Pro, pystyivät kilpailemaan suljettujen lippulaivamallien kanssa tai päihittämään ne, kun käytössä olivat toistot ja hyvä orkestrointi.
Tietoturvan voittava tuote ei siis välttämättä ole malli, jolla on korkein otsikkoluku. Se on järjestelmä, joka yhdistää laajan etsinnän, luotettavan varmennuksen ja sellaiset todisteet, joiden perusteella insinöörit voivat toimia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 löysi kolmen yhdistetyn ajon aikana 28 Aikidon testaamasta 32 haavoittuvuudesta noin 295 dollarin kustannuksella.
DeepSeek V4 Pro 0813 löysi kolmen yhdistetyn ajon aikana 28 Aikidon testaamasta 32 haavoittuvuudesta noin 295 dollarin kustannuksella. Vertailu suosii koordinoitua tietoturvajärjestelmää: edulliset mallit etsivät laajasti, tarkat mallit varmistavat löydöt ja ihmiset arvioivat merkittävät havainnot.