DeepSeek V4 Pro 0813 fant 28 av 32 sårbarheter gjennom tre samlede kjøringer, til en kostnad på rundt 295 dollar – testens beste resultat for samlet recall. Resultatene taler for et orkestrert sikkerhetssystem: rimelige agenter kan lete bredt, presise modeller kan kontrollere funn, og mennesker bør vurdere alvorlige...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikidos benchmark fra august 2026 testet ti KI-modeller mot 32 nylig offentliggjorte sårbarheter. Hver modell fikk tre forsøk. DeepSeek V4 Pro 0813 ledet den samlede recall-scoren med 28 av 32 funn, til en kostnad på rundt 295 dollar. Men den viktigste lærdommen handler mindre om å kåre én vinner og mer om å bygge et system som kombinerer gjentatte undersøkelser, validering og spesialisering mellom modeller. 3
DeepSeek V4 Pro 0813 nådde 28 av 32 sårbarheter, eller 87,5 prosent samlet recall, når resultatene fra tre kjøringer ble slått sammen. Det gjør modellen til testens sterkeste på oppdagelsesstadiet. Tallet må likevel forstås som et såkalt pass@3-resultat – ikke som bevis på at én enkelt kjøring pålitelig finner 28 sårbarheter.
Ulike kjøringer kan utforske forskjellige filer, angrepsbaner og hypoteser om hvordan en sårbarhet kan utnyttes. Når funnene samles, øker dekningen fordi systemet får fordel av dette søkemangfoldet. I praksis støtter resultatet ideen om flere uavhengige undersøkelser, i stedet for å behandle modellens første svar som en komplett sikkerhetsanalyse. 3
Tre kjøringer med DeepSeek Pro dekket 28 av 32 sårbarheter for omtrent 295 dollar. Fordelen var bredden: Modellen avdekket flere av testens sårbarheter når undersøkelsene ble sett under ett.
Det gjør den velegnet som første ledd i en sikkerhetsprosess. Funnene bør likevel gjennom en egen kontroll med dokumentasjon, sammenslåing av duplikater og vurdering av alvorlighetsgrad før de blir produksjonsvarsler.
Tre kjøringer med Flash fant 24 av 32 sårbarheter for rundt 108 dollar. Det gir den mindre modellen et attraktivt forhold mellom dekning og kostnad, og gjør den egnet til parallelle skanninger eller ekstra kjøringer innenfor et fast budsjett.
Flash er ikke nødvendigvis den beste sluttkontrolløren. Den største praktiske verdien ligger i å øke antallet undersøkelser uten at kostnadene løper fra teamet. Funnene kan deretter sendes videre til et mer selektivt valideringsledd. 3
Grok 4.6 skilte seg ut med høyest gjentakbarhet: 21 sårbarheter dukket opp i alle tre kjøringene. Det er viktig for team som trenger forutsigbar oppførsel, stabile rapporter og færre overraskelser mellom skanninger.
Styrken er en annen enn DeepSeek Pros. En svært konsistent modell kan være et bedre valg for løpende overvåking eller standardiserte arbeidsflyter, selv om en mer utforskende modell oppnår høyere samlet recall.
Claude Opus 5 nådde 26 av 32 i samlet recall, mens GPT-5.6 Sol nådde 25 av 32. Begge var sterke alternativer, men resultatene utfordret antakelsen om at den dyreste lukkede modellen automatisk gir best dekning av sårbarheter.
Grunnen til å velge en av dem bør derfor ikke bare være merkenavn eller plassering på generelle KI-lister. Team bør undersøke om modellens resonnering, rapportering eller kontrollarbeid faktisk tilfører verdi i den samlede sikkerhetsprosessen. 3
Kimi K3s tydeligste resultat var 92,3 prosent samlet presisjon. Presisjon viser hvor stor andel av de rapporterte funnene som ble godkjent – ikke hvor mange sårbarheter modellen fant totalt.
Det gjør Kimi nyttig i en annen rolle enn en modell som søker bredt. En agent med høy recall kan lete over store områder og tåle mer støy. En modell med høy presisjon kan på sin side kontrollere funn, klargjøre rapporter og redusere antallet varsler som til slutt når utviklerne.
Aikido observerte at Qwen3.8-Max enkelte ganger gikk tilbake til samme CVE eller samme resonneringsspor. Det er ineffektivt når undersøkelsesrunder brukes på hypoteser som allerede er testet. Samtidig kan en ny gjennomgang av og til avdekke en oversett betingelse, kjøringsbane eller detalj i valideringen.
Den praktiske løsningen ligger i agentoppsettet: Systemet bør holde oversikt over hva som allerede er undersøkt, begrense gjentatte spor og sende uavklarte saker til en ny undersøkelse i stedet for automatisk å spille av samme prosess på nytt.
GLM-5.3 forbedret seg fra 24 av 32 til 25 av 32 i den oppdaterte sammenligningen, samtidig som kostnadsprofilen fortsatt var lavere enn for de lukkede frontmodellene i testen. Det gjør modellen aktuell som høyvolumarbeider eller som del av et ensemble.
Verdien blir størst når organisasjoner bruker lavere kostnad og større distribusjonsfleksibilitet til å kjøre flere undersøkelser, i stedet for å stole på én enkelt gjennomgang fra en hvilken som helst modell.
Et system for å finne sårbarheter bør ikke reduseres til ett tall på en rangering:
Måltallene beskriver ulike behov. Oppdagelse belønner høy recall og variert undersøkelsesatferd. Varsling i produksjon krever høy presisjon, etterprøvbare bevis, sammenslåing av duplikater og nyttig risikorangering.
En modell som er god til å finne mulige problemer, kan derfor være et dårlig valg for å sende ubearbeidede varsler direkte til utviklerne.
Den viktigste systemlærdommen fra testen er at modellresultatene var tilfeldighetsavhengige. Én kjøring utforsker bare én mulig undersøkelsesbane. Flere uavhengige kjøringer øker sjansen for at systemet prøver forskjellige hypoteser.
Det forklarer hvorfor tre relativt rimelige kjøringer med DeepSeek kunne konkurrere med eller overgå den samlede dekningen fra én dyrere kjøring med en frontmodell. Den relevante enheten er ikke bare modellkallet. Det er hele undersøkelsen: modell, verktøy, instruksjoner, antall trinn, minne, nye kjøringer og valideringsprosess. 3
En løsning basert på disse resultatene bør skille mellom å lete og å avgjøre:
Denne typen modellruting er mer robust enn å behandle åpne og lukkede modeller som enkle erstatninger for hverandre.
Aikidos resultater er interessante, men de utgjør ikke en universell rangering av KI-modeller for sikkerhet. Testen omfattet 32 nylig offentliggjorte sårbarheter, tre forsøk per modell og ett bestemt agentoppsett. Resultatene kan endre seg med programmeringsspråk, kodebasens struktur, tilgang til verktøy, trusselmodell, undersøkelsesbudsjett og organisasjonens toleranse for falske positiver. 3
Den mest holdbare konklusjonen er derfor mer avgrenset: I denne testen kunne modeller med åpne vekter – særlig DeepSeek V4 Pro – konkurrere med eller overgå lukkede frontmodeller når de ble kombinert med gjentatte kjøringer og god orkestrering.
Det beste sikkerhetsproduktet er ikke nødvendigvis modellen med høyest overskriftstall. Det er systemet som kombinerer bred oppdagelse, pålitelig validering og dokumentasjon ingeniører faktisk kan handle på.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 fant 28 av 32 sårbarheter gjennom tre samlede kjøringer, til en kostnad på rundt 295 dollar – testens beste resultat for samlet recall.
DeepSeek V4 Pro 0813 fant 28 av 32 sårbarheter gjennom tre samlede kjøringer, til en kostnad på rundt 295 dollar – testens beste resultat for samlet recall. Resultatene taler for et orkestrert sikkerhetssystem: rimelige agenter kan lete bredt, presise modeller kan kontrollere funn, og mennesker bør vurdere alvorlige varsler.