DeepSeek V4 Pro fandt 28 af 32 sårbarheder på tværs af tre samlede kørsler til en pris på cirka 295 dollar – benchmarkens bedste recall resultat, men ikke en garanti for én enkelt kørsel. Resultaterne taler for et orkestreret sikkerhedssystem: Brug brede og billige agenter til opdagelse, stabile eller præcise modell...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikidos benchmark fra august 2026 testede 10 AI-modeller mod 32 nyligt offentliggjorte sårbarheder. Hver model blev kørt tre gange, og resultaterne blev analyseret med fokus på blandt andet recall, precision, konsistens og omkostninger. DeepSeek V4 Pro 0813 førte med 28 af 32 fund til cirka 295 dollar, men den bredere konklusion handler mindre om at kåre én vinder og mere om at bygge et system, der kombinerer gentagne undersøgelser, validering og modelspecialisering. 3
DeepSeek V4 Pro 0813 nåede 28 af 32 sårbarheder, svarende til 87,5 procent samlet recall, når resultaterne fra tre kørsler blev lagt sammen. Det gør modellen til benchmarkens stærkeste i den indledende opdagelsesfase.
Tallet skal dog læses som et såkaldt pass@3-resultat – ikke som bevis på, at én enkelt kørsel pålideligt finder 28 sårbarheder.
Forskellige kørsler kan undersøge forskellige filer, angrebsveje og hypoteser om, hvordan en sårbarhed kan udnyttes. Når resultaterne samles, bliver dækningen større, fordi systemet får fordel af denne søgevariation. I praksis taler resultatet for at køre flere uafhængige undersøgelser i stedet for at betragte modellens første svar som en komplet sikkerhedsanalyse. 3
Tre kørsler med DeepSeek Pro dækkede 28 af 32 sårbarheder til en samlet pris på cirka 295 dollar. Modellens styrke var bredden: Den fandt flere af benchmarkens sårbarheder, når undersøgelserne blev kombineret.
Det gør den velegnet til første trin i et sikkerhedsworkflow. Fundene skal stadig valideres med dokumentation, deduplikeres og vurderes efter alvor, før de bør blive til alarmer i et produktionssystem.
Tre kørsler med Flash fandt 24 af 32 sårbarheder til omkring 108 dollar. Det giver den mindre model et attraktivt forhold mellem dækning og pris og gør den velegnet til billige parallelle scanninger eller ekstra kørsler.
Flash er ikke nødvendigvis den bedste afsluttende kontrollør. Modellens praktiske værdi ligger i at øge antallet af undersøgelser inden for et fast budget og derefter sende de samlede fund videre til et mere selektivt valideringstrin. 3
Grok 4.6 skilte sig ud ved sin gentagelighed: 21 sårbarheder blev fundet i alle tre kørsler. Det er vigtigt, når sikkerhedsteams har brug for forudsigelig adfærd, stabile rapporter og færre overraskelser fra scanning til scanning.
Styrken er en anden end DeepSeek Pros. En meget konsistent model kan være det bedste valg til løbende overvågning eller standardiserede workflows, selv om en mere udforskende model opnår højere samlet recall.
Claude Opus 5 nåede 26 af 32 i samlet recall, mens GPT-5.6 Sol nåede 25 af 32. Begge var fortsat stærke modeller, men resultaterne udfordrede antagelsen om, at den dyreste lukkede model nødvendigvis giver den bedste dækning af sårbarheder.
Grunden til at vælge en af modellerne bør derfor ikke alene være brandet eller dens generelle benchmarkomdømme. Teams bør vurdere, om modellens ræsonnement, rapportering eller evne til at gennemgå fund tilfører værdi i resten af sikkerhedspipelinen. 3
Kimi K3’s mest markante resultat var 92,3 procent samlet precision. Precision måler, hvor stor en andel af de rapporterede fund der blev accepteret – ikke hvor mange sårbarheder modellen fandt i alt.
Det gør Kimi nyttig i en anden rolle end en model, der søger så bredt som muligt. En agent med høj recall kan afsøge store områder og acceptere mere støj, mens en model med høj precision kan hjælpe med at verificere fund, udarbejde rapporter og begrænse antallet af alarmer, der ender hos udviklerne.
Aikido observerede, at Qwen3.8-Max vendte tilbage til den samme CVE eller det samme ræsonnementsspor. Det er ineffektivt, hvis det bruger undersøgelsestrin uden at øge dækningen. Men en ekstra gennemgang kan også være nyttig, hvis den afslører en overset betingelse, angrebsvej eller detalje i valideringen.
Den praktiske løsning ligger i selve agentens styringslag: Systemet bør vide, hvad der allerede er testet, gentagne grene bør have klare begrænsninger, og uafklarede sager bør sendes til en ny undersøgelse i stedet for automatisk at blive afspillet.
GLM-5.3 forbedrede sig fra 24 af 32 til 25 af 32 i den opdaterede sammenligning, samtidig med at modellen havde en lavere prisprofil end de lukkede frontier-alternativer, der blev diskuteret i benchmarken.
Det placerer den som en interessant kandidat til opgaver i stor skala eller som en del af et ensemble – især når organisationer kan bruge lavere omkostninger og større fleksibilitet til at køre flere undersøgelser.
Et system til at finde sårbarheder bør ikke reducere alle resultater til ét tal på en rangliste:
Målene beskriver forskellige behov i driften. Opdagelse kræver høj recall og forskellige undersøgelsesstrategier. Produktionsalarmer kræver høj precision, reproducerbar dokumentation, deduplikering og en brugbar risikorangering.
En model, der er fremragende til at finde mulige problemer, kan derfor være et dårligt valg til at sende ubekræftede alarmer direkte til udviklerne.
Benchmarkens vigtigste systemlæring er, at modellernes resultater var stokastiske. En enkelt kørsel prøver kun én undersøgelsesvej, mens flere uafhængige kørsler øger chancen for, at systemet udforsker forskellige hypoteser.
Det er forklaringen på, at tre forholdsvis billige DeepSeek-kørsler kunne matche eller overgå den samlede dækning fra én kørsel med dyrere frontier-modeller. Den relevante enhed er ikke kun selve modelkaldet. Det er hele undersøgelsen: model, værktøjer, prompt, grænse for antal trin, hukommelse, gentagelser og valideringsproces. 3
Et system baseret på resultaterne bør adskille opdagelse fra vurdering:
Denne modelrute er mere robust end at behandle open-weight- og lukkede modeller som direkte udskiftelige komponenter.
Aikidos resultater er nyttige, men de udgør ikke en universel rangliste over AI-modeller til cybersikkerhed. Testen omfattede 32 nyligt offentliggjorte sårbarheder, tre forsøg pr. model og en bestemt agentstruktur. Resultaterne kan ændre sig afhængigt af programmeringssprog, repository-struktur, værktøjsadgang, trusselsmodel, undersøgelsesbudget og organisationens tolerance over for falske positiver. 3
Den mest holdbare konklusion er derfor mere afgrænset: I denne opsætning kunne open-weight-modeller – især DeepSeek V4 Pro – matche eller overgå lukkede frontier-modeller, når de blev kombineret med gentagelser og orkestrering.
Det vindende sikkerhedsprodukt er ikke nødvendigvis modellen med den højeste overskriftsscore. Det er systemet, der kombinerer bred opdagelse, pålidelig validering og dokumentation, som udviklere faktisk kan handle på.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro fandt 28 af 32 sårbarheder på tværs af tre samlede kørsler til en pris på cirka 295 dollar – benchmarkens bedste recall resultat, men ikke en garanti for én enkelt kørsel.
DeepSeek V4 Pro fandt 28 af 32 sårbarheder på tværs af tre samlede kørsler til en pris på cirka 295 dollar – benchmarkens bedste recall resultat, men ikke en garanti for én enkelt kørsel. Resultaterne taler for et orkestreret sikkerhedssystem: Brug brede og billige agenter til opdagelse, stabile eller præcise modeller til validering og menneskelig kontrol ved alvorlige fund.