DeepSeek V4 Pro 0813 vond in drie gecombineerde runs 28 van de 32 kwetsbaarheden voor ongeveer $295. De benchmark pleit voor een georkestreerd systeem: gebruik goedkope modellen voor brede ontdekking, preciezere modellen voor controle en menselijke beoordeling voor ingrijpende bevindingen.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Een benchmark van Aikido uit augustus 2026 testte tien AI-modellen op 32 recent openbaar gemaakte kwetsbaarheden. Elk model kreeg drie onafhankelijke runs. DeepSeek V4 Pro 0813 kwam, wanneer de resultaten van die runs werden samengevoegd, uit op 28 ontdekte kwetsbaarheden voor ongeveer $295. 3
Dat klinkt als een duidelijke overwinning voor één model. De bredere conclusie is genuanceerder: bij AI-gestuurde beveiligingsonderzoeken bepaalt niet alleen het model de uitkomst, maar ook de manier waarop het wordt ingezet. Herhaalde onderzoeken, geheugen voor eerdere stappen, validatie en taakverdeling tussen modellen kunnen minstens zo belangrijk zijn.
DeepSeek V4 Pro 0813 bereikte een gepoolde recall van 28 op 32, oftewel 87,5 procent, over drie runs. Daarmee was het in deze test het sterkste model voor de ontdekkingsfase.
De score moet wel worden gelezen als een pass@3-resultaat. Het betekent niet dat één aanroep van het model betrouwbaar 28 kwetsbaarheden vindt. Verschillende runs kunnen andere bestanden, aanvalspaden en exploit-hypotheses onderzoeken. Door die uitkomsten te combineren, groeit de totale dekking.
Praktisch gezien ondersteunt de benchmark dus een aanpak met meerdere onafhankelijke onderzoeken, in plaats van blind te vertrouwen op het eerste antwoord van één model. 3
DeepSeek Pro vond in drie runs samen 28 van de 32 kwetsbaarheden voor ongeveer $295. De kracht lag vooral in de breedte: wanneer de onderzoeken werden samengevoegd, kwamen meer verschillende problemen aan het licht.
Dat maakt het model geschikt voor de eerste fase van een beveiligingsworkflow. De resultaten moeten daarna nog worden gevalideerd aan de hand van bewijs, ontdubbeld en op ernst beoordeeld voordat ze als productiewaarschuwing naar ontwikkelaars gaan.
Drie runs van DeepSeek Flash vonden 24 van de 32 kwetsbaarheden voor ongeveer $108. Dat is een sterke verhouding tussen dekking en kosten. Het model is daardoor interessant voor parallelle scans, extra pogingen en grootschalige verkenning binnen een vast budget.
Flash hoeft daarmee niet automatisch de beste eindbeoordelaar te zijn. De meerwaarde zit vooral in het vergroten van het aantal onderzoekspogingen, waarna een selectiever model de gecombineerde bevindingen kan controleren. 3
Grok 4.6 viel op door zijn herhaalbaarheid. 21 kwetsbaarheden kwamen in alle drie de runs terug. Dat is belangrijk voor teams die voorspelbaar gedrag, stabiele rapporten en weinig variatie tussen scans nodig hebben.
Die kwaliteit verschilt van de brede zoekstrategie van DeepSeek Pro. Een zeer consistent model kan aantrekkelijker zijn voor periodieke monitoring of gestandaardiseerde processen, ook als een meer verkennend model in totaal een hogere recall haalt.
Claude Opus 5 kwam uit op 26 van de 32 kwetsbaarheden in de gecombineerde resultaten. GPT-5.6 Sol bereikte 25 van de 32. Beide bleven sterke opties in het onderzoek, maar de resultaten ondergraven de aanname dat het duurste gesloten model vanzelf de beste dekking biedt.
De keuze voor deze modellen zou daarom niet alleen moeten draaien om merknaam of algemene benchmarkreputatie. Belangrijker is of hun redeneerkwaliteit, rapportage of reviewgedrag een aanvulling vormt op de rest van de beveiligingsketen. 3
Kimi K3 had een opvallende gepoolde precisie van 92,3 procent. Precisie meet welk deel van de gerapporteerde bevindingen werd geaccepteerd; het zegt niet hoeveel kwetsbaarheden het model in totaal ontdekte.
Dat onderscheid maakt Kimi geschikt voor een andere rol dan een model dat vooral breed zoekt. Een agent met hoge recall kan veel mogelijke problemen verzamelen en daarbij meer ruis produceren. Een model met hoge precisie kan vervolgens bevindingen controleren, rapporten voorbereiden en het aantal meldingen voor engineers beperken.
Aikido zag dat Qwen3.8-Max soms dezelfde CVE of redeneerroute opnieuw onderzocht. Dat is inefficiënt wanneer onderzoekstijd wordt verbruikt zonder dat de dekking toeneemt. Tegelijkertijd kan een tweede blik nuttig zijn als die een gemiste voorwaarde, uitvoeringsroute of validatiedetail blootlegt.
De oplossing ligt vooral in de agentomgeving rond het model. Houd bij welke bestanden en hypotheses al zijn onderzocht, begrens herhaalde vertakkingen en stuur onopgeloste gevallen door naar een nieuwe onderzoekslijn in plaats van dezelfde stap automatisch te herhalen.
GLM-5.3 verbeterde in de bijgewerkte vergelijking van 24/32 naar 25/32, terwijl het goedkoper bleef dan de besproken gesloten frontiermodellen. Daarmee is het een geloofwaardige kandidaat voor werk met een hoog volume of als onderdeel van een ensemble.
De waarde ervan wordt het grootst wanneer organisaties de lagere kosten gebruiken om meer onderzoeken uit te voeren, in plaats van uitsluitend één poging van welk model dan ook te draaien.
Een systeem voor het vinden van kwetsbaarheden moet niet worden teruggebracht tot één ranglijstcijfer:
Deze maatstaven beantwoorden verschillende operationele vragen. De ontdekkingsfase heeft baat bij hoge recall en uiteenlopende onderzoekspaden. Productiewaarschuwingen vragen juist om precisie, reproduceerbaar bewijs, deduplicatie en een bruikbare inschatting van het risico.
Een model dat uitstekend is in het verzamelen van mogelijke problemen, is daarom niet automatisch geschikt om ongereviewde meldingen rechtstreeks naar ontwikkelaars te sturen.
De belangrijkste systeemles uit de benchmark is dat modelprestaties stochastisch waren. Eén run verkent slechts één onderzoekspad; meerdere onafhankelijke runs vergroten de kans dat ook andere hypotheses worden getest.
Daarom konden drie relatief goedkope runs met DeepSeek de totale dekking van één duurdere run met een frontiermodel evenaren of overtreffen. De relevante eenheid is niet alleen de modelaanroep, maar het volledige onderzoek: model, tools, prompt, aantal stappen, geheugen, herhalingen en validatie. 3
Een beveiligingssysteem dat op deze resultaten voortbouwt, zou ontdekking en beoordeling uit elkaar halen:
Deze aanpak met modelroutering is robuuster dan open-weight- en gesloten modellen simpelweg als uitwisselbare onderdelen behandelen.
De resultaten van Aikido zijn nuttig, maar vormen geen universele ranglijst van AI-modellen voor beveiliging. De test omvatte 32 recent openbaar gemaakte kwetsbaarheden, drie pogingen per model en één specifieke agentomgeving. Prestaties kunnen veranderen door de programmeertaal, de structuur van een repository, beschikbare tools, het dreigingsmodel, het onderzoeksbudget en de tolerantie voor fout-positieve meldingen. 3
De meest verdedigbare conclusie is daarom beperkt maar relevant: in deze test konden open-weightmodellen, met DeepSeek V4 Pro als uitschieter, gesloten frontiermodellen evenaren of overtreffen wanneer ze werden gecombineerd met herhaling en goede orkestratie.
Het beste beveiligingsproduct is dus niet noodzakelijk het model met het hoogste opvallende cijfer. Het is het systeem dat brede ontdekking koppelt aan betrouwbare validatie en bewijs waar engineers daadwerkelijk mee aan de slag kunnen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 vond in drie gecombineerde runs 28 van de 32 kwetsbaarheden voor ongeveer $295.
DeepSeek V4 Pro 0813 vond in drie gecombineerde runs 28 van de 32 kwetsbaarheden voor ongeveer $295. De benchmark pleit voor een georkestreerd systeem: gebruik goedkope modellen voor brede ontdekking, preciezere modellen voor controle en menselijke beoordeling voor ingrijpende bevindingen.