DeepSeek V4 Pro hittade 28 av 32 sårbarheter i tre sammanslagna körningar för cirka 295 dollar – benchmarkets bästa resultat för täckning, men inte en garanti för en enskild körning. Resultaten talar för ett orkestrerat säkerhetssystem: använd billiga och breda agenter för upptäckt, konsekventa eller precisa modelle...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikidos benchmark från augusti 2026 testade tio AI-modeller mot 32 nyligen offentliggjorda sårbarheter. Varje modell fick tre försök, och resultaten visar att framgångsrik sårbarhetsjakt handlar om mer än att utse en ensam vinnare. Upprepade undersökningar, validering och rätt modell för rätt uppgift spelar minst lika stor roll. 3
DeepSeek V4 Pro 0813 nådde 28 av 32 sårbarheter, motsvarande 87,5 procents samlad täckning, när tre körningar räknades ihop. Det var benchmarkets starkaste resultat i upptäcktsfasen – till en kostnad på ungefär 295 dollar. 3
Siffran ska dock läsas som ett så kallat pass@3-resultat. Den betyder inte att en enda körning pålitligt hittar 28 sårbarheter. Olika körningar kan undersöka olika filer, kodvägar och hypoteser om hur ett angrepp skulle kunna genomföras. När resultaten slås samman ökar täckningen tack vare denna sökbredd.
Den praktiska lärdomen är därför tydlig: kör flera oberoende undersökningar i stället för att behandla modellens första svar som en komplett säkerhetsgranskning.
DeepSeek Pro ledde den samlade täckningen med 28 av 32 fynd i tre körningar för cirka 295 dollar. Fördelen låg framför allt i bredden – modellen lyckades hitta fler av benchmarkets sårbarheter när resultaten från flera undersökningar kombinerades.
Det gör modellen väl lämpad för den första fasen i ett säkerhetsflöde. Fynden behöver därefter styrkas med bevis, slås ihop om de gäller samma problem och granskas utifrån allvarlighetsgrad innan de blir produktionslarm.
Tre körningar med Flash hittade 24 av 32 sårbarheter för ungefär 108 dollar. Det ger modellen en stark täckning per krona och gör den intressant för parallella skanningar eller extra körningar när budgeten är begränsad. 3
Flash är däremot inte automatiskt det bästa valet som slutgranskare. Dess främsta värde ligger i att öka antalet undersökningar inom en fast kostnadsram, varefter resultaten kan lämnas vidare till en mer selektiv verifieringsfas.
Grok 4.6 utmärkte sig genom sin upprepningsbarhet: 21 sårbarheter hittades i alla tre körningarna. Den typen av konsekvens är viktig för team som behöver förutsägbara resultat, stabila rapporter och färre överraskningar mellan återkommande skanningar.
Styrkan är dock en annan än DeepSeek Pros. En mycket konsekvent modell kan vara att föredra för löpande övervakning eller standardiserade arbetsflöden, även om en mer utforskande modell når högre samlad täckning.
Claude Opus 5 nådde 26 av 32 i samlad täckning, medan GPT-5.6 Sol nådde 25 av 32. Båda var starka alternativ, men resultaten utmanar föreställningen att den dyraste slutna modellen automatiskt ger bäst täckning av sårbarheter. 3
Valet bör därför inte enbart bygga på varumärke eller resultat från allmänna AI-tester. Team behöver i stället undersöka om modellens resonemang, rapportering eller granskningsbeteende tillför något i den övriga säkerhetskedjan.
Kimi K3:s tydligaste styrka var 92,3 procents samlad precision. Precision mäter hur stor andel av de rapporterade fynden som godkänns – inte hur många sårbarheter modellen hittar totalt.
Skillnaden är viktig. En modell med hög täckning kan söka brett och acceptera mer brus, medan en modell med hög precision kan hjälpa till att verifiera fynd, skriva rapporter och minska antalet larm som når utvecklarna.
Kimi kan därför passa bättre som verifierare eller för prioritering än som ensam modell i den första, breda jakten.
Aikido noterade att Qwen3.8-Max ibland återvände till samma CVE eller samma resonemangsspår. Det är ineffektivt när undersökningsturer förbrukas utan att täckningen ökar. Samtidigt kan en andra granskning ibland avslöja ett missat villkor, en annan körväg eller en detalj som behövs för att bekräfta fyndet.
Lösningen bör därför ligga i agentens styrsystem. Systemet behöver hålla reda på vad som redan har testats, sätta gränser för upprepade grenar och skicka olösta fall vidare till en ny undersökning i stället för att automatiskt spela upp samma spår igen.
GLM-5.3 förbättrades från 24 av 32 till 25 av 32 i den uppdaterade jämförelsen, samtidigt som modellen behöll en lägre kostnadsprofil än de slutna frontier-modellerna i benchmarket. Det gör den till en möjlig högvolymarbetare eller en del av en modellensemble.
Värdet blir störst när den lägre kostnaden används för att köra fler undersökningar – inte när organisationer förlitar sig på en enda körning från någon modell.
Ett system för att hitta sårbarheter bör inte reduceras till en enda siffra på en topplista:
Måtten beskriver olika behov. Upptäckt gynnas av hög täckning och varierade undersökningsvägar. Produktionslarm kräver däremot precision, reproducerbara bevis, sammanslagning av dubbletter och användbar riskprioritering.
En modell som är bra på att hitta möjliga problem kan alltså vara ett dåligt val för att skicka ogranskade larm direkt till utvecklare.
Benchmarkets viktigaste systeminsikt är att modellernas prestationer var stokastiska. En enskild körning följer bara en undersökningsväg. Flera oberoende körningar ökar chansen att systemet prövar olika hypoteser.
Det är också därför tre relativt billiga körningar med DeepSeek kunde konkurrera med eller överträffa den totala täckningen från en enda körning med dyrare frontier-modeller. Den relevanta enheten är inte bara ett modell-anrop, utan hela undersökningen: modell, verktyg, instruktioner, turbudget, minne, omkörningar och validering. 3
En lösning som bygger på resultaten bör skilja upptäckt från bedömning:
Ett sådant flöde med modellstyrning är mer robust än att behandla öppna och slutna modeller som enkla ersättare för varandra.
Aikidos resultat är användbara, men de utgör inte en universell ranking av AI-modeller för cybersäkerhet. Testet omfattade 32 nyligen offentliggjorda sårbarheter, tre försök per modell och ett specifikt agentramverk. Resultaten kan förändras beroende på programmeringsspråk, kodbasens struktur, verktygstillgång, hotmodell, undersökningsbudget och organisationens tolerans för falska positiva. 3
Den mest hållbara slutsatsen är därför mer begränsad – och mer praktiskt användbar: i just detta upplägg kunde öppna modeller, särskilt DeepSeek V4 Pro, mäta sig med eller överträffa slutna frontier-modeller när de kombinerades med upprepning och orkestrering.
Den vinnande säkerhetsprodukten är alltså inte nödvändigtvis modellen med högst rubriksiffra. Det är systemet som förenar bred upptäckt, tillförlitlig validering och bevis som ingenjörer faktiskt kan agera på.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro hittade 28 av 32 sårbarheter i tre sammanslagna körningar för cirka 295 dollar – benchmarkets bästa resultat för täckning, men inte en garanti för en enskild körning.
DeepSeek V4 Pro hittade 28 av 32 sårbarheter i tre sammanslagna körningar för cirka 295 dollar – benchmarkets bästa resultat för täckning, men inte en garanti för en enskild körning. Resultaten talar för ett orkestrerat säkerhetssystem: använd billiga och breda agenter för upptäckt, konsekventa eller precisa modeller för validering och mänsklig granskning av allvarliga fynd.