DeepSeek V4 Pro 0813 odhalil při sloučení tří běhů 28 z 32 zranitelností za přibližně 295 dolarů. Výsledky favorizují orchestraci: levnější modely mohou široce hledat, konzistentní či přesné modely ověřovat nálezy a závažné případy by měl před nápravou posoudit člověk.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Benchmark společnosti Aikido z srpna 2026 porovnal 10 AI modelů při hledání 32 nedávno zveřejněných zranitelností. Každý model dostal tři pokusy. DeepSeek V4 Pro 0813 vedl v souhrnném recallu, když při sloučení všech tří běhů identifikoval 28 z 32 problémů za přibližně 295 dolarů. Hlavní závěr však není „vyberte si vítězný model“, ale spíše „navrhněte správný systém“. 3
DeepSeek V4 Pro 0813 dosáhl při spojení tří běhů 28 z 32 zranitelností, tedy 87,5% souhrnného recallu. To z něj dělá nejsilnější model pro fázi prvotního hledání. Výsledek je ale potřeba chápat jako skóre pass@3: neznamená, že jediná odpověď modelu spolehlivě odhalí 28 zranitelností.
Každý běh může prozkoumat jiné soubory, cesty v kódu nebo hypotézy o možném zneužití. Sloučení výsledků proto zvyšuje pokrytí díky rozmanitosti hledání. V praxi benchmark podporuje spouštění několika nezávislých vyšetřování namísto spoléhání na první odpověď modelu jako na kompletní bezpečnostní audit. 3
Tři běhy DeepSeeku Pro pokryly 28 z 32 zranitelností za zhruba 295 dolarů. Jeho hlavní předností byla šíře záběru: při spojení jednotlivých vyšetřování odhalil více problémů než ostatní testované modely.
To z něj činí vhodného kandidáta pro první fázi bezpečnostního procesu. Jeho nálezy však stále vyžadují ověření důkazy, odstranění duplicit a posouzení závažnosti, než se z nich stanou upozornění pro produkční vývoj.
Tři běhy varianty Flash našly 24 z 32 zranitelností za přibližně 108 dolarů. Menší model tak nabídl velmi zajímavý poměr pokrytí a ceny a hodí se pro levné paralelní skenování nebo další opakované běhy.
Flash ale automaticky není nejlepší závěrečný kontrolor. Jeho praktická hodnota spočívá ve zvýšení počtu vyšetřovacích pokusů v rámci rozpočtu. Výsledky pak může převzít selektivnější fáze ověřování. 3
Grok 4.6 vynikl opakovatelností: 21 zranitelností se objevilo ve všech třech jeho bězích. To je důležité pro týmy, které potřebují předvídatelné chování, stabilní reporty a méně rozdílů mezi jednotlivými skeny.
Jeho přednost se tedy liší od přednosti DeepSeeku Pro. Vysoce konzistentní model může být vhodnější pro pravidelný monitoring nebo standardizované procesy, i když průzkumnější model dosáhne vyššího souhrnného recallu.
Claude Opus 5 dosáhl souhrnného recallu 26 z 32, zatímco GPT-5.6 Sol 25 z 32. Oba modely zůstaly mezi výkonnými možnostmi, výsledky však zpochybnily předpoklad, že nejdražší uzavřený model musí automaticky nabídnout nejlepší pokrytí zranitelností.
Důvodem pro jejich nasazení by proto neměla být pouze značka nebo obecná pověst z jiných benchmarků. Týmy by měly posoudit, zda jejich způsob uvažování, reportování nebo kontroly přináší přidanou hodnotu v kombinaci se zbytkem bezpečnostního procesu. 3
Nejvýraznějším výsledkem Kimi K3 byla 92,3% souhrnná precision. Precision vyjadřuje, jak velká část nahlášených nálezů byla uznána jako oprávněná; neříká, kolik zranitelností model celkově objevil.
Díky tomu se Kimi hodí pro jinou úlohu než modely určené k širokému průzkumu. Agent s vysokým recallem může hledat ve velkém a tolerovat více šumu, zatímco přesný model může nálezy ověřovat, připravovat reporty a snižovat počet upozornění, která se dostanou až k vývojářům.
Aikido u Qwen3.8-Max pozorovalo opakované vracení ke stejnému CVE nebo ke stejné úvaze. Takové opakování je neefektivní, pokud spotřebovává další kroky bez rozšíření pokrytí. Zároveň ale může být užitečné, když druhé prověření odhalí přehlédnutou podmínku, cestu provedení nebo detail potřebný k ověření.
Praktickým řešením je sledování stavu na úrovni agentního systému. Agent by měl vědět, co už otestoval, opakované větve by měly mít stanovený limit a nevyřešené případy by se měly předat novému vyšetřování, nikoli automaticky znovu přehrávat.
GLM-5.3 se v aktualizovaném porovnání zlepšil z 24 z 32 na 25 z 32 a zároveň si zachoval nižší nákladový profil než zmiňované uzavřené modely z nejvyšší třídy. Díky tomu může sloužit jako pracovní model pro velké objemy úloh nebo jako součást ensemble přístupu.
Jeho hodnota roste zejména tehdy, když organizace využije nižší cenu a flexibilitu nasazení k provedení většího počtu vyšetřování, místo aby se spoléhala na jediný běh libovolného modelu.
Výkon systému pro hledání zranitelností nelze smysluplně zredukovat na jediné číslo v žebříčku:
Tyto metriky odpovídají různým provozním potřebám. Fáze objevování vyžaduje vysoký recall a různorodé vyšetřování. Produkční upozornění naopak potřebují vysokou přesnost, reprodukovatelné důkazy, odstranění duplicit a užitečné řazení podle rizika.
Model, který je skvělý při hledání možných problémů, proto nemusí být vhodný k přímému odesílání neověřených upozornění vývojářům.
Nejdůležitější systémové zjištění benchmarku je, že výkon modelů byl stochastický. Jeden běh představuje pouze jednu cestu vyšetřování. Několik nezávislých běhů zvyšuje šanci, že systém prozkoumá odlišné hypotézy.
Právě proto mohly tři relativně levné běhy DeepSeeku dosáhnout nebo překonat celkové pokrytí jediného běhu dražších modelů z nejvyšší třídy. Relevantní jednotkou tedy není jen volání modelu. Je jí celé vyšetřování: model, nástroje, prompt, limit kroků, paměť, opakované běhy a proces ověřování. 3
Nasazení inspirované těmito výsledky by mělo oddělit hledání od rozhodování:
Takové směrování úloh mezi modely je odolnější než přístup, který otevřené a uzavřené modely považuje za jednoduché zaměnitelné komponenty.
Výsledky Aikido jsou užitečné, nejde však o univerzální pořadí AI modelů pro kyberbezpečnost. Test zahrnoval 32 nedávno zveřejněných zranitelností, tři pokusy na model a konkrétní agentní prostředí. Výkon se může měnit podle programovacího jazyka, struktury repozitáře, přístupu k nástrojům, modelu hrozeb, rozpočtu na vyšetřování i tolerance organizace k falešně pozitivním nálezům. 3
Obhajitelný a praktičtější závěr je užší: v tomto konkrétním prostředí dokázaly open-weight modely, zejména DeepSeek V4 Pro, konkurovat uzavřeným modelům z nejvyšší třídy nebo je překonat, pokud byly podpořeny opakováním a orchestracemi. Vítězem bezpečnostního produktu proto nemusí být model s nejvyšším titulkovým skóre. Je jím systém, který spojí široké hledání, spolehlivé ověřování a důkazy, podle nichž mohou vývojáři skutečně jednat.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 odhalil při sloučení tří běhů 28 z 32 zranitelností za přibližně 295 dolarů.
DeepSeek V4 Pro 0813 odhalil při sloučení tří běhů 28 z 32 zranitelností za přibližně 295 dolarů. Výsledky favorizují orchestraci: levnější modely mohou široce hledat, konzistentní či přesné modely ověřovat nálezy a závažné případy by měl před nápravou posoudit člověk.