DeepSeek V4 Pro 0813 wykrył 28 z 32 podatności po połączeniu wyników trzech uruchomień, a łączny koszt wyniósł około 295 dolarów. Benchmark przemawia za złożonym systemem bezpieczeństwa: tańsze modele powinny szeroko szukać problemów, dokładniejsze weryfikować zgłoszenia, a najtrudniejsze przypadki nadal wymagać dod...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Sierpniowy benchmark Aikido z 2026 roku objął 10 modeli AI, 32 niedawno ujawnione podatności oraz trzy próby dla każdego modelu. Analizy odbywały się bez dostępu do internetu, w ramach 30 tur pracy agenta. Po połączeniu wyników trzech uruchomień DeepSeek V4 Pro 0813 wykrył 28 z 32 luk, czyli osiągnął 87,5 proc. łącznego recallu, przy koszcie około 295 dolarów. 3
To jednak nie jest historia o jednym bezdyskusyjnym zwycięzcy. Najważniejszy wniosek z testu brzmi: skuteczność wykrywania podatności zależy od całego systemu — modelu, narzędzi, pamięci prowadzonego dochodzenia, liczby prób, sposobu walidacji i dalszego triage’u.
DeepSeek V4 Pro 0813 osiągnął wynik 28/32 po połączeniu trzech analiz. To najlepszy rezultat na etapie szerokiego wyszukiwania. Trzeba jednak czytać go jako wynik pass@3, a nie dowód, że pojedyncze uruchomienie modelu niezawodnie znajduje 28 podatności.
Każda próba może przejść przez inne pliki, ścieżki wykonania i hipotezy dotyczące potencjalnego exploita. Połączenie rezultatów zwiększa więc pokrycie, bo system korzysta z różnorodności poszukiwań. W praktyce oznacza to, że kilka niezależnych analiz może być skuteczniejsze niż traktowanie pierwszej odpowiedzi modelu jako kompletnego audytu bezpieczeństwa. 3
Trzy uruchomienia DeepSeek Pro znalazły łącznie 28 z 32 podatności za około 295 dolarów. Przewaga modelu polegała przede wszystkim na szerokości poszukiwań — po połączeniu analiz ujawnił więcej luk niż konkurenci.
To czyni go dobrym kandydatem do pierwszego etapu audytu. Jego zgłoszenia nadal trzeba jednak poprzeć dowodami, połączyć duplikaty i poddać ocenie pod kątem rzeczywistej wagi problemu, zanim trafią do zespołu deweloperskiego jako alerty produkcyjne.
Trzy analizy wersji Flash wykryły 24 z 32 podatności, a ich koszt wyniósł około 108 dolarów. To bardzo atrakcyjny stosunek pokrycia do ceny, szczególnie w przypadku równoległych skanów i dodatkowych powtórzeń.
Flash nie musi być najlepszym końcowym recenzentem. Jego mocną stroną jest możliwość przeprowadzenia większej liczby prób w ramach ograniczonego budżetu, a następnie przekazania połączonych wyników do bardziej selektywnego etapu weryfikacji. 3
Grok 4.6 wyróżnił się przede wszystkim powtarzalnością. 21 podatności pojawiło się we wszystkich trzech jego uruchomieniach. Taka stabilność ma znaczenie dla organizacji, które potrzebują przewidywalnego zachowania, spójnych raportów i mniejszej liczby niespodzianek między kolejnymi skanami.
To inny rodzaj przewagi niż w przypadku DeepSeek Pro. Model o wysokiej powtarzalności może lepiej sprawdzić się w stałym monitoringu lub standaryzowanych procesach, nawet jeśli model bardziej eksploracyjny osiąga wyższy łączny recall.
Claude Opus 5 osiągnął 26/32 po połączeniu wyników, a GPT-5.6 Sol — 25/32. Oba modele pozostały bardzo skutecznymi opcjami, ale wyniki podważyły założenie, że najdroższy zamknięty model musi automatycznie zapewniać najlepsze pokrycie podatności.
Wybór któregoś z nich powinien wynikać z jego konkretnej roli w potoku bezpieczeństwa — na przykład jakości rozumowania, raportowania lub dodatkowej weryfikacji — a nie wyłącznie z marki czy pozycji w ogólnych rankingach. 3
Najmocniejszym wynikiem Kimi K3 była łączna precyzja na poziomie 92,3 proc. Precision, czyli precyzja, odpowiada na inne pytanie niż recall: pokazuje, jaka część zgłoszonych ustaleń została zaakceptowana, a nie ile wszystkich podatności udało się znaleźć.
Dlatego Kimi może być szczególnie przydatny jako weryfikator, narzędzie do przygotowywania raportów albo komponent ograniczający liczbę alertów trafiających do inżynierów. Model o wysokim recallu może szukać szeroko i generować więcej szumu, natomiast model o wysokiej precyzji pomaga odsiać fałszywe alarmy.
Aikido zauważyło, że Qwen3.8-Max wracał do tych samych CVE lub ścieżek rozumowania. To nieefektywne, jeśli kolejne tury nie zwiększają pokrycia. Powtórna analiza może jednak także ujawnić przeoczony warunek, dodatkową ścieżkę wykonania albo brakujący dowód.
Rozwiązaniem powinno być zarządzanie stanem na poziomie całego systemu. Agent musi wiedzieć, które pliki i hipotezy zostały już sprawdzone, powtarzające się gałęzie powinny mieć ograniczenia, a nierozstrzygnięte przypadki warto kierować do nowego dochodzenia zamiast bez końca odtwarzać tę samą ścieżkę.
W zaktualizowanym porównaniu GLM-5.3 poprawił wynik z 24/32 do 25/32, zachowując niższy profil kosztowy niż omawiane zamknięte modele z najwyższej półki. Dzięki temu może być użytecznym narzędziem do pracy na dużą skalę albo elementem zespołu kilku modeli.
Jego wartość rośnie wtedy, gdy organizacja wykorzystuje niższy koszt i elastyczność wdrożenia do uruchamiania większej liczby analiz, zamiast polegać na pojedynczym przejściu dowolnego modelu.
Jedna liczba w tabeli nie opisuje całej wartości systemu wykrywania podatności:
Na etapie odkrywania liczą się wysoki recall i różnorodność poszukiwań. Alerty trafiające bezpośrednio do zespołu produkcyjnego wymagają natomiast wysokiej precyzji, powtarzalnych dowodów, usuwania duplikatów i sensownego priorytetyzowania ryzyka.
Model, który świetnie znajduje potencjalne problemy, nie musi więc być dobrym wyborem do automatycznego wysyłania niezweryfikowanych zgłoszeń deweloperom.
Benchmark pokazał, że wyniki modeli są losowe w praktycznym sensie: pojedyncza analiza wybiera tylko jedną ścieżkę dochodzenia, a kolejne uruchomienia mogą sprawdzać inne hipotezy.
Z tego powodu trzy relatywnie tanie analizy DeepSeek mogły dorównać lub przewyższyć łączne pokrycie uzyskane w pojedynczym przejściu droższych modeli z najwyższej półki. Właściwą jednostką oceny nie jest więc samo wywołanie modelu, lecz kompletne dochodzenie: model, narzędzia, prompt, limit tur, pamięć, powtórzenia i proces walidacji. 3
Na podstawie tych wyników organizacja mogłaby rozdzielić etap odkrywania od etapu oceny:
Takie kierowanie zadań między modelami jest bardziej odporne niż traktowanie modeli open-weight i zamkniętych jako prostych zamienników jeden do jednego.
Wyniki Aikido są interesujące, ale nie stanowią uniwersalnego rankingu modeli do cyberbezpieczeństwa. Test obejmował 32 niedawno ujawnione podatności, trzy próby dla każdego modelu i konkretny system narzędzi oraz orkiestracji. Rezultaty mogą się zmienić zależnie od języka programowania, struktury repozytorium, dostępu do narzędzi, modelu zagrożeń, budżetu analizy oraz tolerancji organizacji na fałszywe alarmy. 3
Najostrożniejszy i zarazem najbardziej użyteczny wniosek jest węższy: w tym ustawieniu modele open-weight, szczególnie DeepSeek V4 Pro, mogły dorównać lub przewyższyć zamknięte modele z najwyższej półki, gdy wsparto je powtarzaniem analiz i dobrą orkiestracją.
Najlepszym produktem bezpieczeństwa nie musi być zatem model z najwyższym wynikiem na pierwszym miejscu tabeli. Wygrywa system, który łączy szerokie wykrywanie, rzetelną walidację i dowody, na podstawie których inżynierowie mogą rzeczywiście działać.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 wykrył 28 z 32 podatności po połączeniu wyników trzech uruchomień, a łączny koszt wyniósł około 295 dolarów.
DeepSeek V4 Pro 0813 wykrył 28 z 32 podatności po połączeniu wyników trzech uruchomień, a łączny koszt wyniósł około 295 dolarów. Benchmark przemawia za złożonym systemem bezpieczeństwa: tańsze modele powinny szeroko szukać problemów, dokładniejsze weryfikować zgłoszenia, a najtrudniejsze przypadki nadal wymagać dodatkowej analizy i udziału czło...