DeepSeek V4 Pro 0813 виявив 28 із 32 вразливостей у трьох об’єднаних запусках за приблизно $295 — це найкращий результат за повнотою виявлення, але не гарантія для одного запуску. Результати говорять на користь оркестрованої системи: недорогі моделі шукають широко, точніші перевіряють знахідки, а складні випадки та...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
У серпні 2026 року Aikido протестувала 10 AI-моделей на 32 нещодавно розкритих уразливостях. Кожну модель запускали тричі, а результати об’єднували, щоб оцінити загальне покриття. DeepSeek V4 Pro 0813 показала найкращий pooled recall — 28 із 32 вразливостей, або 87,5%, — за приблизно $295. Але ширший висновок тесту полягає не в тому, що одна модель остаточно перемогла всіх конкурентів. Важливішою виявилася архітектура системи: повторні розслідування, перевірка доказів, розподіл ролей між моделями та контроль людини. 3
DeepSeek V4 Pro 0813 досягла показника 28 із 32 вразливостей у трьох об’єднаних запусках. Це робить її найсильнішою моделлю на етапі первинного пошуку.
Водночас 28/32 — це результат pass@3, а не доказ того, що один запуск стабільно знаходить 28 вразливостей. Різні проходи можуть досліджувати різні файли, шляхи виконання та гіпотези експлуатації. Об’єднання результатів підвищує покриття саме завдяки такій різноманітності пошуку.
Для практичної безпеки це означає: не варто сприймати першу відповідь моделі як завершений аудит. Кілька незалежних розслідувань часто корисніші за один дорогий запуск. 3
Три запуски DeepSeek Pro виявили 28 із 32 вразливостей і коштували приблизно $295. Її головна перевага — широта пошуку: після об’єднання проходів модель виявила більше проблем, ніж інші учасники тесту.
Тому DeepSeek Pro добре підходить для першого етапу конвеєра безпеки. Проте перед створенням робочого сповіщення її висновки потрібно підтвердити доказами, об’єднати дублікати та перевірити рівень ризику.
Три запуски Flash виявили 24 із 32 вразливостей приблизно за $108. Це дає моделі переконливе співвідношення покриття та вартості й робить її придатною для паралельних сканувань або додаткових повторних проходів.
Flash не обов’язково має бути фінальним перевіряльником. Її практична цінність — у можливості збільшити кількість спроб у межах обмеженого бюджету, а потім передати сукупні результати на вибіркову перевірку. 3
Grok 4.6 вирізнилася повторюваністю: 21 вразливість з’явилася в усіх трьох її запусках. Така стабільність важлива для команд, яким потрібні передбачувана поведінка, однаковий формат звітів і менше сюрпризів під час регулярного моніторингу.
Її сильна сторона відрізняється від переваги DeepSeek Pro. Для періодичних перевірок або стандартизованих процесів стабільна модель може бути кориснішою, навіть якщо більш дослідницька модель має вищий сукупний recall.
Claude Opus 5 досягла 26 із 32 у сукупному recall, а GPT-5.6 Sol — 25 із 32. Обидві залишилися високоефективними варіантами, однак результати поставили під сумнів припущення, що найдорожча закрита модель автоматично забезпечує найкраще покриття вразливостей.
Обирати ці моделі варто не лише через бренд чи загальну репутацію в бенчмарках. Командам слід оцінювати, чи додають їхні міркування, якість звітів або поведінка під час перевірки цінність у конкретному конвеєрі безпеки. 3
Найпомітніший результат Kimi K3 — 92,3% pooled precision. Precision показує, яка частка заявлених моделлю знахідок була прийнята після перевірки, а не скільки вразливостей модель знайшла загалом.
Ця різниця визначає іншу роль моделі. Агент із високим recall може шукати широко й допускати більше шуму. Модель із високим precision краще підходить для підтвердження знахідок, підготовки звітів і зменшення кількості сповіщень, які зрештою потрапляють до інженерів.
Aikido помітила, що Qwen3.8-Max поверталася до тієї самої CVE або вже дослідженого шляху міркувань. Це неефективно, якщо повторення витрачає ходи, але не розширює покриття. Водночас повторний аналіз іноді допомагає виявити пропущену умову експлуатації, шлях виконання або деталь, потрібну для підтвердження.
Практичне рішення має бути на рівні агентського середовища: система повинна фіксувати вже перевірені гіпотези, обмежувати повторні гілки, а невирішені випадки спрямовувати на нове розслідування, а не автоматично відтворювати той самий сценарій.
У оновленому порівнянні GLM-5.3 покращила результат із 24/32 до 25/32, зберігши нижчий профіль вартості порівняно із закритими передовими моделями, згаданими в тесті.
Це робить її перспективним інструментом для великої кількості перевірок або компонентом ансамблю. Найбільшу користь така модель дає тоді, коли нижчу ціну використовують для запуску більшої кількості розслідувань, а не просто для одного проходу.
Систему пошуку вразливостей не варто зводити до одного числа в таблиці лідерів:
Ці показники описують різні операційні потреби. Для пошуку важливі високий recall і різноманітність розслідувань. Для сповіщень у робочому середовищі потрібні точність, відтворювані докази, усунення дублікатів і коректне ранжування ризиків.
Тому модель, яка чудово знаходить потенційні проблеми, може бути поганим вибором для прямого надсилання неперевірених сповіщень розробникам.
Найважливіший системний урок тесту — результати моделей були стохастичними. Один запуск досліджує лише один маршрут перевірки, тоді як кілька незалежних проходів збільшують шанси на перевірку різних гіпотез.
Саме тому три відносно недорогі запуски DeepSeek могли зрівнятися або перевершити за сукупним покриттям один прохід дорожчих передових моделей. Одиницею оцінювання є не лише виклик моделі. Важливе все розслідування: модель, інструменти, промпт, ліміт ходів, пам’ять, повторні запуски та процес валідації. 3
Система, побудована з урахуванням цих результатів, має розділяти пошук і остаточне рішення:
Такий підхід із маршрутизацією моделей надійніший, ніж сприймати відкриті та закриті моделі як прості взаємозамінні компоненти.
Результати Aikido корисні, але не є універсальним рейтингом AI-моделей для кібербезпеки. Тест охоплював 32 нещодавно розкриті вразливості, три спроби для кожної моделі та конкретне агентське середовище. Показники можуть змінюватися залежно від мови програмування, структури репозиторію, доступних інструментів, моделі загроз, бюджету розслідування та допустимого рівня хибнопозитивних спрацювань. 3
Найобґрунтованіший висновок є вужчим, але практично ціннішим: у цьому тестовому середовищі відкриті моделі, особливо DeepSeek V4 Pro, могли зрівнятися або перевершити закриті передові системи за умови повторних запусків і грамотної оркестрації.
Переможцем продукту з кібербезпеки стає не обов’язково модель із найвищим показником у заголовку. Виграє система, яка поєднує широке виявлення, надійну перевірку та докази, на які інженери можуть спиратися.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Pro 0813 виявив 28 із 32 вразливостей у трьох об’єднаних запусках за приблизно $295 — це найкращий результат за повнотою виявлення, але не гарантія для одного запуску.
DeepSeek V4 Pro 0813 виявив 28 із 32 вразливостей у трьох об’єднаних запусках за приблизно $295 — це найкращий результат за повнотою виявлення, але не гарантія для одного запуску. Результати говорять на користь оркестрованої системи: недорогі моделі шукають широко, точніші перевіряють знахідки, а складні випадки та критичні рішення проходять додаткову й людську перевірку.