DeepSeek V4 Pro 0813 обнаружил 28 из 32 уязвимостей в совокупности трёх запусков при стоимости около $295 — это лучший результат по полноте обнаружения, но не гарантия одного безошибочного запуска. Результаты говорят в пользу многоуровневой системы: недорогие агенты ищут проблемы, более точные модели проверяют наход...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Августовское исследование Aikido проверило 10 ИИ-моделей на 32 недавно раскрытых уязвимостях. Каждая модель получила три независимые попытки, а суммарно на эксперимент ушло 11,7 млрд токенов. На первом месте по совокупному охвату оказалась DeepSeek V4 Pro 0813, но наиболее важный вывод оказался шире простого рейтинга: эффективность поиска зависит от того, как устроена вся система — от повторных запусков и памяти агента до валидации и распределения ролей между моделями. 3
DeepSeek V4 Pro 0813 обнаружила 28 из 32 уязвимостей, то есть достигла 87,5% совокупной полноты (recall). Стоимость трёх запусков составила примерно $295. Это лучший показатель на этапе широкого поиска, однако его нельзя трактовать так, будто один запуск модели стабильно находит 28 уязвимостей.
Каждый новый запуск может исследовать другие файлы, цепочки вызовов и гипотезы эксплуатации. Если объединить результаты, покрытие растёт за счёт разнообразия поиска. На практике это означает, что несколько независимых расследований часто полезнее, чем попытка получить полный аудит одним ответом модели. 3
В совокупности трёх запусков DeepSeek Pro достигла результата 28/32 при стоимости около $295. Её преимущество — в широте охвата: после объединения результатов модель находила больше уязвимостей, чем конкуренты.
Это делает её сильным кандидатом для первого этапа проверки кода. Но перед тем как превращать находки в рабочие уведомления, их необходимо подтвердить доказательствами, объединить дубликаты и оценить их серьёзность.
Три запуска Flash обнаружили 24 из 32 уязвимостей примерно за $108. По соотношению стоимости и охвата это весьма привлекательный результат — особенно для параллельных проверок и дополнительных прогонов в рамках ограниченного бюджета.
Однако Flash не обязательно должна быть последним рецензентом. Её сильная сторона — увеличить число поисковых попыток, после чего передать объединённые находки на более строгую проверку. 3
Grok 4.6 показала лучшую воспроизводимость: 21 уязвимость была найдена во всех трёх запусках. Такая стабильность важна для команд, которым нужны предсказуемые результаты, единообразные отчёты и минимум сюрпризов при повторном сканировании.
При этом сильная сторона Grok отличается от преимущества DeepSeek Pro. Для регулярного мониторинга и стандартизированных процессов стабильная модель может оказаться предпочтительнее более исследовательской системы с большим совокупным охватом.
Claude Opus 5 достигла 26/32 по совокупной полноте, а GPT-5.6 Sol — 25/32. Обе модели остались среди лидеров, но результаты поставили под сомнение распространённое предположение, что самая дорогая закрытая модель автоматически обеспечивает лучший поиск уязвимостей.
Поэтому выбирать одну из них стоит не только из-за бренда или общего положения в рейтингах. Важно понять, добавляет ли модель ценность именно в вашем контуре — например, за счёт качества рассуждений, отчётности или повторной проверки. 3
Главным результатом Kimi K3 стала совокупная точность 92,3% (precision). Эта метрика показывает, какая доля заявленных находок была подтверждена, а не сколько уязвимостей модель обнаружила всего.
Разница принципиальна. Агент с высоким recall может широко искать и допускать больше шума. Модель с высокой precision лучше подходит для подтверждения находок, подготовки отчётов и сокращения числа ложных тревог, которые доходят до разработчиков.
Aikido заметила, что Qwen3.8-Max иногда возвращалась к той же CVE или уже исследованной логике рассуждений. Это неэффективно, если повторение расходует ходы и не расширяет охват. Но повторная проверка может оказаться полезной, когда позволяет заметить пропущенное условие, путь выполнения или деталь, необходимую для подтверждения.
Практическое решение должно находиться на уровне агентской оболочки: система должна помнить, что уже проверено, ограничивать повторяющиеся ветки и направлять нерешённые случаи на новое расследование, а не автоматически воспроизводить прежний сценарий.
В обновлённом сравнении GLM-5.3 улучшила результат с 24/32 до 25/32, сохранив более низкую стоимость по сравнению с обсуждаемыми закрытыми передовыми моделями. Это делает её подходящим кандидатом для массовых проверок или работы в составе ансамбля.
Её преимущество особенно заметно там, где организация может использовать стоимость и гибкость развёртывания, чтобы запускать больше расследований, а не полагаться на единственный проход любой модели.
Оценивать систему поиска уязвимостей по одной цифре в таблице лидеров рискованно. Здесь важны как минимум четыре показателя:
Для первичного поиска важны высокий recall и разнообразие исследовательских траекторий. Для производственных уведомлений — точность, воспроизводимые доказательства, удаление дубликатов и полезная оценка риска.
Поэтому модель, хорошо находящая возможные проблемы, может оказаться плохим выбором для отправки непроверенных предупреждений непосредственно разработчикам.
Главный системный вывод теста: поведение моделей при поиске уязвимостей вероятностно. Один запуск выбирает лишь один путь расследования, тогда как несколько независимых запусков повышают шанс проверить разные гипотезы.
Именно поэтому три сравнительно недорогих запуска DeepSeek смогли превзойти или сопоставиться по общему охвату с одним запуском более дорогих передовых моделей. Считать нужно не только стоимость вызова модели. Важна цена полного расследования: модель, инструменты, промпт, лимит ходов, память, повторные запуски и процедура проверки. 3
Система, построенная с учётом этих результатов, должна разделять поиск и вынесение окончательного суждения:
Такой подход с маршрутизацией между моделями надёжнее, чем рассматривать открытые и закрытые модели как взаимозаменяемые решения «из коробки».
Результаты Aikido полезны, но не представляют собой универсальный рейтинг ИИ-моделей для кибербезопасности. В исследовании использовались 32 недавно раскрытые уязвимости, по три попытки на модель и конкретная агентская оболочка. Результаты могут измениться в зависимости от языка программирования, структуры репозитория, доступных инструментов, модели угроз, бюджета расследования и допустимого уровня ложных срабатываний. 3
Наиболее обоснованный вывод звучит уже: в данном сценарии модели с открытыми весами — прежде всего DeepSeek V4 Pro — смогли сравняться с закрытыми передовыми решениями или превзойти их при использовании повторных запусков и продуманной оркестрации.
Побеждает не обязательно модель с самым громким результатом в заголовке. Побеждает система, которая сочетает широкий поиск, надёжную проверку и доказательства, с которыми инженеры действительно могут работать.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
DeepSeek V4 Pro 0813 обнаружил 28 из 32 уязвимостей в совокупности трёх запусков при стоимости около $295 — это лучший результат по полноте обнаружения, но не гарантия одного безошибочного запуска.
DeepSeek V4 Pro 0813 обнаружил 28 из 32 уязвимостей в совокупности трёх запусков при стоимости около $295 — это лучший результат по полноте обнаружения, но не гарантия одного безошибочного запуска. Результаты говорят в пользу многоуровневой системы: недорогие агенты ищут проблемы, более точные модели проверяют находки, а критические выводы подтверждаются человеком.