DeepSeek V4 Pro 0813は3回分の結果を合算すると32件中28件を発見。約295ドルで最高の再現率を記録したが、1回の実行で28件を見つけるという意味ではない。 ベンチマークが示したのは「最強の1モデル」より、低コストの探索、精度重視の検証、重複排除、難しい事例への追加調査を組み合わせる運用設計の重要性だ。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did Aikido’s August 2026 benchmark of 10 AI models—using 11.7 billion tokens, 32 recently disclosed real-world vulnerabilities, three i. Article summary: Aikido’s result was not that one model is universally “best,” but that agentic vulnerability discovery is highly stochastic and system-dependent. Pooling three independent, internet-free investigations materially improve. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Aikidoが2026年8月に実施した検証では、10種類のAIモデルを、最近公表された32件の脆弱性に対して各3回ずつ実行した。3回分の結果を合算した探索範囲では、DeepSeek V4 Pro 0813が32件中28件を発見し、首位となった。費用は約295ドルだった。3
ただし、この数字が意味するのは「1回の実行で28件を安定して検出できる」ということではない。実際には、実行ごとに調べるファイル、攻撃経路、悪用仮説が変わる。複数回の調査結果をプールすることで、1回では見落とした問題を拾えるようになる。ベンチマークの本当の示唆は、モデル単体の順位よりも、調査をどう設計するかにある。
DeepSeek V4 Pro 0813は、3回の実行結果を合算した**プール再現率87.5%(28/32件)**を記録した。脆弱性の候補を幅広く洗い出す「発見フェーズ」のモデルとしては、今回の比較で最も強い結果だ。
一方、検出結果はそのまま本番アラートにできるわけではない。証拠の確認、同じ問題を指す報告の統合、深刻度の判定を経て、初めて開発者が対応できる有効な指摘になる。3
DeepSeek Proは3回で28/32件を発見し、費用は約295ドルだった。強みは、調査を重ねたときに多様な仮説を試し、全体としてより多くの脆弱性を拾える点にある。
そのため、セキュリティワークフローの初動に向く。ただし、発見量の多さは誤検知の少なさを保証しない。検証と重複排除を別工程として組み込む必要がある。
Flashは3回の実行で24/32件を発見し、費用は約108ドルだった。限られた予算で試行回数を増やせるため、並列スキャンや追加調査に適した選択肢になる。
最終レビューを単独で任せるというより、安価な探索エージェントとして候補を増やし、その結果をより選別力の高い検証工程へ渡す使い方が現実的だ。3
Grok 4.6では、21件の脆弱性が3回すべての実行で見つかった。同じ問題を繰り返し確認しやすいことは、定期監視や標準化された運用で大きな価値を持つ。
DeepSeek Proが探索範囲で優位に立ったのに対し、Grokの強みは安定性だ。最大の発見数より、スキャンごとの結果を予測しやすいことを優先する現場では、別の意味で有力な候補になる。
Claude Opus 5のプール再現率は26/32件、GPT-5.6 Solは25/32件だった。いずれも高性能な選択肢だが、「最も高価なクローズドモデルが必ず最高の脆弱性検出力を持つ」という前提は崩れた。
これらのモデルを選ぶ理由は、ブランドや一般的なベンチマークの評判だけでは足りない。調査結果の説明、推論、報告書作成、レビューなど、セキュリティパイプラインのどの部分を補えるかで判断すべきだ。3
Kimi K3の目立った成績は、プールした結果で**92.3%の適合率(precision)**を記録したことだ。適合率は、報告した指摘のうち、実際に有効と認められたものの割合を示す。脆弱性を合計何件見つけたかを示す再現率とは別の指標だ。
広く探して候補を増やすモデルと、高い確度で候補を絞り込むモデルは役割が異なる。DeepSeek Proのような高再現率モデルで探索し、Kimiのような高精度モデルで検証や報告作成を行う構成が考えられる。
Aikidoは、Qwen3.8-Maxが同じCVEや推論経路を再び調べる傾向を観察した。調査ターンを消費するだけなら非効率だが、再検討によって見落とした条件、実行経路、検証の詳細が見つかる場合もある。
対策は、モデルそのものだけでなくエージェントの実行基盤(ハーネス)に状態管理を持たせることだ。すでに確認したファイルや仮説を記録し、同じ分岐の繰り返しには上限を設ける。未解決のケースは、同じ調査を自動再生するのではなく、新しい調査経路へ振り分けるべきだ。
GLM-5.3は更新後の比較で24/32件から25/32件へ改善し、今回比較されたクローズドな最先端モデルより低いコスト水準を維持した。大量処理を担うワーカーや、複数モデルを組み合わせるアンサンブルの一員として有望な位置付けだ。
価値を最大化するには、単発の実行に頼るのではなく、コスト面の利点を生かして調査回数を増やすことが重要になる。
脆弱性検出システムを、1つのランキング数字だけで評価するのは危険だ。少なくとも次の指標を分けて見る必要がある。
発見工程では、高い再現率と多様な探索が重要になる。一方、本番のアラートでは、適合率、再現可能な証拠、重複排除、リスクの優先順位付けが求められる。候補を多く出せるモデルが、そのまま開発者へ未検証の通知を送るのに適しているとは限らない。
今回の最も重要なシステム上の発見は、モデルの挙動が確率的だったことだ。1回の実行では、数ある調査経路のうち1つしか試せない。独立した実行を複数回行えば、別の仮説やファイル、攻撃経路を探索する確率が上がる。
その結果、比較的安価なDeepSeekの3回実行が、より高価な最先端モデルの1回実行と競合し、場合によっては上回った。評価すべき単位は、単なるモデル呼び出しではない。モデル、ツール、プロンプト、ターン数、メモリ、再実行、検証を含む「調査全体」だ。3
今回の結果を踏まえると、実用的なセキュリティシステムは次のような段階構成になる。
このようなモデル振り分けの方が、オープンウェイトモデルとクローズドモデルを単純な代替品として扱うより堅牢だ。
Aikidoの結果は有用だが、AIセキュリティモデルの普遍的な順位表ではない。対象は最近公表された32件の脆弱性、各モデル3回の試行、そして特定のエージェント実行基盤に限られている。プログラミング言語、リポジトリの構造、利用できるツール、脅威モデル、調査予算、誤検知への許容度によって結果は変わり得る。3
したがって、最も堅実な結論は次の通りだ。今回の条件では、特にDeepSeek V4 Proのようなオープンウェイトモデルが、複数回の実行と適切なオーケストレーションを組み合わせることで、クローズドな最先端モデルに匹敵、またはそれを上回った。
ただし、セキュリティ製品の勝者は、見出しのスコアが最も高いモデルとは限らない。幅広い発見、信頼できる検証、そしてエンジニアが実際に対応できる証拠を一つのシステムとして組み上げた製品こそが、現場で強い。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
DeepSeek V4 Pro 0813は3回分の結果を合算すると32件中28件を発見。約295ドルで最高の再現率を記録したが、1回の実行で28件を見つけるという意味ではない。
DeepSeek V4 Pro 0813は3回分の結果を合算すると32件中28件を発見。約295ドルで最高の再現率を記録したが、1回の実行で28件を見つけるという意味ではない。 ベンチマークが示したのは「最強の1モデル」より、低コストの探索、精度重視の検証、重複排除、難しい事例への追加調査を組み合わせる運用設計の重要性だ。