認定候補となる企業は、いわゆる「レッドチーム」方式の敵対的テストを行うことが想定されています。これは、攻撃者の視点からAIの防御を試す方法です。
具体的には、入力に悪意ある指示を紛れ込ませる「プロンプトインジェクション」や、AIの安全策を回避する「ジェイルブレイク」を試し、通常なら拒否される危険な動作やポリシー違反の出力を誘発できないか調べます。
検証対象には、次のようなリスクが含まれます。
AI TAPが目指すのは、外部テスト市場をより一貫性と信頼性のあるものにすることです。テスターの能力に共通の期待値を設け、検証範囲を明文化し、証拠に基づく再現可能な評価を促すことで、企業は自社の用途やリスクに合ったテストを選びやすくなります。
利用可能な資料には、業界関係者が「カスタマイズ性」「ガバナンス」「AI安全性への信頼」の改善について具体的に語った内容は含まれていません。ただ、認定企業の能力と検証範囲を明確にし、独立した評価を受けやすくするという制度設計は、こうした効果を支えるものと考えられます。