2026年8月27日、Google DeepMindは、独自開発の最先端AIモデルを対象とした初の二重盲検評価だとする試験を発表した。 MLCommonsのAILuminateから未公開のプロンプトを用い、サイバー攻撃、化学・生物学的危険、ヘイトスピーチ、自傷、暴力犯罪の誘発などを検証した。
研究の答え

Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Google DeepMindは2026年8月27日、外部評価者にテスト問題を見せず、同時に評価者にもモデルの重みを渡さない「二重盲検(ダブルブラインド)評価」の試験運用を発表した。対象はGemini 2.5 Flash-Liteで、シンガポールAI安全研究所、OpenMined、AVERI、MLCommonsと共同で実施された。Googleは、独自開発の最先端AIモデルを対象とする世界初の二重盲検評価だと説明している。1213
この方式の狙いは、AIモデルと安全性テストの双方に含まれる機密情報を守りながら、外部評価を成立させることだ。通常の評価では、モデル開発者に非公開プロンプトを渡すか、評価者にモデルの重みを渡す必要がある。しかし前者はテスト問題の漏えいや、後の学習による「ベンチマーク汚染」を招くおそれがあり、後者は企業の重要な知的財産を開示することになる。
試験では、MLCommonsが運営するAI安全性ベンチマーク群「AILuminate」から、規模を限定した非公開のプロンプト群を使用した。AVERIによると、これらはGoogle DeepMindに過去に公開されていないプロンプトで、サイバー攻撃の支援、化学・生物学的危険、ヘイトスピーチ、自傷、暴力犯罪の誘発などに対する安全性を調べた。1
プロンプトは評価中を通じて非公開のまま維持された。AVERIが問題を暗号化し、保護された環境内でモデルの推論と評価を実行。生成された出力を取り出した後、合意済みの基準に基づいて復号・採点した。今回の目的は公開ランキングを作ることではなく、評価手法そのものを実証することだったため、代表的なモデルスコアやプロンプトの中身は公開されていない。1
評価は、Google Cloudの機密コンピューティング機能「Confidential Computing」に含まれるConfidential Space上のA3 Confidential VMで実行された。技術報告書によると、Intel TDXがホストメモリを暗号化・隔離し、NVIDIA H100 Confidential GPUがGPUメモリ上のモデル重みをハードウェアベースの暗号化で保護した。評価者のプロンプトとGoogleのモデル資産は、暗号化された通信を通じて保護環境へ送られた。13
さらに、暗号化されたデータ経路、ハードウェアファイアウォール、一時的なエンクレーブのライフサイクル、OpenMinedのPySyftポリシー層も利用された。モデル、推論コード、プロンプト、評価コードは、承認されたエンクレーブ内で初めて合流し、許可された計算だけを実行。外部に返される出力も制限された。13
暗号化だけでは、参加者は「実際にどのソフトウェアが動いているのか」を確認できない。そこで使われたのがリモートアテステーションだ。
Googleと評価者は、保護環境に機密資産を渡す前に、実行されるワークロードの内容を確認し、ハードウェアとエンクレーブ構成を示すアテステーション情報を検証できた。その確認後に限って、暗号化されたプロンプトとモデル資産が環境へ投入された。13
評価が終わると、エンクレーブは許可された評価結果だけを返し、廃棄された。想定された信頼モデルでは、Googleはエンクレーブ内のプロンプトを読めず、外部評価者はモデルの重みを取り出せない。これは、単に「ログを保存しない」「データを再利用しない」と契約するより強い保護だが、すべての信頼上の前提をなくすものではない。13
AI評価では、ベンチマーク汚染が長く問題になっている。モデルが学習、ファインチューニング、過去のテストなどで問題文を見ていれば、そのテストは本来の能力や安全性を測りにくくなる。MLCommonsは、信頼できるベンチマークには、データの清潔さ、出所の記録、適切なサンプリング、結果がどのように生まれたかを理解できる透明性が必要だとしている。2024
二重盲検評価は、従来の二つの妥協案の間にある第三の選択肢を示す。
今回の試験が示したのは、双方の秘密を保ったまま外部評価を実行するための、実行可能性のある基盤だ。ただし、この仕組みだけで安全性に関する結論が完全になったり、独立した決定的証拠になったりするわけではない。
今回の取り組みは大きな技術実証だが、結果を解釈する際には複数の制約がある。
第一に、評価者はエンクレーブの宣言された構成やモデルのインターフェースを確認できても、Googleの独自モデル重みや推論実装を自由に検査できない。そのため、実行環境があらゆる点で意図どおりに動作したかを、評価者が完全に監査することはできない。13
第二に、環境全体を第三者が独立して再現できたわけではない。Confidential Spaceの展開やクラウド基盤はGoogleの管理下にあり、関係のない組織が一から構築して再実行したものではない。アテステーションも、Google Cloudのハードウェア、ファームウェア、サービス基盤、認証インフラに依存する。ハードウェアに裏付けられた検証は、契約上の「ログを取らない」という約束より強いが、クラウド事業者やそのサプライチェーンへの依存をなくすものではない。13
第三に、非公開プロンプトも数値結果も発表されていない。問題を隠すことで、将来の評価に使えるベンチマークの価値は守られる一方、外部からの精査、モデル間比較、評価結果の独立検証は難しくなる。AVERIも今回の試験を、完全な公開ベンチマーク結果ではなく、質的評価と小規模な量的評価として位置づけている。1
安全なハードウェアは、評価問題の一部しか解決しない。二重盲検方式を継続的な業界慣行にするには、周辺のガバナンスも整える必要がある。
法的・制度的な保護では、データの取り扱い、許可される出力、情報開示、責任、アクセス権限を明確にしなければならない。特に危険な能力を含む評価では、誰がどの情報をどの条件で扱えるのかが重要になる。
ベンチマークの管理体制では、プロンプトの出所、サンプリング、ラベル付け、文書化、更新手順、汚染の監視が必要だ。MLCommonsが強調するように、ベンチマークはデータを秘密にしているだけで信頼されるのではなく、構築と維持の方法そのものが説明可能でなければならない。2025
独立した再現性を確保するには、モデル提供者とクラウド運営者以外の組織が、ビルド、アテステーションの連鎖、実行ポリシー、報告結果を意味のある範囲で検証できる仕組みが求められる。
拡張性も欠かせない。実用的な標準は、単一のハードウェア構成による特別な協業だけでなく、さまざまなモデル開発者、アーキテクチャ、クラウド、評価者、ベンチマーク、モデルの更新に対応できなければならない。
Google DeepMindのGemini試験は、ベンチマークの機密性と独自モデルの保護を両立させるためのインフラを示したものだ。評価の信頼性を高める可能性はあるが、業界規模で説得力のある証拠になるかどうかは、エンクレーブの暗号技術だけで決まらない。独立した監督、適切なベンチマーク管理、法的保護、再現性、運用面での実用性がそろうかが、次の焦点になる。1320
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
2026年8月27日、Google DeepMindは、独自開発の最先端AIモデルを対象とした初の二重盲検評価だとする試験を発表した。
2026年8月27日、Google DeepMindは、独自開発の最先端AIモデルを対象とした初の二重盲検評価だとする試験を発表した。 MLCommonsのAILuminateから未公開のプロンプトを用い、サイバー攻撃、化学・生物学的危険、ヘイトスピーチ、自傷、暴力犯罪の誘発などを検証した。
方式はベンチマーク汚染とモデル重みの流出を同時に抑えるが、独立再現性、法的保護、ベンチマーク管理、規模拡大にはなお課題が残る。