Google DeepMind presenteerde op 27 augustus 2026 een pilot als de eerste dubbelblinde evaluatie van een propriëtair frontier class AI model. Gemini 2.5 Flash Lite werd getest met geheime MLCommons AILuminate prompts over onder meer cyberaanvallen, chemische en biologische risico’s, haatzaaien, zelfbeschadiging en ge...
Research answer

Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Google DeepMind heeft een manier getest om een propriëtair frontier-model te evalueren zonder dat de ontwikkelaar toegang krijgt tot de evaluatieprompts en zonder dat externe beoordelaars de modelgewichten ontvangen. De pilot, aangekondigd op 27 augustus 2026, testte Gemini 2.5 Flash-Lite samen met het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons. Google beschreef het project als de eerste dubbelblinde evaluatie van een propriëtair AI-model uit de frontier-klasse. 1213
Het idee is eenvoudig: de gevoelige bezittingen van beide partijen blijven afgeschermd, terwijl een goedgekeurde test toch kan worden uitgevoerd. Dat pakt een lastig probleem aan. Krijgt de modelontwikkelaar de geheime prompts in handen, dan kunnen die worden opgeslagen, bewust of per ongeluk in latere training terechtkomen of toekomstige tests beïnvloeden. Krijgen beoordelaars de modelgewichten, dan ontvangen zij waardevolle intellectuele eigendom en mogelijk gevoelige capaciteiten.
De pilot gebruikte een kleine, private selectie uit de MLCommons AILuminate-benchmarkfamilie. Volgens AVERI waren de prompts niet eerder aan Google DeepMind blootgesteld. Ze waren bedoeld om veiligheidsgedrag te onderzoeken op terreinen als hulp bij cyberaanvallen, chemische en biologische gevaren, haatzaaiende inhoud, zelfbeschadiging en het uitlokken van gewelddadige criminaliteit. 1
Het benchmarkmateriaal bleef tijdens de hele evaluatie vertrouwelijk. AVERI versleutelde de prompts, waarna de beveiligde omgeving het model en het evaluatieproces uitvoerde. De uitkomsten werden vervolgens ontsleuteld en beoordeeld aan de hand van vooraf afgesproken criteria. De pilot was vooral bedoeld om de methode te demonstreren, niet om een publiek klassement met modelscores te publiceren: de belangrijkste scores en de onderliggende prompts werden niet vrijgegeven. 1
De evaluatie draaide in Confidential Space van Google Cloud Confidential Computing, op een A3 Confidential VM. Volgens het technisch rapport versleutelde en isoleerde Intel TDX het geheugen van de host. Een NVIDIA H100 Confidential GPU beschermde de modelgewichten in het GPU-geheugen met hardwarematige versleuteling. Versleutelde verbindingen brachten de prompts van de beoordelaars en de modelassets van Google naar de beveiligde omgeving. 13
De opzet bevatte ook maatregelen om te beperken wat de uitvoering kon doen en welke informatie naar buiten mocht. Daaronder vielen versleutelde dataverbindingen, hardwarefirewalls, een tijdelijke enclave die na afloop wordt vernietigd en de beleidslaag PySyft van OpenMined. Het model, de inferentiecode, de prompts en de evaluatiecode kwamen pas binnen de goedgekeurde enclave samen. Daar kon alleen de afgesproken berekening worden uitgevoerd en konden slechts begrensde resultaten worden teruggestuurd. 13
Versleuteling alleen zegt nog niet welke software er precies draait. Remote attestation — cryptografische verificatie van de hardware en de configuratie — moest dat ondervangen. Voordat zij hun beschermde bestanden vrijgaven, konden Google en de beoordelaars de opgegeven werklast bekijken en een attestation quote controleren. Die quote identificeerde de hardware en de configuratie van de enclave. Pas daarna werden de versleutelde prompts en modelassets beschikbaar gemaakt. 13
Aan het einde stuurde de enclave de toegestane evaluatie-uitkomsten terug en werd de omgeving buiten gebruik gesteld. Binnen het beoogde vertrouwensmodel kon Google de prompts in de enclave niet lezen, terwijl externe beoordelaars de modelgewichten niet konden uitlezen. Dat gaat verder dan alleen vertrouwen op een contractuele belofte om gegevens niet te loggen of opnieuw te gebruiken. Het neemt echter niet alle aannames over vertrouwen weg. 13
Besmetting van benchmarks — vaak aangeduid als benchmark contamination — is een hardnekkig probleem bij AI-evaluaties. Een test zegt minder als een model de prompts al heeft gezien tijdens training, fine-tuning of eerdere tests. MLCommons stelt dat betrouwbare benchmarks schone data, gedocumenteerde herkomst, zorgvuldige steekproeven en voldoende transparantie nodig hebben om te begrijpen hoe resultaten tot stand komen. 2024
Een dubbelblinde evaluatie biedt een derde mogelijkheid naast twee onvolmaakte oplossingen:
De pilot laat daarmee een aannemelijk mechanisme zien om vertrouwelijkheid aan beide kanten te bewaren en toch externe evaluatie mogelijk te maken. Op zichzelf bewijst de aanpak niet dat de conclusies over de veiligheid van het model volledig of onafhankelijk doorslaggevend zijn.
Technisch was dit een betekenisvolle demonstratie, maar de resultaten moeten voorzichtig worden geïnterpreteerd.
Ten eerste konden de beoordelaars de opgegeven enclave-werklast en modelinterface controleren, maar niet zelfstandig de propriëtaire modelgewichten of de volledige inferentie-implementatie van Google inspecteren. Daardoor konden zij niet volledig nagaan of de runtime in elk opzicht precies werkte zoals bedoeld. 13
Ten tweede was de operationele omgeving niet van begin tot eind onafhankelijk reproduceerbaar. De implementatie en cloudinfrastructuur bleven onder controle van Google, in plaats van door een niet-gelieerde partij opnieuw te worden opgebouwd en uitgevoerd. Ook het attestationproces bleef afhankelijk van de hardware, firmware, serversystemen en attestationinfrastructuur van Google Cloud. Hardwarematige verificatie is sterker dan een belofte om niets te loggen, maar neemt de afhankelijkheid van die bredere toeleveringsketen niet weg. 13
Ten derde werden de geheime prompts en numerieke resultaten niet gepubliceerd. Het achterhouden van de prompts helpt hun waarde voor toekomstige tests te behouden, maar beperkt ook de publieke controle, vergelijking tussen modellen en onafhankelijke validatie van de inhoudelijke bevindingen. AVERI beschrijft het project als een kwalitatieve en kleinschalige kwantitatieve beoordeling, niet als een volledig openbaar benchmarkresultaat. 1
Beveiligde hardware lost slechts één deel van het evaluatieprobleem op. Voor dubbelblinde tests een duurzame praktijk kunnen worden, moet ook de governance eromheen verder worden ontwikkeld.
Juridische en institutionele waarborgen moeten vastleggen hoe data mag worden verwerkt, welke resultaten mogen worden vrijgegeven, wie aansprakelijk is en wie toegang krijgt — zeker wanneer tests gevaarlijke capaciteiten onderzoeken.
Beheer van benchmarks moet betrekking hebben op de herkomst van prompts, steekproeven, labeling, documentatie, vernieuwing en controle op besmetting. MLCommons benadrukt dat een benchmark niet alleen betrouwbaar is omdat de data geheim blijft. Ook de manier waarop de benchmark wordt samengesteld en onderhouden moet verdedigbaar zijn. 2025
Onafhankelijke reproduceerbaarheid vraagt om betekenisvolle controle van de softwarebuild, de attestationketen, uitvoeringsregels en gerapporteerde resultaten door partijen buiten de modelontwikkelaar en cloudleverancier.
Schaalbaarheid is eveneens cruciaal. Een bruikbare standaard moet werken met verschillende modelontwikkelaars, architecturen, cloudomgevingen, beoordelaars, benchmarktypen en opeenvolgende modelreleases — niet alleen binnen één speciaal samenwerkingsverband met één hardwarestack.
De Gemini-pilot van Google DeepMind kan daarom het best worden gezien als infrastructuur voor een moeilijker soort AI-evaluatie, niet als het definitieve antwoord op de vraag wanneer een benchmark betrouwbaar is. De proef laat zien hoe confidential computing de botsing tussen bescherming van testdata en bescherming van propriëtaire modellen kan verkleinen. Of dit op industriële schaal geloofwaardig bewijs oplevert, hangt af van onafhankelijk toezicht, degelijk benchmarkbeheer, juridische bescherming, reproduceerbaarheid en praktische uitvoerbaarheid — niet van enclavecryptografie alleen. 1320
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind presenteerde op 27 augustus 2026 een pilot als de eerste dubbelblinde evaluatie van een propriëtair frontier class AI model.
Google DeepMind presenteerde op 27 augustus 2026 een pilot als de eerste dubbelblinde evaluatie van een propriëtair frontier class AI model. Gemini 2.5 Flash Lite werd getest met geheime MLCommons AILuminate prompts over onder meer cyberaanvallen, chemische en biologische risico’s, haatzaaien, zelfbeschadiging en gewelddadige criminaliteit.
De aanpak voorkomt dat Google de testprompts ziet of dat evaluatoren de modelgewichten krijgen, maar onafhankelijke reproduceerbaarheid, juridische waarborgen, zorgvuldig benchmarkbeheer en schaalbaarheid blijven nodig.