
Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Google DeepMind představil způsob, jak testovat proprietární špičkový model, aniž by jeho vývojář získal přístup k neveřejným testovacím promptům a externí hodnotitelé k vahám modelu. Pilot oznámený 27. srpna 2026 testoval Gemini 2.5 Flash-Lite ve spolupráci se Singapore AI Safety Institute, OpenMined, AVERI a MLCommons. Google jej popsal jako první dvojitě zaslepené hodnocení proprietárního modelu z kategorie frontier AI. 1213
Princip je podobný dvojitě zaslepenému experimentu: obě strany dodají citlivé podklady, ale žádná z nich nevidí tajný materiál té druhé. To řeší dlouhodobé dilema bezpečnostního testování AI. Pokud vývojář dostane neveřejné prompty, mohou být omylem či záměrně zaznamenány, použity při dalším trénování nebo jinak „prosáknout“ do budoucích testů. Pokud naopak hodnotitelé získají váhy modelu, dostanou se k cennému duševnímu vlastnictví a potenciálně citlivým schopnostem systému.
Pilot využil malý neveřejný výběr z rodiny benchmarků AILuminate od MLCommons. Podle AVERI nebyly použité prompty společnosti Google DeepMind dříve zpřístupněny. Měly prověřit bezpečnostní chování modelu v oblastech, jako je pomoc při kybernetických útocích, chemická a biologická rizika, nenávistné projevy, sebepoškozování a podněcování k násilné trestné činnosti. 1
Testovací materiály zůstaly po celou dobu důvěrné. AVERI prompty zašifrovala, chráněné prostředí v něm spustilo model i vyhodnocovací proces a výsledné odpovědi byly následně dešifrovány a ohodnoceny podle předem dohodnutých kritérií. Cílem pilotu bylo předvést samotnou metodu, nikoli vytvořit veřejný žebříček modelů. Nebyly proto zveřejněny hlavní skóre ani původní prompty. 1
Výpočet probíhal v Confidential Space, součásti Google Cloud Confidential Computing, na virtuálním stroji A3 Confidential VM. Podle technické zprávy technologie Intel TDX šifrovala a izolovala paměť hostitelského systému, zatímco důvěrný GPU NVIDIA H100 chránil váhy modelu v grafické paměti hardwarovým šifrováním. Zašifrovaná spojení přenášela do chráněného prostředí prompty hodnotitelů i aktiva Googlu. 13
Architektura používala také šifrované datové cesty, hardwarové firewally, dočasný životní cyklus enklávy a pravidlovou vrstvu PySyft od OpenMined. Model, inferenční kód, prompty i vyhodnocovací kód se spojily až uvnitř schválené enklávy. Ta směla provést pouze dohodnutý výpočet a vrátit omezené výstupy. 13
Samotné šifrování neříká, jaký software ve skutečnosti běží. Tento problém měla řešit vzdálená atestace. Ještě před uvolněním chráněných podkladů mohli Google i hodnotitelé zkontrolovat deklarovanou úlohu a ověřit atestační důkaz popisující použité zařízení a konfiguraci enklávy. Teprve poté byly do prostředí zpřístupněny zašifrované prompty a modelová aktiva. 13
Po skončení testu enkláva vrátila povolené výsledky a byla zlikvidována. V zamýšleném modelu důvěry Google nemohl číst prompty uvnitř enklávy a externí hodnotitelé nemohli z enklávy získat váhy modelu. Jde o silnější ochranu než pouhý smluvní slib, že data nebudou zaznamenávána nebo znovu použita. Neznamená to však, že zmizely všechny předpoklady důvěry. 13
Kontaminace benchmarků patří mezi trvalé problémy hodnocení AI. Test přestává být vypovídající, pokud model jeho prompty viděl během trénování, dolaďování nebo předchozího testování. MLCommons uvádí, že důvěryhodné benchmarky vyžadují čistá data, zdokumentovaný původ, promyšlený výběr vzorků a dostatečnou transparentnost, aby bylo možné pochopit, jak výsledky vznikly. 2024
Dvojitě zaslepené hodnocení nabízí třetí možnost mezi dvěma nedokonalými variantami:
Pilot tak ukazuje věrohodný mechanismus, který může zachovat důvěrnost na obou stranách a současně umožnit externí hodnocení. Sám o sobě ale nedokazuje, že závěry o bezpečnosti modelu jsou úplné nebo nezávisle rozhodující.
Technicky významná ukázka má několik omezení, která určují, co z ní lze vyvodit.
Zaprvé, hodnotitelé mohli ověřit deklarovanou úlohu enklávy a rozhraní modelu, nikoli však nezávisle prozkoumat proprietární váhy Googlu nebo kompletní inferenční implementaci. Nemohli proto plně zkontrolovat, zda běhové prostředí ve všech ohledech fungovalo přesně tak, jak bylo zamýšleno. 13
Zadruhé, celé provozní prostředí nebylo nezávisle reprodukovatelné. Nasazení a cloudová infrastruktura zůstaly pod kontrolou Googlu, místo aby je nezávislá třetí strana znovu sestavila a spustila. Atestace navíc stále závisela na hardwaru, firmwaru, obslužných systémech a atestační infrastruktuře Google Cloud. Ověření podporované hardwarem je silnější než smluvní příslib zákazu logování, neodstraňuje však závislost na širším dodavatelském řetězci. 13
Zatřetí, pilot nezveřejnil neveřejné prompty ani číselné výsledky. Tajnost promptů pomáhá zachovat jejich hodnotu pro budoucí testování, zároveň ale omezuje veřejnou kontrolu, srovnání s jinými modely a nezávislé ověření konkrétních závěrů. AVERI práci popisuje jako kvalitativní a malou kvantitativní analýzu, nikoli jako úplný veřejný výsledek benchmarku. 1
Bezpečný hardware řeší pouze jednu část problému. Aby se dvojitě zaslepené testování stalo trvalou praxí, musela by se rozvinout i pravidla kolem něj.
Právní a institucionální záruky by měly určovat nakládání s daty, povolené výstupy, pravidla zveřejňování, odpovědnost i přístupová oprávnění — zejména u testů, které se dotýkají nebezpečných schopností.
Správa benchmarků by měla pokrývat původ promptů, výběr vzorků, jejich označování, dokumentaci, pravidelnou obměnu a sledování kontaminace. MLCommons zdůrazňuje, že benchmark není důvěryhodný jen proto, že jsou jeho data tajná. Obhajitelná musí být také jeho konstrukce a dlouhodobá údržba. 2025
Nezávislá reprodukovatelnost by vyžadovala smysluplné ověření sestavení systému, atestačního řetězce, pravidel provádění i nahlášených výsledků stranami, které nejsou pouze poskytovatelem modelu a provozovatelem cloudu.
Škálovatelnost je další podmínkou. Použitelný standard musí fungovat napříč různými vývojáři, architekturami modelů, cloudovými prostředími, hodnotiteli, typy benchmarků i opakovanými vydáními modelů — ne jen v jednorázové spolupráci postavené na jedné hardwarové platformě.
Pilot Google DeepMind je proto nejlepší chápat jako infrastrukturu pro náročnější způsob hodnocení AI, nikoli jako definitivní odpověď na otázku důvěryhodnosti benchmarků. Ukazuje, jak může důvěrné výpočetní prostředí zmírnit konflikt mezi ochranou testovacích dat a ochranou proprietárních modelů. Zda se z něj stane přesvědčivý důkazní standard pro celý průmysl, ale rozhodnou až nezávislý dohled, kvalitní správa benchmarků, právní ochrana, reprodukovatelnost a provozní použitelnost — nikoli samotná kryptografie enklávy. 1320
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind 27. srpna 2026 oznámil pilotní dvojitě zaslepené hodnocení Gemini 2.5 Flash Lite, které označil za první test proprietárního frontierového modelu tohoto typu.
Google DeepMind 27. srpna 2026 oznámil pilotní dvojitě zaslepené hodnocení Gemini 2.5 Flash Lite, které označil za první test proprietárního frontierového modelu tohoto typu. Test využil neveřejné prompty z bezpečnostního benchmarku MLCommons AILuminate a zaměřil se mimo jiné na kybernetické útoky, chemická a biologická rizika, nenávistné projevy, sebepoškozování a podněcování k násilné tr...
Model a testovací data se setkaly v hardwarově chráněném prostředí Google Cloud, ale pilot zatím neodstranil otázky kolem nezávislé reprodukovatelnosti, správy benchmarků, právních záruk ani zveřejnění výsledků.