Google DeepMind kuvasi 27. elokuuta 2026 Gemini 2.5 Flash Lite pilotinsa ensimmäiseksi omistusoikeudelliseen, eturintaman tekoälymalliin kohdistuneeksi kaksoissokkoarvioinniksi.
Research answer

Create a landscape editorial hero image for this Studio Global article: What was Google DeepMind’s first double-blind evaluation of a proprietary frontier AI model, conducted with the Singapore AI Safety Institut. Article summary: Google DeepMind’s pilot was a “double-blind evaluation” of Gemini 2.5 Flash-Lite: confidential, never-before-used MLCommons AILuminate prompts were run against the proprietary model without Google receiving the prompts a. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Google DeepMind on pilotoinut menetelmää, jossa omistusoikeudellinen eturintaman tekoälymalli voidaan testata ilman, että mallin kehittäjä näkee arvioinnin testikysymyksiä tai ulkopuoliset arvioijat pääsevät käsiksi mallin painoihin. 27. elokuuta 2026 julkistetussa hankkeessa Gemini 2.5 Flash-Litea arvioitiin yhteistyössä Singaporen tekoälyn turvallisuusinstituutin, OpenMinedin, AVERIn ja MLCommmonsin kanssa. Google kuvasi kokeilua ensimmäiseksi omistusoikeudellisen, eturintaman tekoälymallin kaksoissokkotestiksi. 1213
Perusajatus on yksinkertainen: molempien osapuolten arkaluonteiset aineistot pysyvät sinetöityinä, mutta hyväksytty arviointi voidaan silti suorittaa. Tämä on tärkeää, koska tavallinen turvallisuustestaus pakottaa usein valitsemaan kahden huonon vaihtoehdon välillä. Jos kehittäjä saa yksityiset testikysymykset, ne voivat päätyä lokitietoihin tai tahattomasti myöhempään koulutukseen. Jos arvioijat saavat mallin painot, heille avautuu arvokasta immateriaalioikeutta ja mahdollisesti arkaluonteisia kyvykkyyksiä.
Pilotissa käytettiin pientä, yksityistä otosta MLCommonsin AILuminate-vertailujen perheestä. AVERIn mukaan kysymyksiä ei ollut aiemmin luovutettu Google DeepMindille. Niillä tutkittiin mallin turvallisuuskäyttäytymistä esimerkiksi kyberhyökkäysten avustamisessa, kemiallisissa ja biologisissa vaaroissa, vihapuheessa, itsensä vahingoittamisessa sekä väkivaltarikoksiin houkuttelevissa pyynnöissä. 1
Vertailuaineisto pysyi luottamuksellisena koko kokeen ajan. AVERI salasi kysymykset, suojattu ympäristö suoritti mallin ja arviointiprosessin, ja tulokset purettiin sekä pisteytettiin ennalta sovittujen kriteerien mukaan. Pilotin tarkoituksena oli esitellä arviointitapaa, ei julkaista tavanomaista avointa tulostaulukkoa: keskeisiä mallipisteitä tai alkuperäisiä kysymyksiä ei julkaistu. 1
Arviointi suoritettiin Google Cloudin Confidential Computing -luottamuksellisessa laskentaympäristössä, Confidential Spacessa, A3 Confidential VM -virtuaalikoneella. Teknisen raportin mukaan Intel TDX salasi ja eristi isäntäkoneen muistin. NVIDIA H100 Confidential GPU puolestaan suojasi mallin painoja grafiikkasuorittimen muistissa laitteistopohjaisella salauksella. Arvioijan kysymykset ja Googlen malliaineistot siirrettiin suojattuun ympäristöön salatuilla yhteyksillä. 13
Järjestelmässä oli lisäksi toimintoja, joiden oli tarkoitus rajoittaa sekä työkuorman toimintaa että siitä ulos palautuvia tietoja. Näihin kuuluivat salatut tietopolut, laitteistopalomuurit, tilapäinen enklavi- eli suojatun suoritusympäristön elinkaari sekä OpenMinedin PySyft-käytäntökerros. Malli, päättelykoodi, testikysymykset ja arviointikoodi tuotiin yhteen vasta hyväksytyn suojatun ympäristön sisällä. Siellä voitiin suorittaa vain sovittu laskenta, ja ulos palautettiin rajattu määrä tuloksia. 13
Pelkkä salaus ei kerro, millainen ohjelmisto suojatussa ympäristössä todellisuudessa pyörii. Etäattestoinnin tarkoituksena oli ratkaista tämä ongelma. Ennen kuin kumpikaan osapuoli vapautti salatut aineistonsa, Google ja arvioijat saattoivat tarkistaa ilmoitetun työkuorman ja todentaa laitteiston sekä enklavin kokoonpanon yksilöivän attestaatiotodisteen.
Vasta tämän tarkistuksen jälkeen salatut testikysymykset ja malliaineistot annettiin ympäristön käyttöön. Kokeen lopuksi enklavi palautti sallitut arviointitulokset ja poistettiin käytöstä. Suunnitellussa luottamusmallissa Google ei voinut lukea enklavin sisällä olevia testikysymyksiä, eivätkä ulkopuoliset arvioijat voineet poimia mallin painoja. Tämä on vahvempi järjestely kuin pelkkä sopimus siitä, ettei tietoja lokitettaisi tai käytettäisi uudelleen, mutta se ei poista kaikkia luottamukseen liittyviä oletuksia. 13
Vertailukysymysten saastuminen eli benchmark contamination on tekoälyn arvioinnissa jatkuva ongelma. Testi kertoo vähemmän, jos malli on nähnyt sen kysymyksiä koulutuksen, hienosäädön tai aiempien testien aikana. MLCommonsin mukaan luotettava vertailu edellyttää puhdasta dataa, dokumentoitua alkuperää, huolellista otantaa ja riittävää läpinäkyvyyttä, jotta tulosten syntytapa voidaan ymmärtää. 2024
Kaksoissokko tarjoaa kolmannen vaihtoehdon kahden epätäydellisen järjestelyn rinnalle:
Pilotti osoittaa siis uskottavalta vaikuttavan tavan suojata molempien osapuolten luottamuksellisia aineistoja ulkopuolisen arvioinnin aikana. Se ei kuitenkaan yksin todista, että arvioinnin turvallisuuspäätelmät olisivat kattavia tai lopullisia.
Teknisesti merkittävä kokeilu ei vielä tarkoita, että Geminin turvallisuudesta olisi saatu riippumattomasti ratkaiseva näyttö.
Ensinnäkin arvioijat pystyivät tarkistamaan ilmoitetun enklavi-työkuorman ja mallirajapinnan, mutta eivät voineet tutkia itsenäisesti Googlen omistusoikeudellisia painoja tai päättelytoteutusta. Siksi heidän kykynsä tarkistaa ajonaikainen toiminta kaikilta osin jäi rajalliseksi. 13
Toiseksi koko toimintaympäristöä ei voitu toistaa riippumattomasti alusta loppuun. Käyttöönotto ja pilvi-infrastruktuuri pysyivät Googlen hallinnassa sen sijaan, että ulkopuolinen taho olisi rakentanut ja ajanut ympäristön uudelleen. Attestointi nojasi edelleen Google Cloudin laitteistoon, laiteohjelmistoihin, palvelujärjestelmiin ja attestointi-infrastruktuuriin. Laitteistopohjainen varmennus on vahvempi kuin pelkkä lupaus siitä, ettei tietoja lokiteta, mutta se ei poista riippuvuutta laajemmasta toimitusketjusta. 13
Kolmanneksi yksityisiä kysymyksiä tai numeerisia tuloksia ei julkaistu. Salassapito auttaa säilyttämään kysymysten arvon tulevissa testeissä, mutta samalla se rajoittaa julkista tarkastelua, mallien välistä vertailua ja tulosten riippumatonta vahvistamista. AVERI kuvaa työtä laadulliseksi ja pienimuotoiseksi määrälliseksi arvioinniksi, ei täydelliseksi julkiseksi vertailutulokseksi. 1
Turvallinen laitteisto ratkaisee vain yhden osan tekoälyn arviointiongelmasta. Jotta kaksoissokkotestauksesta voisi tulla pysyvä käytäntö, myös sen ympärillä olevan hallinnon pitäisi kehittyä.
Oikeudellisten ja institutionaalisten suojien pitäisi määritellä tietojen käsittely, sallitut tulokset, julkistamissäännöt, vastuut ja käyttöoikeudet – erityisesti silloin, kun testit koskevat vaarallisia kyvykkyyksiä.
Vertailujen ylläpidon pitäisi kattaa kysymysten alkuperä, otanta, luokittelu, dokumentointi, päivitysmenettelyt ja saastumisen seuranta. MLCommons on korostanut, ettei vertailusta tee luotettavaa pelkkä datan salassapito. Myös sen rakentamisen ja ylläpidon on kestettävä tarkastelu. 2025
Riippumaton toistettavuus edellyttäisi, että mallin tarjoajan ja pilvioperaattorin ulkopuoliset tahot voisivat mielekkäällä tavalla tarkistaa koontiversion, attestointiketjun, suorituspolitiikat ja raportoidut tulokset.
Skaalautuvuus olisi yhtä tärkeää. Käyttökelpoisen standardin pitäisi toimia eri mallikehittäjien, arkkitehtuurien, pilvipalvelujen, arvioijien, vertailutyyppien ja mallijulkaisujen välillä – ei vain yhdessä räätälöidyssä yhteistyössä ja yhden laitteistokokoonpanon varassa.
Google DeepMindin Gemini-pilotti kannattaa nähdä vaikeampien tekoälyarviointien infrastruktuurina, ei vertailujen luotettavuuden lopullisena ratkaisuna. Se näyttää, miten luottamuksellinen laskenta voi lieventää ristiriitaa testidatan suojaamisen ja omistusoikeudellisten mallien suojaamisen välillä. Alan mittakaavassa uskottavuus riippuu kuitenkin riippumattomasta valvonnasta, hyvästä vertailujen hallinnasta, oikeudellisista suojista, toistettavuudesta ja käytännön toimivuudesta – ei enklavien salauksesta yksin. 1320
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Google DeepMind kuvasi 27. elokuuta 2026 Gemini 2.5 Flash Lite pilotinsa ensimmäiseksi omistusoikeudelliseen, eturintaman tekoälymalliin kohdistuneeksi kaksoissokkoarvioinniksi.
Google DeepMind kuvasi 27. elokuuta 2026 Gemini 2.5 Flash Lite pilotinsa ensimmäiseksi omistusoikeudelliseen, eturintaman tekoälymalliin kohdistuneeksi kaksoissokkoarvioinniksi. Testissä käytettiin MLCommonsin AILuminate turvallisuusvertailun yksityisiä kysymyksiä, jotka käsittelivät muun muassa kyberhyökkäyksiä, kemiallisia ja biologisia riskejä, vihapuhetta, itsensä vahingoittamista ja väki...
Menetelmä vähentää vertailukysymysten salassapidon ja mallin painojen suojaamisen välistä kompromissia, mutta laajamittainen käyttöönotto vaatisi vielä riippumatonta toistettavuutta, oikeudellisia suojia, vertailujen...