Google DeepMind julkaisi EmbeddingGemma 2:n 6. lokakuuta 2026. Kyseessä on avoimilla painoilla julkaistu multimodaalinen upotusmalli: se muuntaa eri sisältötyypit numeerisiksi vektoreiksi, joiden avulla sovellus voi etsiä merkitykseltään samankaltaista sisältöä. Malli perustuu Gemma 4:ään ja laajentaa alkuperäistä, vain tekstiä käsitellyttä EmbeddingGemmaa.
1
2
Mitä uutta edeltäjään verrattuna?
Alkuperäinen EmbeddingGemma julkaistiin syyskuussa 2025. Siinä oli 308 miljoonaa parametria, ja se perustui Gemma 3:een. EmbeddingGemma 2:ssa on 740 miljoonaa parametria, ja sen lisenssi on Apache 2.0.
1
3
4
Suurin muutos on tuettujen sisältöjen kirjo. EmbeddingGemma 2 käsittelee tekstiä ja koodia sekä kuvia, videota ja ääntä – myös näiden yhdistelmiä. Sen moduuleista koostuva rakenne mahdollistaa vain tarvittavien osien lataamisen: tekstin ja koodin asetukset alkavat 270 miljoonasta parametrista, ja kaikkia sisältötyyppejä tukeva kokonaisuus yltää 740 miljoonaan parametriin.
1
5
Yhteinen vektoriavaruus helpottaa monimuotoista hakua
Kaiken sisältötyypin esitykset sijoittuvat samaan 768-ulotteiseen vektoriavaruuteen. Sovellus voi siten verrata esimerkiksi tekstimuotoista hakua kuviin tai äänisisältöön ilman, että eri sisältötyypeille täytyy ketjuttaa erillisiä upotusmalleja.
1
5
Tämä voi mahdollistaa esimerkiksi haun muistiinpanoista, valokuvista, tallenteista ja videoista suoraan laitteella. Mallia voi käyttää myös hakuun perustuvissa generointijärjestelmissä, joista käytetään usein lyhennettä RAG. Vektorin kokoa voi pienentää tallennustilan säästämiseksi; alkuperäisen mallin ulostulovektorin koko oli säädettävissä 128:sta 768 ulottuvuuteen.
2
6
Pidempi konteksti ja laitteella käyttö
EmbeddingGemma 2:n ilmoitettu konteksti-ikkuna on 8 000 tokenia eli noin nelinkertainen alkuperäisen 2 000 tokenin ikkunaan verrattuna. Google kuvaa mallia kokoluokassaan parhaaksi, mutta saatavilla olevien lähteiden perusteella ei voi tehdä luotettavaa numeerista vertailua sen ja alkuperäisen EmbeddingGemman vertailutuloksista.
4
6
Ilmoitetut muistilukemat ovat noin 191 megatavua tekstipainotteiselle kokoonpanolle ja noin 567 megatavua koko multimodaaliselle kokoonpanolle kvantisoituna. Luvut koskevat tiettyjä kokoonpanoja ja testilaitetta, eivätkä ne takaa samaa muistinkäyttöä kaikilla laitteilla.
2
6
7
Mitä malli ei tee?
Yhteinen vektoriavaruus auttaa löytämään samankaltaiseksi arvioitua sisältöä, mutta se ei itsessään kerro, onko löydetty aineisto turvallista, paikkansapitävää tai tilanteeseen sopivaa. Sovelluksen kehittäjän on huolehdittava esimerkiksi arkaluonteisen sisällön käsittelystä ja vääristä hakutuloksista.
2
8
EmbeddingGemma 2:n painot ovat saatavilla Googlen kehittäjämateriaaleissa ja Hugging Face -mallisivulla. Tarkastelluissa lähteissä ei vahvisteta aikataulua mahdollisille muille jakelukanaville tai integraatioille.
1
5
8