Google DeepMind lancerede EmbeddingGemma 2 den 6. oktober 2026. Det er en åben, multimodal efterfølger til den første EmbeddingGemma, som kun arbejdede med tekst. Den nye model bygger på Gemma 4 og er lavet til at gøre indhold på tværs af formater søgbart – også direkte på en telefon eller computer i stedet for via en cloudtjeneste.
1
2
Kort fortalt omdanner en embeddingmodel indhold til talvektorer, der afspejler betydning. Når forskellige typer indhold ligger i samme vektorrum, kan en app for eksempel sammenholde en tekstsøgning med et billede eller et lydklip.
Hvad er nyt i forhold til den første EmbeddingGemma?
- Flere typer indhold: Hvor den første model kun håndterede tekst, kan EmbeddingGemma 2 arbejde med tekst og kode, billeder, video og lyd – også blandinger af formaterne.
1
5
- Fælles vektorrum: Modelens modulære kodere placerer indholdet i et fælles rum med 768 dimensioner. Det gør det muligt at sammenligne forskellige formater uden først at kæde separate embeddingmodeller sammen. Udviklere kan indlæse de kodere, de har brug for; konfigurationerne spænder fra 270 millioner parametre til tekst og kode til 740 millioner for alle modaliteter.
1
5
- Større kontekstvindue: EmbeddingGemma 2 har et oplyst kontekstvindue på 8.000 tokens – omtrent fire gange så stort som forgængerens 2.000. Vektorerne kan også gøres mindre end 768 dimensioner; den nye model understøtter forkortelse helt ned til 128 dimensioner.
4
9
- Flere parametre: Den fulde model har 740 millioner parametre og er udgivet under Apache 2.0-licensen. Til sammenligning havde den første EmbeddingGemma 308 millioner parametre og byggede på Gemma 3.
1
3
4
Kan den køre på en telefon?
Google oplyser et kvantiseret hukommelsesforbrug på cirka 191 MB for tekstopsætningen og 567 MB for den fulde multimodale model. Tallene gælder bestemte konfigurationer og en test på en Google Pixel 11 Pro; de er derfor ikke en garanti for, hvordan modellen vil køre på alle enheder.
2
3
7
Modellen kan bruges til lokal semantisk søgning på tværs af eksempelvis noter, billeder, lydoptagelser og video. Den kan også indgå i multimodal informationssøgning, herunder RAG – en metode, hvor et system finder relevant materiale, før det genererer et svar.
2
8
Hvad ved vi om benchmarkresultaterne?
Google beskriver EmbeddingGemma 2 som førende i sin størrelsesklasse. De kilder, der ligger til grund for denne gennemgang, giver dog ikke et tilstrækkeligt grundlag for en sikker, numerisk sammenligning med den første EmbeddingGemma.
2
6
7
Hvad betyder det for sikkerheden?
At tekst, billeder og lyd kan sammenlignes i samme vektorrum, betyder ikke i sig selv, at søgeresultaterne er sikre, korrekte eller passende. En app skal stadig håndtere følsomt indhold og tage højde for, at modellen kan finde irrelevante eller forkerte match.
2
8
Hvor kan modellen hentes?
Vægtene er ifølge de tilgængelige oplysninger listet via Googles udviklermateriale og modellens side på Hugging Face. De gennemgåede kilder fastslår ikke en konkret dato for yderligere distribution eller planlagte integrationer.
1
5
8