Google DeepMind hat EmbeddingGemma 2 am 6. Oktober 2026 veröffentlicht. Das Open-Weight-Modell ist der multimodale Nachfolger des textbasierten EmbeddingGemma und basiert auf der Gemma-4-Architektur. Sein zentraler Unterschied: Es kann Text und Code ebenso wie Bilder, Video und Audio in einem gemeinsamen Suchraum abbilden – und ist für den Einsatz direkt auf Geräten ausgelegt.
1
2
Was Embeddings mit einer Suche zu tun haben
Ein Embedding ist eine Zahlenfolge, die die Bedeutung eines Inhalts repräsentiert. Ähnliche Inhalte liegen in diesem Vektorraum näher beieinander. So kann eine Anwendung etwa eine Textanfrage mit einem Bild oder einem Audioausschnitt vergleichen, statt für jede Medienart ein eigenes Embedding-Modell zu verketten.
Die wichtigsten Änderungen gegenüber dem Vorgänger
- Mehr Medien, gemeinsamer Suchraum: EmbeddingGemma 2 unterstützt Text, Code, Bilder, Video, Audio und Kombinationen daraus. Die modularen Encoder bilden diese Inhalte in einem gemeinsamen 768-dimensionalen Vektorraum ab.
1
5
- Größer, aber modular nutzbar: Das vollständige Modell hat 740 Millionen Parameter und wird unter der Apache-2.0-Lizenz mit offenen Gewichten angeboten. Entwicklerinnen und Entwickler können je nach Bedarf einzelne Encoder laden: Konfigurationen reichen von 270 Millionen Parametern für Text und Code bis zur vollständigen multimodalen Variante mit 740 Millionen. Der Vorgänger kam im September 2025 mit 308 Millionen Parametern und basierte auf Gemma 3.
1
3
4
- Längerer Kontext, anpassbare Vektoren: Für EmbeddingGemma 2 werden 8.000 Tokens Kontext angegeben – etwa viermal so viel wie beim Vorgänger mit 2.000 Tokens. Die Vektoren müssen nicht immer alle 768 Dimensionen umfassen; sie lassen sich verkleinern, beim neuen Modell laut Entwicklerangaben bis auf 128 Dimensionen. Auch das erste EmbeddingGemma unterstützte anpassbare Ausgaben von 128 bis 768 Dimensionen.
4
6
9
- Arbeitsspeicher auf dem Gerät: Für quantisierte Konfigurationen nennt Google rund 191 MB für Text allein und rund 567 MB für das vollständige multimodale Modell. Das sind spezifische Messwerte und keine Garantie für jedes Gerät oder jede Nutzung.
2
6
7
Was sich damit machen lässt
Die gemeinsame Repräsentation kann etwa eine lokale Suche über Notizen, Fotos, Aufnahmen und Videos ermöglichen. Auch Anwendungen für semantische Suche oder Retrieval-Augmented Generation (RAG) können davon profitieren: Bei RAG sucht ein System passende Inhalte heraus, um sie für eine Antwort zu nutzen. Die Verarbeitung direkt auf dem Gerät kann dabei helfen, Inhalte lokal zu halten.
2
8
Ein gemeinsamer Vektorraum macht Treffer jedoch nicht automatisch richtig, sicher oder angemessen. Anwendungen müssen weiterhin mit sensiblen Inhalten umgehen und berücksichtigen, dass eine semantische Suche auch unpassende oder irreführende Treffer liefern kann.
2
8
Benchmarks und Verfügbarkeit
Google beschreibt EmbeddingGemma 2 als besonders leistungsfähig für seine Größenklasse. Aus den vorliegenden Quellen lässt sich aber kein belastbarer numerischer Benchmarkvergleich mit dem Vorgänger ableiten.
2
6
7
Die Modellgewichte sind über Googles Entwicklerangebote und eine Hugging-Face-Modellseite aufgeführt. Zu weiteren geplanten Vertriebswegen oder Integrationen geben die ausgewerteten Quellen keinen verlässlichen Termin an.
1
5
8