Google DeepMind představil EmbeddingGemma 2 dne 6. října 2026. Jde o otevřený multimodální model pro tvorbu takzvaných embeddingů – číselných reprezentací významu, podle kterých může software vyhledávat podobný obsah. Novinka navazuje na původní textový EmbeddingGemma, ale umí pracovat i s kódem, obrázky, videem a zvukem. Je postavená na architektuře Gemma 4 a licencovaná pod Apache 2.0.
2
Co je nové oproti původnímu EmbeddingGemma
Původní EmbeddingGemma, uvedený v září 2025, převáděl do vektorů pouze text. Měl 308 milionů parametrů a kontextové okno o velikosti 2 000 tokenů. EmbeddingGemma 2 rozšiřuje záběr na více typů obsahu a jeho kontextové okno má podle dostupných informací 8 000 tokenů.
5
6
11
Hlavní změnou je společný prostor pro různé modality. Textový dotaz tak lze porovnávat například s obrázkem, zvukovou nahrávkou nebo částí videa, aniž by aplikace musela pro každý typ obsahu skládat samostatný řetězec embeddingových modelů. Model mapuje vstupy do prostoru o 768 rozměrech.
2
18
Parametry, velikost vektorů a provoz v zařízení
Plná multimodální varianta má 740 milionů parametrů. Architektura je modulární: vývojáři mohou načíst jen ty části, které potřebují, přičemž konfigurace pro text a kód začíná na 270 milionech parametrů. To může pomoci omezit nároky na zařízení i aplikaci.
2
Výstupní vektory není nutné vždy ukládat v plné 768rozměrné podobě. EmbeddingGemma 2 umožňuje jejich zkrácení až na 128 rozměrů; podobnou možnost nabízela i původní verze. Menší vektory mohou šetřit místo v databázi, ale výběr rozměru je kompromisem a sám o sobě nezaručuje stejnou kvalitu vyhledávání.
5
9
10
Google uvádí, že po kvantizaci činí aktivní paměť přibližně 191 MB pro textovou konfiguraci a 567 MB pro plně multimodální model při měření na telefonu Google Pixel 11 Pro. Jde o hodnoty pro konkrétní konfigurace a zařízení, nikoli o záruku stejné spotřeby na každém telefonu či počítači.
3
Co to může umožnit – a co od modelu nečekat
EmbeddingGemma 2 se hodí pro sémantické vyhledávání, tedy hledání podle významu, nikoli jen podle přesně shodných slov. V praxi by tak aplikace mohla vyhledávat mezi textovými poznámkami, fotografiemi, nahrávkami nebo videozáznamy a využívat model také v systémech RAG, které při odpovědi pracují s vyhledanými podklady.
2
8
Společný vektorový prostor ale není bezpečnostní ani ověřovací nástroj. To, že model označí obsah za významově podobný dotazu, samo o sobě neříká, zda je nalezená informace přesná, bezpečná nebo vhodná. Aplikace proto musí počítat s chybnými shodami i s vlastním zacházením s citlivým obsahem.
Výsledky testů a dostupnost
Google popisuje EmbeddingGemma 2 jako velmi schopný model na svou velikost. Z podkladů, které jsou k dispozici, však nelze spolehlivě sestavit číselné srovnání jeho výsledků s původním EmbeddingGemma napříč benchmarky.
2
Váhy modelu jsou uvedené v materiálech Google pro vývojáře a na jeho stránce na Hugging Face. Dostupné zdroje nepotvrzují pevné datum dalších plánovaných distribucí či integrací.