Google DeepMind ने 6 अक्टूबर 2026 को EmbeddingGemma 2 जारी किया। यह सितंबर 2025 में आए टेक्स्ट-मात्र EmbeddingGemma का मल्टीमॉडल उत्तराधिकारी है। Gemma 4 पर आधारित इस खुले-वज़न वाले मॉडल का मकसद टेक्स्ट से लेकर तस्वीर और ऑडियो तक अलग-अलग सामग्री को एक ही जगह खोजने लायक बनाना है—और वह भी डिवाइस पर, बिना हर काम के लिए क्लाउड पर निर्भर हुए।
1
2
EmbeddingGemma 2 करता क्या है?
Embedding मॉडल सामग्री को संख्याओं के ऐसे समूह—यानी वेक्टर—में बदलता है जिनसे उसका अर्थ दर्शाया जा सके। फिर ऐप समान अर्थ वाली चीज़ों को ढूँढ़ सकता है। उदाहरण के लिए, कोई ऐप लिखे हुए सवाल के आधार पर उससे मिलती-जुलती तस्वीर या ऑडियो क्लिप खोज सकता है।
पहला EmbeddingGemma केवल टेक्स्ट के लिए था। नया मॉडल टेक्स्ट और कोड, तस्वीरें, वीडियो और ऑडियो को एक साझा 768-आयामी वेक्टर स्पेस में रखता है। इसका मॉड्यूलर ढाँचा डेवलपर को ज़रूरत के मुताबिक़ एन्कोडर चुनने देता है: टेक्स्ट और कोड वाले कॉन्फ़िगरेशन में 270 मिलियन से लेकर सभी मीडिया के लिए 740 मिलियन पैरामीटर तक। इससे अलग-अलग प्रकार की सामग्री के लिए कई एम्बेडिंग मॉडल जोड़ने की ज़रूरत घट सकती है।
1
5
पुराने मॉडल से क्या बदला?
| पहलू |
EmbeddingGemma 2 |
मूल EmbeddingGemma |
| रिलीज़ |
6 अक्टूबर 2026 1 2 |
सितंबर 2025 4 |
| आधार |
Gemma 4 2 |
Gemma 3 6 |
| पैरामीटर |
पूरे मल्टीमॉडल रूप में 740 मिलियन; मॉड्यूलर विकल्प 270 मिलियन से शुरू 1 5 |
308 मिलियन 3 4 |
| मीडिया |
टेक्स्ट, कोड, तस्वीरें, वीडियो और ऑडियो 1 5 |
केवल टेक्स्ट 4 5 |
| संदर्भ सीमा |
8,000 टोकन 4 6 |
2,000 टोकन 4 5 |
नए मॉडल की संदर्भ सीमा पुराने मॉडल की तुलना में लगभग चार गुना है। दोनों मॉडल 768 आयामों से छोटे वेक्टर भी दे सकते हैं। मूल मॉडल के लिए 128 से 768 आयामों का विकल्प बताया गया था; नए मॉडल के लिए उपलब्ध जानकारी वेक्टर को 128 आयाम तक छोटा करने की सुविधा का ज़िक्र करती है। कम आयाम से वेक्टर संग्रह करने की जगह घट सकती है, हालांकि इससे खोज की गुणवत्ता पर असर पड़ सकता है।
4
5
9
10
बेंचमार्क और डिवाइस पर मेमोरी
Google इसे अपने आकार के हिसाब से बेहतरीन प्रदर्शन वाला मॉडल बताता है। लेकिन उपलब्ध स्रोतों से मूल मॉडल के मुकाबले इसका विश्वसनीय संख्यात्मक बेंचमार्क देना संभव नहीं है।
2
3
Google की रिपोर्ट के मुताबिक़, क्वांटाइज़ किए गए मॉडल को Pixel 11 Pro पर चलाते समय टेक्स्ट-मात्र कॉन्फ़िगरेशन ने करीब 191 MB और पूरा मल्टीमॉडल कॉन्फ़िगरेशन करीब 567 MB सक्रिय मेमोरी इस्तेमाल की। ये खास कॉन्फ़िगरेशन और डिवाइस के आँकड़े हैं—हर फोन पर मेमोरी की गारंटी नहीं।
2
6
7
किन कामों में उपयोग हो सकता है?
डिवाइस पर चलने की क्षमता के साथ यह मॉडल नोट्स, तस्वीरों, रिकॉर्डिंग और वीडियो में अर्थ के आधार पर खोज बनाने में काम आ सकता है। डेवलपर इसे RAG (Retrieval-Augmented Generation)—यानी जवाब तैयार करने से पहले संबंधित जानकारी खोजने की तकनीक—जैसे कामों में भी लगा सकते हैं।
2
8
स्थानीय रूप से काम करने से सामग्री को क्लाउड पर भेजने की ज़रूरत कम हो सकती है, लेकिन इससे अपने-आप गोपनीयता या सुरक्षा सुनिश्चित नहीं होती। साझा वेक्टर स्पेस यह भी तय नहीं करता कि खोजा गया नतीजा सही, सुरक्षित या उपयुक्त है। संवेदनशील सामग्री और गलत मिलान के लिए ऐप बनाने वालों को अलग सुरक्षा उपाय रखने होंगे।
उपलब्धता
मॉडल के वज़न Google के डेवलपर संसाधनों और Hugging Face मॉडल पेज पर सूचीबद्ध हैं। अतिरिक्त वितरण या भविष्य के इंटीग्रेशन की किसी पक्की तारीख की पुष्टि के लिए उपलब्ध स्रोत पर्याप्त नहीं हैं।
1
5
8