टीथर ने ओपन-सोर्स किया टर्बोक्वांट: AI की मेमोरी खपत 5 गुना कम करके लैपटॉप पर चलाएं लंबे AI सेशन
टीथर ने टर्बोक्वांट को ओपन सोर्स किया, जो बड़े भाषा मॉडलों की कार्यशील मेमोरी (KV कैश) को 5 गुना तक संपीड़ित करता है। इससे बिना गुणवत्ता खोए, लंबे और जटिल AI सेशन आम कंप्यूटर और फोन पर चलाना संभव हुआ है [5][7][2]। गूगल रिसर्च के एल्गोरिदम पर आधारित यह टूल, QVAC SDK 0.12.0 का अहम हिस्सा है, जो टीथर का लोकल फर्स्ट, वि...
टीथर ने टर्बोक्वांट को ओपन सोर्स किया, जो बड़े भाषा मॉडलों की कार्यशील मेमोरी (KV कैश) को 5 गुना तक संपीड़ित करता है। इससे बिना गुणवत्ता खोए, लंबे और जटिल AI सेशन आम कंप्यूटर और फोन पर चलाना संभव हुआ है [5][7][2]।
गूगल रिसर्च के एल्गोरिदम पर आधारित यह टूल, QVAC SDK 0.12.0 का अहम हिस्सा है, जो टीथर का लोकल फर्स्ट, विकेंद्रीकृत AI प्लेटफॉर्म है। इस अपडेट में टेक्स्ट टू वीडियो और रोबोट कंट्रोल की सुविधाएं भी शामिल की गई हैं [2][7]।
टीथर के CEO पाओलो अर्दोइनो का मानना है कि यह एक सामरिक कदम है। उनका तर्क है कि अगर उन्नत AI सिर्फ बड़े डेटा सेंटरों में चलेगा, तो 'AI को वही आकार देगा जिसके पास सबसे ज़्यादा हार्डवेयर होगा' [7]।
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI संकेत
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
1 जून, 2026 को, टीथर के AI रिसर्च ग्रुप ने एक ऐसा ओपन-सोर्स टूल जारी किया जो उन्नत AI को विशाल डेटा सेंटरों की क़ैद से आज़ाद करने का वादा करता है। इस टूल का नाम है टर्बोक्वांट (TurboQuant)। यह गूगल रिसर्च के एक एल्गोरिदम का प्रोडक्शन-रेडी कार्यान्वयन है, जिसे बड़े भाषा मॉडल (LLM) की सबसे बड़ी मेमोरी बाधा को तोड़ने के लिए डिज़ाइन किया गया है। AI के कार्यशील संदर्भ (वर्किंग कॉन्टेक्स्ट) के लिए ज़रूरी मेमोरी को 5 गुना तक कम करके, टर्बोक्वांट डेवलपर्स को लंबे AI सेशन उन्हीं उपकरणों पर चलाने की सुविधा देता है जो वे पहले से इस्तेमाल करते हैं—जैसे लैपटॉप, फोन, और एज डिवाइस—बिना आउटपुट की गुणवत्ता से समझौता किए ।
Studio Global AI
अपना शोध जारी रखें
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
"टीथर ने ओपन-सोर्स किया टर्बोक्वांट: AI की मेमोरी खपत 5 गुना कम करके लैपटॉप पर चलाएं लंबे AI सेशन" का संक्षिप्त उत्तर क्या है?
टीथर ने टर्बोक्वांट को ओपन सोर्स किया, जो बड़े भाषा मॉडलों की कार्यशील मेमोरी (KV कैश) को 5 गुना तक संपीड़ित करता है। इससे बिना गुणवत्ता खोए, लंबे और जटिल AI सेशन आम कंप्यूटर और फोन पर चलाना संभव हुआ है [5][7][2]।
सबसे पहले सत्यापित करने योग्य मुख्य बिंदु क्या हैं?
टीथर ने टर्बोक्वांट को ओपन सोर्स किया, जो बड़े भाषा मॉडलों की कार्यशील मेमोरी (KV कैश) को 5 गुना तक संपीड़ित करता है। इससे बिना गुणवत्ता खोए, लंबे और जटिल AI सेशन आम कंप्यूटर और फोन पर चलाना संभव हुआ है [5][7][2]। गूगल रिसर्च के एल्गोरिदम पर आधारित यह टूल, QVAC SDK 0.12.0 का अहम हिस्सा है, जो टीथर का लोकल फर्स्ट, विकेंद्रीकृत AI प्लेटफॉर्म है। इस अपडेट में टेक्स्ट टू वीडियो और रोबोट कंट्रोल की सुविधाएं भी शामिल की गई हैं [2][7]।
मुझे अभ्यास में आगे क्या करना चाहिए?
टीथर के CEO पाओलो अर्दोइनो का मानना है कि यह एक सामरिक कदम है। उनका तर्क है कि अगर उन्नत AI सिर्फ बड़े डेटा सेंटरों में चलेगा, तो 'AI को वही आकार देगा जिसके पास सबसे ज़्यादा हार्डवेयर होगा' [7]।
यह महज़ एक तकनीकी जिज्ञासा नहीं है। यह रिलीज़ विकेंद्रीकृत कंप्यूटिंग की ओर टीथर के व्यापक कदम का एक अहम हिस्सा है, और इसे QVAC SDK 0.12.0 की मुख्य विशेषता के रूप में पेश किया गया है। QVAC, टीथर का वह प्लेटफॉर्म है जो पूरी तरह से क्लाउड के बाहर रहने वाले AI के निर्माण के लिए बनाया गया है ।
मेमोरी की वह दीवार जिसे टर्बोक्वांट तोड़ता है
यह समझने के लिए कि यह इतना अहम क्यों है, आपको यह देखना होगा कि LLM "याद" कैसे रखते हैं। जब आप किसी AI मॉडल से बातचीत करते हैं या उसे किसी लंबे दस्तावेज़ का विश्लेषण करने के लिए कहते हैं, तो मॉडल सिर्फ अपने मूल प्रशिक्षण डेटा का ही संदर्भ नहीं लेता। वह एक गतिशील, रीयल-टाइम मेमोरी बनाता है जिसे की-वैल्यू (KV) कैश कहते हैं। यह उस सत्र के दौरान संसाधित हर शब्द और इंटरैक्शन के संदर्भ को संग्रहीत करता है ।
समस्या यह है कि यह KV कैश मेमोरी का बहुत बड़ा भुक्खड़ है। यह हर एक नए टोकन के साथ फूलता जाता है और चुपचाप गीगाबाइट्स RAM या VRAM खा जाता है। टीथर के अनुसार, एक 4-बिलियन-पैरामीटर मॉडल के लिए जो लगभग 2,62,000 टोकन (जो कि घंटों की चैट या एक पूरा कोडबेस हो सकता है) के साथ काम कर रहा है, अकेला KV कैश ही लगभग 8 GB मेमोरी खा जाता है। ऐसे चार सत्र एक साथ चलाएं, तो मॉडल को लोड करने से पहले ही 32 GB से अधिक मेमोरी इस्तेमाल हो रही होगी ।
मेमोरी में यह विस्फोटक वृद्धि ही मुख्य कारण है कि लंबे संदर्भ वाले AI कार्य—जैसे किसी कानूनी दस्तावेज़ का विश्लेषण करना, किसी पॉडकास्ट का सारांश तैयार करना, या वास्तव में संदर्भ-जागरूक सहायक के साथ कोडिंग करना—अब तक बड़े पैमाने पर केंद्रीकृत क्लाउड इंफ्रास्ट्रक्चर और उसकी उच्च-मेमोरी GPU की पंक्तियों के क़ैदी रहे हैं ।
टर्बोक्वांट कैसे हासिल करता है बिना नुकसान के 5 गुना संपीड़न
टर्बोक्वांट आक्रामक KV कैश क्वांटाइज़ेशन नामक तकनीक से इस समस्या से सीधे निपटता है। इसकी अवधारणा किसी इमेज को संपीड़ित करने जैसी ही है: यह सैद्धांतिक संख्यात्मक सटीकता के एक छोटे से हिस्से को, व्यावहारिक मेमोरी दक्षता में बड़े लाभ के लिए व्यापार करता है ।
यह ऐसे काम करता है:
सही लक्ष्य पर हमला: स्थिर मॉडल भार (वेट्स) को संपीड़ित करने के बजाय—जो एक आम तकनीक है और जिसके लिए पुनर्प्रशिक्षण की आवश्यकता हो सकती है—टर्बोक्वांट विशेष रूप से अनुमान (इन्फरेंस) के समय उत्पन्न होने वाले अस्थिर KV कैश मानों पर ध्यान केंद्रित करता है।
संख्यात्मक सटीकता कम करना: यह KV कैश में संख्याओं की सटीकता को कम करता है, आमतौर पर 16-बिट या 32-बिट फ़्लोटिंग-पॉइंट फ़ॉर्मेट से घटाकर केवल 4-बिट या 2-बिट प्रतिनिधित्व तक ।
प्राकृतिक अतिरेकता का दोहन: यह तकनीक इसलिए काम करती है क्योंकि कैश्ड की-वैल्यू जोड़े में महत्वपूर्ण सांख्यिकीय अतिरेकता होती है। टर्बोक्वांट की क्वांटाइज़ेशन विधि इतनी स्मार्ट है कि मॉडल की अगली भविष्यवाणी के लिए मायने रखने वाली जानकारी को संरक्षित रखती है, जिससे अंतिम आउटपुट गुणवत्ता एक असंपीड़ित मॉडल से लगभग अप्रभेद्य रहती है ।
टीथर का ओपन-सोर्स रिलीज़ सिर्फ एक सैद्धांतिक पेपर नहीं है। यह एक व्यावहारिक पैकेज है जिसमें एक पूर्ण क्वांटाइज़ेशन पाइपलाइन, सामान्य इन्फरेंस फ्रेमवर्क के लिए एडेप्टर, और विभिन्न कार्यभारों के लिए ट्यून किए गए डिप्लॉयमेंट प्रोफाइल शामिल हैं, जो इसे डेवलपर्स के लिए अपनी परियोजनाओं में जोड़ने के लिए तैयार बनाते हैं ।
रणनीति: लोकल AI शक्ति संतुलन बदलने वाला कदम
टर्बोक्वांट का असली महत्व तब स्पष्ट होता है जब आप देखते हैं कि यह कहाँ रहता है: QVAC फ़ैब्रिक के अंदर, जो टीथर के QVAC SDK का मुख्य LLM रनटाइम है । QVAC, जिसका अर्थ है "सॉवरेन माइंड" पहल, टीथर का ओपन-सोर्स, क्रॉस-प्लेटफ़ॉर्म SDK है, जो लोकल-फर्स्ट, विकेंद्रीकृत AI के निर्माण के लिए है । यह एक एकीकृत API के पीछे LLM कम्पलीशन, स्पीच रिकॉग्निशन, अनुवाद, OCR, इमेज जनरेशन और ऑन-डिवाइस फाइन-ट्यूनिंग जैसी क्षमताओं को बंडल करता है, जिसे किसी भी डिवाइस या ऑपरेटिंग सिस्टम पर समान रूप से चलाने के लिए डिज़ाइन किया गया है ।
KV-कैश मेमोरी की दीवार को हटाकर, टर्बोक्वांट केवल एक प्रदर्शन सुधार नहीं है। यह टीथर के उस विज़न का एक रणनीतिक सक्षमकर्ता है, जिसमें AI व्यक्तिगत उपकरणों, स्थानीय नेटवर्कों और पीयर-टू-पीयर इंफ्रास्ट्रक्चर पर चलता है, जिससे दुनिया की मुट्ठी भर केंद्रीकृत हाइपरस्केल क्लाउड पर निर्भरता कम होती है ।
इसकी राजनीति स्पष्ट है। टीथर के CEO पाओलो अर्दोइनो ने इस रिलीज़ को कड़े शब्दों में परिभाषित किया: “अगर लंबे संदर्भ वाला AI केवल सबसे बड़े डेटा सेंटरों के अंदर ही काम करता है, तो AI को वही आकार देगा जिसके पास सबसे अधिक हार्डवेयर होगा” । टर्बोक्वांट को सत्ता के इस संकेंद्रण का एक व्यावहारिक जवाब बनने के लिए डिज़ाइन किया गया है।
QVAC SDK 0.12.0 में और क्या है नया
टर्बोक्वांट 0.12.0 रिलीज़ का सितारा था, लेकिन यह अकेला नहीं आया था। आधिकारिक रिलीज़ और संबंधित कवरेज के अनुसार, इस अपडेट ने SDK की मल्टीमॉडल क्षमताओं का भी महत्वपूर्ण रूप से विस्तार किया :
टेक्स्ट-टू-वीडियो जनरेशन: टेक्स्ट प्रॉम्प्ट से वीडियो सामग्री बनाने की एक बिल्कुल नई क्षमता, जो SDK के जनरेटिव AI टूलकिट को और विस्तृत करती है ।
रोबोट कंट्रोल: रोबोटिक्स अनुप्रयोगों के लिए विशेष रूप से शामिल किए गए नए इन्फरेंस प्रिमिटिव और रनटाइम घटक, जो भौतिक दुनिया में एक महत्वाकांक्षी विस्तार का संकेत देते हैं ।
एक संपूर्ण AI स्टैक: 0.12.0 अपडेट एक दर्जन AI कार्यों—जिसमें ट्रांसक्रिप्शन, अनुवाद, टेक्स्ट-टू-स्पीच और ऑन-डिवाइस LoRA फाइन-ट्यूनिंग शामिल हैं—के लिए एकल आयात के रूप में QVAC के वादे पर आगे बढ़ना जारी रखता है, जो सभी @qvac/sdk पैकेज के माध्यम से सुलभ हैं ।
टर्बोक्वांट को ओपन-सोर्स सॉफ़्टवेयर के रूप में जारी करके और इसे सीधे QVAC SDK में एकीकृत करके, टीथर यह दांव लगा रहा है कि AI का भविष्य उतना ही परिभाषित होगा जितना कि वह कहाँ चलता है—आपके डिवाइस पर, आपके हाथों में—जितना कि वह क्या कर सकता है।