AI op je eigen apparaat: Tether pakt het grootste geheugenprobleem aan met TurboQuant
Tether heeft TurboQuant open source gemaakt, een tool die het werkgeheugen (KV cache) van een groot taalmodel tot 5× comprimeert, waardoor lange, complexe AI sessies op alledaagse apparaten mogelijk worden zonder kwal... De technologie, gebaseerd op een Google Research algoritme, is nu een kernonderdeel van de QVAC...
Tether heeft TurboQuant open source gemaakt, een tool die het werkgeheugen (KV cache) van een groot taalmodel tot 5× comprimeert, waardoor lange, complexe AI sessies op alledaagse apparaten mogelijk worden zonder kwal...
De technologie, gebaseerd op een Google Research algoritme, is nu een kernonderdeel van de QVAC SDK 0.12.0, Tethers framework voor lokale, decentrale AI dat ook tekst naar video en robotbesturingsmogelijkheden heeft t...
CEO Paolo Ardoino noemt deze verschuiving strategisch en stelt dat als alleen de grootste datacenters geavanceerde AI kunnen draaien, 'AI gevormd zal worden door degene met de meeste hardware' [7].
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
Op 1 juni 2026 heeft Tether's AI Research Group een open-source tool uitgebracht die geavanceerde AI belooft te bevrijden van massieve datacenters. De tool, TurboQuant, is een productieklare implementatie van een Google Research-algoritme dat is ontworpen om het grootste geheugenknelpunt in grote taalmodellen (LLM's) aan te pakken. Door het geheugen dat nodig is voor de werkcontext van AI tot 5× te verminderen, stelt TurboQuant ontwikkelaars in staat om uitgestrekte, langdurige AI-sessies te draaien op de apparaten die ze al bij zich dragen – laptops, telefoons en edge-hardware – zonder in te leveren op de kwaliteit van de output .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "AI op je eigen apparaat: Tether pakt het grootste geheugenprobleem aan met TurboQuant"?
Tether heeft TurboQuant open source gemaakt, een tool die het werkgeheugen (KV cache) van een groot taalmodel tot 5× comprimeert, waardoor lange, complexe AI sessies op alledaagse apparaten mogelijk worden zonder kwal...
What are the key points to validate first?
Tether heeft TurboQuant open source gemaakt, een tool die het werkgeheugen (KV cache) van een groot taalmodel tot 5× comprimeert, waardoor lange, complexe AI sessies op alledaagse apparaten mogelijk worden zonder kwal... De technologie, gebaseerd op een Google Research algoritme, is nu een kernonderdeel van de QVAC SDK 0.12.0, Tethers framework voor lokale, decentrale AI dat ook tekst naar video en robotbesturingsmogelijkheden heeft t...
What should I do next in practice?
CEO Paolo Ardoino noemt deze verschuiving strategisch en stelt dat als alleen de grootste datacenters geavanceerde AI kunnen draaien, 'AI gevormd zal worden door degene met de meeste hardware' [7].
Het is niet zomaar een technische curiositeit. De release is een sleutelonderdeel van Tether's bredere stap richting gedecentraliseerd computergebruik, en het wordt geleverd als een hoofdonderdeel van QVAC SDK 0.12.0, het platform van het bedrijf voor het bouwen van AI die volledig buiten de cloud leeft .
De geheugenmuur die TurboQuant doorbreekt
Om te begrijpen waarom dit belangrijk is, moet je kijken naar hoe LLM's "onthouden". Wanneer je een gesprek voert met een AI-model of het vraagt een lang document te analyseren, refereert het model niet alleen aan zijn oorspronkelijke trainingsdata. Het bouwt een dynamisch, real-time geheugen op dat de key-value (KV) cache wordt genoemd, en dat de context opslaat van elk woord en elke interactie die tijdens die sessie wordt verwerkt .
Het probleem is dat deze KV-cache een onverzadigbare geheugenvreter is. Het zwelt op met elk nieuw token en slokt in stilte gigabytes aan RAM of VRAM op. Volgens Tether verbruikt alleen de KV-cache voor een model met 4 miljard parameters dat werkt met ongeveer 262.000 tokens – wat neer kan komen op urenlange chat of een volledige codebase – al snel 8 GB aan geheugen. Draai je vier van zulke sessies tegelijk, dan zit je op meer dan 32 GB geheugengebruik, nog voordat je het model zelf hebt geladen .
Deze explosieve geheugengroei is de belangrijkste reden dat taken met een lange AI-context – zoals het analyseren van een juridisch document, het samenvatten van een podcast, of programmeren met een echt contextbewuste assistent – grotendeels gevangen zijn gebleven in gecentraliseerde cloudinfrastructuur met rijen GPU's met veel geheugen .
Hoe TurboQuant een bijna verliesloze 5× compressie bereikt
TurboQuant pakt dit probleem frontaal aan met een techniek die agressieve KV-cache-kwantisering wordt genoemd. Het concept is vergelijkbaar met het comprimeren van een afbeelding: het ruilt een klein beetje theoretische numerieke precisie in voor enorme praktische winst in geheugenefficiëntie .
Zo werkt het:
Val het juiste doel aan: In plaats van de statische modelgewichten te comprimeren – een veelgebruikte techniek die omscholing kan vereisen – richt TurboQuant zich uitsluitend op de vluchtige KV-cache-waarden die tijdens de uitvoering worden gegenereerd.
Verminder numerieke precisie: Het vermindert de precisie van de getallen in de KV-cache, doorgaans van 16-bits of zelfs 32-bits floating-point-formaten naar slechts 4-bits of 2-bits representaties .
Benut natuurlijke redundantie: De techniek werkt omdat de opgeslagen key-value-paren aanzienlijke statistische redundantie bevatten. De kwantiseringsmethode van TurboQuant is slim genoeg om de informatie te bewaren die ertoe doet voor de volgende voorspelling van het model, waardoor de uiteindelijke uitvoerkwaliteit bijna niet te onderscheiden is van een ongecomprimeerd model .
Tethers open-source release is niet zomaar een theoretisch paper. Het is een praktisch pakket dat een volledige kwantiseringspijplijn, adapters voor gangbare inferentieframeworks en implementatieprofielen omvat die zijn afgestemd op verschillende workloads, waardoor het klaar is voor ontwikkelaars om in hun projecten te integreren .
De strategie: Lokale AI als machtsverschuiving
De echte betekenis van TurboQuant wordt duidelijk wanneer je kijkt naar waar het zich bevindt: binnen QVAC Fabric, de kern-LLM-runtime van Tethers QVAC SDK . QVAC, wat staat voor het "Sovereign Mind"-initiatief, is Tethers open-source, cross-platform SDK voor het bouwen van lokale, decentrale AI. Het bundelt mogelijkheden zoals LLM-voltooiing, spraakherkenning, vertaling, OCR, het genereren van afbeeldingen en het finetunen op het apparaat achter één uniforme API die identiek moet draaien op elk apparaat of besturingssysteem .
Door de geheugenmuur van de KV-cache te slechten, is TurboQuant meer dan een prestatieverbetering. Het is een strategische aanjager van Tethers visie op AI die draait op persoonlijke apparaten, lokale netwerken en peer-to-peer-infrastructuur, waardoor de wereldwijde afhankelijkheid van een handvol gecentraliseerde hyperscale clouds afneemt .
De politiek hiervan is expliciet. Tether-CEO Paolo Ardoino formuleerde de release in harde bewoordingen: “Als AI met een lange context alleen werkt in de grootste datacenters, dan wordt AI gevormd door degene die de meeste hardware bezit” . TurboQuant is ontworpen als een praktisch antwoord op die machtsconcentratie.
Wat is er nog meer nieuw in QVAC SDK 0.12.0
TurboQuant was de ster van de 0.12.0-release, maar het reisde niet alleen. De update breidde ook de multimodale mogelijkheden van de SDK op significante wijze uit, op basis van de officiële release en ondersteunende berichtgeving :
Tekst-naar-videogeneratie: Een gloednieuwe mogelijkheid voor het creëren van videocontent op basis van tekstprompts, ter verbreding van de generatieve AI-toolkit van de SDK .
Robotbesturing: Nieuwe inferentie-primitieven en runtime-componenten die specifiek zijn opgenomen voor roboticatoepassingen, wat duidt op een ambitieuze uitbreiding naar de fysieke wereld .
Een complete AI-stack: De 0.12.0-update bouwt voort op de belofte van QVAC als een enkele import voor een dozijn AI-taken, waaronder transcriptie, vertaling, tekst-naar-spraak en LoRA-finetuning op het apparaat, allemaal toegankelijk via het @qvac/sdk-pakket .
Door TurboQuant als open-source software uit te brengen en direct te integreren in de QVAC SDK, zet Tether in op het idee dat de toekomst van AI evenzeer bepaald zal worden door waar het draait – op jouw apparaat, in jouw handen – als door wat het kan doen.