Tether åpner TurboQuant: Kjør avansert KI på din egen PC med 5 ganger mindre minne
Tether lanserte TurboQuant, et open source verktøy som komprimerer en stor språkmodells arbeidsminne (KV cache) med opptil 5×, noe som gjør det mulig å kjøre lange, komplekse KI økter på hverdagsenheter uten å miste y... Teknologien, basert på en algoritme fra Google Research, er nå en kjernekomponent i QVAC SDK 0.1...
Tether lanserte TurboQuant, et open source verktøy som komprimerer en stor språkmodells arbeidsminne (KV cache) med opptil 5×, noe som gjør det mulig å kjøre lange, komplekse KI økter på hverdagsenheter uten å miste y...
Teknologien, basert på en algoritme fra Google Research, er nå en kjernekomponent i QVAC SDK 0.12.0, Tethers rammeverk for lokal, desentralisert KI, som også har fått funksjoner for tekst til video og robotstyring [2]...
Administrerende direktør Paolo Ardoino kaller dette et strategisk grep, og hevder at hvis bare de største datasentrene kan kjøre avansert KI, så vil 'KI bli formet av dem som eier mest maskinvare' [7].
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
Den 1. juni 2026 slapp Tethers KI-forskningsgruppe et open source-verktøy som lover å frigjøre avansert kunstig intelligens fra massive datasentre. Verktøyet, kalt TurboQuant, er en produksjonsklar implementasjon av en Google Research-algoritme designet for å knuse den største minneflaskehalsen i store språkmodeller (LLM-er). Ved å redusere minnet som kreves for KI-ens arbeidskontekst med opptil 5 ganger, lar TurboQuant utviklere kjøre omfattende KI-økter med lang kontekst på enhetene de allerede har – bærbare PC-er, telefoner og annen kantutstyr – uten å ofre kvaliteten på resultatet .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Tether åpner TurboQuant: Kjør avansert KI på din egen PC med 5 ganger mindre minne"?
Tether lanserte TurboQuant, et open source verktøy som komprimerer en stor språkmodells arbeidsminne (KV cache) med opptil 5×, noe som gjør det mulig å kjøre lange, komplekse KI økter på hverdagsenheter uten å miste y...
What are the key points to validate first?
Tether lanserte TurboQuant, et open source verktøy som komprimerer en stor språkmodells arbeidsminne (KV cache) med opptil 5×, noe som gjør det mulig å kjøre lange, komplekse KI økter på hverdagsenheter uten å miste y... Teknologien, basert på en algoritme fra Google Research, er nå en kjernekomponent i QVAC SDK 0.12.0, Tethers rammeverk for lokal, desentralisert KI, som også har fått funksjoner for tekst til video og robotstyring [2]...
What should I do next in practice?
Administrerende direktør Paolo Ardoino kaller dette et strategisk grep, og hevder at hvis bare de største datasentrene kan kjøre avansert KI, så vil 'KI bli formet av dem som eier mest maskinvare' [7].
Dette er ikke bare en teknisk kuriositet. Lanseringen er en nøkkelbrikke i Tethers bredere satsing på desentralisert databehandling, og den lanseres som en hovedfunksjon i QVAC SDK 0.12.0, selskapets plattform for å bygge KI som eksisterer helt utenfor skyen .
Minnemuren TurboQuant bryter ned
For å forstå hvorfor dette er viktig, må man se på hvordan språkmodeller "husker". Når du har en samtale med en KI-modell eller ber den analysere et langt dokument, refererer modellen ikke bare til sine opprinnelige treningsdata. Den bygger et dynamisk sanntidsminne kalt nøkkel-verdi-cachen (KV-cache), som lagrer konteksten av hvert ord og hver interaksjon som behandles i løpet av økten .
Problemet er at denne KV-cachen er en glupsk minnesluker. Den vokser for hvert eneste nye tegn (token) og sluker lydløst gigabyte med RAM eller VRAM. Ifølge Tether bruker KV-cachen alene omtrent 8 GB minne for en modell med 4 milliarder parametere som jobber med rundt 262 000 tegn – noe som kan tilsvare timesvis med chat eller en hel kodebase. Kjører du fire slike økter samtidig, ser du på over 32 GB minnebruk, før du i det hele tatt har lastet inn selve modellen .
Denne eksplosive minneveksten er hovedgrunnen til at KI-oppgaver med lang kontekst – som å analysere et juridisk dokument, oppsummere en podcast eller kode med en virkelig kontekstbevisst assistent – i stor grad har vært fanger av sentralisert skyinfrastruktur med sine rekker av minnetunge GPU-er .
Slik oppnår TurboQuant nær tapsfri 5× komprimering
TurboQuant takler dette problemet direkte med en teknikk kalt aggressiv KV-cache-kvantisering. Konseptet ligner på å komprimere et bilde: det bytter bort en ørliten bit teoretisk numerisk presisjon mot enorme praktiske gevinster i minneeffektivitet .
Slik fungerer det:
Angrip det rette målet: I stedet for å komprimere de statiske modellvektene – en vanlig teknikk som kan kreve ny trening – fokuserer TurboQuant utelukkende på de flyktige KV-cache-verdiene som genereres under kjøring.
Reduser numerisk presisjon: Det reduserer presisjonen på tallene i KV-cachen, typisk fra 16-biters eller til og med 32-biters flyttallsformater ned til kun 4-biters eller 2-biters representasjoner .
Utnytt naturlig redundans: Teknikken fungerer fordi de hurtiglagrede nøkkel-verdi-parene inneholder betydelig statistisk redundans. TurboQuants kvantiseringsmetode er smart nok til å bevare informasjonen som betyr noe for modellens neste prediksjon, slik at den endelige utdatakvaliteten forblir nesten umulig å skille fra en ukomprimert modell .
Tethers open source-lansering er ikke bare en teoretisk artikkel. Det er en praktisk pakke som inkluderer en full kvantiseringspipeline, adaptere for vanlige inferensrammeverk og distribusjonsprofiler tilpasset ulike arbeidsbelastninger, noe som gjør den klar for utviklere å plugge inn i sine prosjekter .
Strategien: Lokal KI som et maktforskyvende grep
TurboQuants virkelige betydning blir tydelig når man ser hvor den hører hjemme: inne i QVAC Fabric, kjernekjøringen for språkmodeller i Tethers QVAC SDK . QVAC, som står for "Sovereign Mind"-initiativet, er Tethers open source, plattformuavhengige SDK for å bygge lokal-først, desentralisert KI. Den samler funksjoner som tekstfullføring, talegjenkjenning, oversettelse, tekstgjenkjenning (OCR), bildegenerering og finjustering på enheten bak et enhetlig API som er ment å kjøre identisk på enhver enhet eller ethvert operativsystem .
Ved å fjerne KV-cache-minnemuren er TurboQuant mer enn bare en ytelsesjustering. Det er en strategisk muliggjører for Tethers visjon om KI som kjører på personlige enheter, lokale nettverk og peer-to-peer-infrastruktur, noe som reduserer verdens avhengighet av en håndfull sentraliserte, gigantiske skytjenester .
Det politiske aspektet ved dette er eksplisitt. Tethers administrerende direktør, Paolo Ardoino, formulerte lanseringen i klare ordelag: «Hvis KI med lang kontekst bare fungerer innenfor de største datasentrene, vil KI bli formet av den som eier mest maskinvare» . TurboQuant er designet for å være et praktisk svar på denne maktkonsentrasjonen.
Hva annet er nytt i QVAC SDK 0.12.0
TurboQuant var stjernen i 0.12.0-lanseringen, men den kom ikke alene. Oppdateringen utvidet også SDK-ens multimodale evner på betydelige måter, basert på den offisielle lanseringen og støttende dekning :
Tekst-til-video-generering: En helt ny funksjon for å lage videoinnhold fra tekstmeldinger, noe som utvider SDK-ens generative KI-verktøykasse .
Robotstyring: Nye inferensprimitiver og kjøretidskomponenter spesifikt inkludert for robotikk-applikasjoner, noe som signaliserer en ambisiøs utvidelse inn i den fysiske verden .
En komplett KI-stakk: 0.12.0-oppdateringen bygger videre på QVACs løfte som en enkelt import for et dusin KI-oppgaver, inkludert transkripsjon, oversettelse, tekst-til-tale og LoRA-finjustering på enheten, alt tilgjengelig via @qvac/sdk-pakken .
Ved å lansere TurboQuant som open source-programvare og integrere det direkte i QVAC SDK, vedder Tether på at fremtidens KI vil bli like mye definert av hvor den kjører – på din enhet, i dine hender – som av hva den kan gjøre.