Tether julkaisi TurboQuantin: Pitkän kontekstin tekoäly toimii nyt läppärillä viisi kertaa pienemmällä muistilla
Tether julkaisi avoimen lähdekoodin TurboQuant työkalun, joka pakkaa suuren kielimallin työmuistin (KV välimuistin) jopa viidesosaan. Google Researchin algoritmiin perustuva teknologia on nyt osa QVAC SDK 0.12.0 kehityspakettia, Tetherin hajautetun tekoälyn viitekehystä, joka sai samalla tuen tekstistä videoksi toim...
Tether julkaisi avoimen lähdekoodin TurboQuant työkalun, joka pakkaa suuren kielimallin työmuistin (KV välimuistin) jopa viidesosaan.
Google Researchin algoritmiin perustuva teknologia on nyt osa QVAC SDK 0.12.0 kehityspakettia, Tetherin hajautetun tekoälyn viitekehystä, joka sai samalla tuen tekstistä videoksi toiminnolle ja robotiikan ohjaukselle...
Toimitusjohtaja Paolo Ardoinon mukaan kyse on strategisesta vallan hajauttamisesta: jos vain suurimmat datakeskukset pystyvät ajamaan kehittynyttä tekoälyä, 'tekoälyä muokkaa se, joka omistaa eniten rautaa' [7].
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
Tetherin tekoälytutkimusryhmä julkaisi 1. kesäkuuta 2026 avoimen lähdekoodin työkalun, joka lupaa vapauttaa kehittyneen tekoälyn massiivisten datakeskusten kahleista. Työkalu, TurboQuant, on tuotantovalmis toteutus Google Researchin algoritmista, joka on suunniteltu murskaamaan suurten kielimallien (LLM) suurin muistin pullonkaula. Pienentämällä tekoälyn työmuistin tarvetta jopa viidesosaan (5×) TurboQuant antaa kehittäjien ajaa laajoja, pitkän kontekstin tekoälysessioita laitteilla, jotka heillä on jo mukanaan – läppäreillä, puhelimilla ja reunapalvelimilla – ilman, että tulosten laatu kärsii .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Tether julkaisi TurboQuantin: Pitkän kontekstin tekoäly toimii nyt läppärillä viisi kertaa pienemmällä muistilla"?
Tether julkaisi avoimen lähdekoodin TurboQuant työkalun, joka pakkaa suuren kielimallin työmuistin (KV välimuistin) jopa viidesosaan.
What are the key points to validate first?
Tether julkaisi avoimen lähdekoodin TurboQuant työkalun, joka pakkaa suuren kielimallin työmuistin (KV välimuistin) jopa viidesosaan. Google Researchin algoritmiin perustuva teknologia on nyt osa QVAC SDK 0.12.0 kehityspakettia, Tetherin hajautetun tekoälyn viitekehystä, joka sai samalla tuen tekstistä videoksi toiminnolle ja robotiikan ohjaukselle...
What should I do next in practice?
Toimitusjohtaja Paolo Ardoinon mukaan kyse on strategisesta vallan hajauttamisesta: jos vain suurimmat datakeskukset pystyvät ajamaan kehittynyttä tekoälyä, 'tekoälyä muokkaa se, joka omistaa eniten rautaa' [7].
Kyse ei ole vain teknisestä kuriositeetista. Julkaisu on avainpala Tetherin laajempaa pyrkimystä kohti hajautettua laskentaa, ja se toimitetaan QVAC SDK 0.12.0 -kehityspaketin kärkiominaisuutena, joka on yhtiön alusta täysin pilven ulkopuolella elävän tekoälyn rakentamiseen .
Muistiseinä, jonka TurboQuant murskaa
Ymmärtääkseen, miksi tällä on merkitystä, on tarkasteltava, miten LLM:t "muistavat". Kun käyt keskustelua tekoälymallin kanssa tai pyydät sitä analysoimaan pitkää dokumenttia, malli ei vain viittaa alkuperäiseen koulutusdataansa. Se rakentaa dynaamisen, reaaliaikaisen muistin, jota kutsutaan avain-arvo-välimuistiksi (KV cache), ja joka tallentaa jokaisen istunnon aikana käsitellyn sanan ja vuorovaikutuksen kontekstin .
Ongelmana on, että tämä KV-välimuisti on ahne muistisyöppö. Se paisuu jokaisen uuden sanan myötä ja nielee hiljaisesti gigatavuja RAM- tai VRAM-muistia. Tetherin mukaan 4 miljardin parametrin mallille, joka käsittelee noin 262 000 sanan verran tekstiä – mikä voi tarkoittaa tuntikausien keskustelua tai kokonaista koodipohjaa – pelkkä KV-välimuisti ahmii noin 8 Gt muistia. Aja neljä tällaista sessiota samanaikaisesti, ja muistia kuluu yli 32 Gt ennen kuin itse malli on edes ladattu.
Tämä räjähdysmäinen muistin kasvu on pääsyy sille, miksi pitkän kontekstin tekoälytehtävät – kuten oikeudellisen asiakirjan analysointi, podcastin tiivistäminen tai koodaaminen todella kontekstitietoisen avustajan kanssa – ovat pitkälti olleet keskitetyn pilvi-infrastruktuurin vankeja, jossa on riveittäin suurmuistisia näytönohjaimia .
Miten TurboQuant saavuttaa lähes häviöttömän 5×-pakkauksen
TurboQuant käy ongelman kimppuun tekniikalla, jota kutsutaan aggressiiviseksi KV-välimuistin kvantisoinniksi. Konsepti on samankaltainen kuin kuvan pakkaaminen: se vaihtaa pienen määrän teoreettista numerotarkkuutta valtaviin käytännön hyötyihin muistitehokkuudessa .
Näin se toimii:
Iskee oikeaan kohteeseen: Sen sijaan, että pakkaisi staattisia mallin painoarvoja – yleinen tekniikka, joka saattaa vaatia uudelleenkoulutusta – TurboQuant keskittyy yksinomaan päättelyhetkellä luotuihin, haihtuviin KV-välimuistin arvoihin.
Vähentää numerotarkkuutta: Se vähentää KV-välimuistin numeroiden tarkkuutta, tyypillisesti 16-bittisistä tai jopa 32-bittisistä liukuluvuista vain 4-bittisiin tai 2-bittisiin esitysmuotoihin .
Hyödyntää luontaista redundanssia: Tekniikka toimii, koska välimuistissa olevat avain-arvo-parit sisältävät merkittävää tilastollista toisteisuutta. TurboQuantin kvantisointimenetelmä on tarpeeksi älykäs säilyttääkseen mallin seuraavan ennustuksen kannalta olennaisen tiedon, pitäen lopullisen tuloksen laadun lähes erottamattomana pakkaamattomasta mallista .
Tetherin avoimen lähdekoodin julkaisu ei ole vain teoreettinen paperi. Se on käytännön paketti, joka sisältää täyden kvantisointiputken, sovittimia yleisiin päättelykehyksiin ja eri työkuormille viritettyjä käyttöönottoprofiileja, mikä tekee siitä valmiin kehittäjien liitettäväksi projekteihinsa .
Strategia: Paikallinen tekoäly vallan siirtäjänä
TurboQuantin todellinen merkitys kirkastuu, kun katsoo, missä se sijaitsee: QVAC Fabricin sisällä, joka on Tetherin QVAC SDK:n keskeinen LLM-ajoympäristö . QVAC, joka on lyhenne "Sovereign Mind" -aloitteesta, on Tetherin avoimen lähdekoodin, alustariippumaton kehityspaketti paikallisen, hajautetun tekoälyn rakentamiseen . Se niputtaa ominaisuuksia, kuten LLM-tekstintuoton, puheentunnistuksen, käännöksen, tekstintunnistuksen (OCR), kuvien luonnin ja laitteella tapahtuvan hienosäädön yhden yhtenäisen ohjelmointirajapinnan taakse, joka on suunniteltu toimimaan identtisesti millä tahansa laitteella tai käyttöjärjestelmällä .
Poistamalla KV-välimuistin muuriseinän TurboQuant on enemmän kuin suorituskykysäätö. Se on strateginen mahdollistaja Tetherin visiolle tekoälystä, joka toimii henkilökohtaisilla laitteilla, lähiverkoissa ja vertaisverkkoinfrastruktuurissa, vähentäen maailman riippuvuutta kourallisesta keskitettyjä hyperskaalan pilvipalveluita .
Tämän politiikka on julkilausuttua. Tetherin toimitusjohtaja Paolo Ardoino kehysti julkaisun kärkevin sanankääntein: "Jos pitkän kontekstin tekoäly toimii vain suurimmissa datakeskuksissa, tekoälyä muokkaa se, joka omistaa eniten rautaa" . TurboQuant on suunniteltu käytännön vastaukseksi tälle vallan keskittymiselle.
Mitä muuta on uutta QVAC SDK 0.12.0:ssa
TurboQuant oli 0.12.0-julkaisun tähti, mutta se ei matkustanut yksin. Päivitys laajensi myös SDK:n multimodaalisia kykyjä merkittävillä tavoilla virallisen julkaisun ja sitä tukevan uutisoinnin perusteella :
Robotin ohjaus: Uusia päättelyn perustoimintoja ja ajonaikaisia komponentteja erityisesti robotiikkasovelluksiin, mikä viestittää kunnianhimoista laajentumista fyysiseen maailmaan .
Täydellinen tekoälypino: 0.12.0-päivitys jatkaa QVAC:n lupauksen rakentamista yhden tuonnin takaa kymmenille tekoälytehtäville, mukaan lukien litterointi, kääntäminen, tekstistä puheeksi -synteesi ja laitteella tapahtuva LoRA-hienosäätö, jotka kaikki ovat käytettävissä @qvac/sdk-paketin kautta .
Julkaisemalla TurboQuantin avoimen lähdekoodin ohjelmistona ja integroimalla sen suoraan QVAC SDK:hon, Tether lyö vetoa siitä, että tekoälyn tulevaisuutta määrittelee yhtä paljon se, missä se toimii – omalla laitteellasi, käsissäsi – kuin se, mitä se pystyy tekemään.