Tether, büyük dil modellerinin anlık hafızasını (KV önbellek) 5 kata kadar sıkıştırarak, saatler süren sohbet veya yüzlerce sayfalık belge analizi gibi işlemleri günlük cihazlarda kalite kaybı olmadan mümkün kılan Tur... Google Research algoritmasına dayanan teknoloji, Tether'ın yerel öncelikli ve merkeziyetsiz yapa...

Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
1 Haziran 2026'da Tether'ın Yapay Zeka Araştırma Grubu, gelişmiş yapay zekayı devasa veri merkezlerinin tekelinden kurtarmayı vaat eden açık kaynaklı bir araç yayınladı. TurboQuant adlı bu araç, büyük dil modellerinin (LLM) en büyük hafıza darboğazını kırmak için Google Research tarafından geliştirilmiş bir algoritmanın üretime hazır bir uygulaması. Yapay zekanın çalışma belleğini 5 kata kadar azaltan TurboQuant, geliştiricilerin karmaşık ve uzun soluklu yapay zeka oturumlarını, çıktı kalitesinden ödün vermeden, halihazırda taşıdıkları cihazlarda (dizüstü bilgisayarlar, telefonlar, uç birim donanımlar) çalıştırmasına olanak tanıyor .
Bu, yalnızca teknik bir merak konusu değil. Bu sürüm, Tether'ın merkeziyetsiz bilgi işlem alanındaki daha geniş çaplı atılımının kilit bir parçası ve şirketin tamamen bulut dışında yaşayan yapay zeka inşa etme platformu olan QVAC SDK 0.12.0'ın amiral gemisi özelliği olarak geliyor .
Bunun neden önemli olduğunu anlamak için, yapay zeka modellerinin nasıl "hatırladığına" bakmak gerekiyor. Bir yapay zeka modeliyle sohbet ettiğinizde veya ondan uzun bir belgeyi analiz etmesini istediğinizde, model sadece orijinal eğitim verilerine başvurmaz. Anahtar-değer (KV) önbelleği adı verilen ve o oturum sırasında işlenen her kelimenin ve etkileşimin bağlamını depolayan dinamik, gerçek zamanlı bir hafıza oluşturur .
Sorun şu ki, bu KV önbelleği inanılmaz derecede obur bir hafıza tüketicisidir. İşlenen her yeni kelimeyle (token) birlikte şişer ve sessizce gigabaytlarca RAM veya VRAM tüketir. Tether'ın verdiği bilgiye göre, yaklaşık 262.000 token (saatlerce süren bir sohbet veya bütün bir yazılım kod tabanı olabilir) ile çalışan 4 milyar parametreli bir model için KV önbelleği tek başına yaklaşık 8 GB hafıza tüketiyor. Bu tür dört oturumu aynı anda çalıştırdığınızı düşünün; modelin kendisini yüklemeden önce 32 GB'ın üzerinde bir hafıza kullanımıyla karşı karşıyasınız demektir .
Bu patlayıcı hafıza büyümesi, hukuki bir belgeyi analiz etmek, bir podcast'in özetini çıkarmak veya bağlamın gerçekten farkında olan bir asistanla kod yazmak gibi uzun soluklu yapay zeka görevlerinin, sıra sıra yüksek hafızalı GPU'larla donatılmış merkezi bulut altyapısının adeta bir mahkûmu olmasının ana nedenidir .
TurboQuant bu sorunun üzerine, agresif KV önbellek niceleme adı verilen bir teknikle gidiyor. Konsept, bir görüntüyü sıkıştırmaya benziyor: küçük bir teorik sayısal hassasiyet, hafıza verimliliğinde büyük pratik kazançlar için takas ediliyor .
İşleyiş prensibi şöyle:
Tether'ın açık kaynak sürümü yalnızca teorik bir makale değil. Eksiksiz bir niceleme hattı, yaygın çıkarım çerçeveleri için bağdaştırıcılar ve farklı iş yükleri için ayarlanmış dağıtım profilleri içeren pratik bir paket olarak geliyor ve geliştiricilerin projelerine entegre etmesi için hazır .
TurboQuant'ın gerçek önemi, nerede konumlandığına bakınca netleşiyor: Tether'ın QVAC SDK'sının temel LLM çalışma zamanı olan QVAC Fabric'in içinde . "Egemen Zihin" (Sovereign Mind) girişiminin kısaltması olan QVAC, Tether'ın yerel öncelikli, merkeziyetsiz yapay zeka inşa etmek için geliştirdiği açık kaynaklı, çapraz platform bir SDK'dır
. LLM tamamlama, konuşma tanıma, çeviri, optik karakter tanıma (OCR), görüntü oluşturma ve cihaz üzerinde ince ayar gibi yetenekleri, herhangi bir cihaz veya işletim sisteminde aynı şekilde çalışması amaçlanan tek ve birleşik bir API arkasında toplar
.
TurboQuant, KV-önbellek hafıza duvarını ortadan kaldırarak bir performans ince ayarından çok daha fazlasını ifade ediyor. Tether'ın kişisel cihazlarda, yerel ağlarda ve uçtan uca altyapılarda çalışan, dünyanın bir avuç merkezi hiper ölçekli buluta olan bağımlılığını azaltan yapay zeka vizyonu için stratejik bir kolaylaştırıcı rolünde .
Bunun politik boyutu oldukça açık. Tether CEO'su Paolo Ardoino, bu sürümü keskin bir dille çerçeveledi: "Eğer uzun bağlamlı yapay zeka yalnızca en büyük veri merkezlerinde çalışırsa, o zaman yapay zeka en çok donanıma sahip olan kişi tarafından şekillendirilecektir" . TurboQuant, bu güç yoğunlaşmasına pratik bir cevap olarak tasarlandı.
TurboQuant, 0.12.0 sürümünün yıldızıydı, ancak tek başına gelmedi. Resmi sürüm notlarına ve destekleyici haberlere göre, bu güncelleme SDK'nın çok modlu yeteneklerini de önemli ölçüde genişletti :
@qvac/sdk paketi aracılığıyla tek bir içe aktarma (import) vaadini geliştirmeye devam ediyor Tether, TurboQuant'ı açık kaynaklı bir yazılım olarak piyasaya sürerek ve doğrudan QVAC SDK'ya entegre ederek, yapay zekanın geleceğinin, ne yapabildiği kadar nerede çalıştığıyla da (sizin cihazınızda, sizin ellerinizde) tanımlanacağına dair bir bahse giriyor.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Tether, büyük dil modellerinin anlık hafızasını (KV önbellek) 5 kata kadar sıkıştırarak, saatler süren sohbet veya yüzlerce sayfalık belge analizi gibi işlemleri günlük cihazlarda kalite kaybı olmadan mümkün kılan Tur...
Tether, büyük dil modellerinin anlık hafızasını (KV önbellek) 5 kata kadar sıkıştırarak, saatler süren sohbet veya yüzlerce sayfalık belge analizi gibi işlemleri günlük cihazlarda kalite kaybı olmadan mümkün kılan Tur... Google Research algoritmasına dayanan teknoloji, Tether'ın yerel öncelikli ve merkeziyetsiz yapay zeka vizyonunun temel taşı olan QVAC SDK 0.12.0 sürümüne entegre edildi; bu sürüm ayrıca metinden videoya üretim ve rob...
Tether CEO'su Paolo Ardoino, bu hamlenin stratejik olduğunu belirterek, 'Eğer gelişmiş yapay zeka sadece en büyük veri merkezlerinde çalışırsa, yapay zeka en çok donanıma sahip olanın şekillendirdiği bir şey olur' ded...