Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan... Teknologi ini, berdasarkan algoritma Google Research, kini menjadi teras kepada QVAC SDK 0.12.0,...

Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
Pada 1 Jun 2026, Kumpulan Penyelidikan AI Tether melancarkan alat sumber terbuka yang berpotensi membebaskan AI canggih daripada belenggu pusat data yang besar. Alat ini, TurboQuant, ialah implementasi sedia-pengeluaran bagi algoritma Google Research yang direka untuk menghapuskan kesesakan memori terbesar dalam model bahasa besar (LLM). Dengan mengurangkan memori yang diperlukan untuk konteks kerja AI sehingga 5 kali ganda, TurboQuant membolehkan pembangun menjalankan sesi AI berkonteks panjang yang meluas pada peranti yang sama yang sudah mereka miliki—komputer riba, telefon, dan perkakasan tepian—tanpa menjejaskan kualiti output .
Ini bukan sekadar rasa ingin tahu teknikal. Pelancaran ini adalah komponen penting dalam usaha lebih besar Tether ke arah pengkomputeran terdesentralisasi, dan ia dilancarkan sebagai ciri utama QVAC SDK 0.12.0, platform syarikat untuk membina AI yang hidup sepenuhnya di luar awan .
Untuk memahami kepentingannya, kita perlu melihat bagaimana LLM "mengingat." Apabila anda berbual dengan model AI atau memintanya menganalisis dokumen panjang, model itu bukan sekadar merujuk data latihan asalnya. Ia membina memori dinamik dan masa nyata yang dipanggil cache nilai-kunci (KV), yang menyimpan konteks setiap perkataan dan interaksi yang diproses semasa sesi tersebut .
Masalahnya, cache KV ini adalah pemakan memori yang sangat rakus. Ia mengembang dengan setiap token baharu, secara senyap memakan gigabait RAM atau VRAM. Menurut Tether, untuk model berparameter 4 bilion yang berfungsi dengan kira-kira 262,000 token—mungkin perbualan berjam-jam atau keseluruhan pangkalan kod—cache KV sahaja menelan kira-kira 8 GB memori. Jalankan empat sesi sedemikian serentak, dan penggunaan memori mencecah lebih 32 GB, sebelum model itu sendiri dimuatkan .
Pertumbuhan memori yang mendadak ini adalah sebab utama tugas AI berkonteks panjang—seperti menganalisis dokumen undang-undang, meringkaskan podcast, atau mengekod dengan pembantu yang benar-benar sedar konteks—sebahagian besarnya terkurung dalam infrastruktur awan terpusat dengan deretan GPU bermemori tinggi .
TurboQuant menangani masalah ini secara langsung dengan teknik yang dipanggil kuantisasi cache KV agresif. Konsepnya serupa dengan memampatkan imej: ia menukar sedikit ketepatan berangka teori untuk keuntungan praktikal yang besar dalam kecekapan memori .
Begini cara ia berfungsi:
Lancaran sumber terbuka Tether bukan sekadar kertas teori. Ia adalah pakej praktikal yang merangkumi saluran paip kuantisasi penuh, penyesuai untuk rangka kerja inferens biasa, dan profil penggunaan yang ditala untuk beban kerja yang berbeza, menjadikannya sedia untuk dipasang oleh pembangun ke dalam projek mereka .
Kepentingan sebenar TurboQuant menjadi jelas apabila melihat di mana ia berada: di dalam QVAC Fabric, masa jalan LLM teras bagi QVAC SDK Tether . QVAC, singkatan bagi inisiatif "Minda Berdaulat", ialah SDK sumber terbuka dan rentas platform Tether untuk membina AI terdesentralisasi yang mengutamakan peranti setempat
. Ia menggabungkan keupayaan seperti penyelesaian LLM, pengecaman pertuturan, terjemahan, OCR, penjanaan imej, dan penalaan halus pada peranti di sebalik satu API bersatu yang direka untuk berjalan secara identik pada mana-mana peranti atau sistem operasi
.
Dengan menyingkirkan tembok memori cache KV, TurboQuant adalah lebih daripada sekadar tweak prestasi. Ia adalah pemboleh strategik untuk visi Tether tentang AI yang berjalan pada peranti peribadi, rangkaian tempatan, dan infrastruktur rakan-ke-rakan, mengurangkan kebergantungan dunia kepada segelintir awan hiperskala terpusat .
Politik di sebalik ini adalah eksplisit. CEO Tether, Paolo Ardoino, merangka pelancaran ini dalam istilah yang jelas: “Jika AI berkonteks panjang hanya berfungsi di dalam pusat data terbesar, maka AI akan dibentuk oleh sesiapa yang memiliki paling banyak perkakasan” . TurboQuant direka sebagai jawapan praktikal kepada penumpuan kuasa itu.
TurboQuant adalah bintang bagi keluaran 0.12.0, tetapi ia tidak datang bersendirian. Kemas kini ini turut memperluaskan keupayaan multimodal SDK dengan cara yang ketara, berdasarkan siaran rasmi dan liputan sokongan :
@qvac/sdk Dengan melancarkan TurboQuant sebagai perisian sumber terbuka dan mengintegrasikannya terus ke dalam QVAC SDK, Tether membuat pertaruhan bahawa masa depan AI akan ditentukan oleh tempat ia berjalan—pada peranti anda, di tangan anda—sama seperti apa yang boleh dilakukannya.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan...
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan... Teknologi ini, berdasarkan algoritma Google Research, kini menjadi teras kepada QVAC SDK 0.12.0, rangka kerja Tether untuk AI terdesentralisasi yang mengutamakan peranti setempat, yang turut menambah keupayaan penjana...
CEO Paolo Ardoino menyatakan langkah ini adalah strategik, dengan alasan jika hanya pusat data terbesar boleh menjalankan AI canggih, maka 'AI akan dibentuk oleh sesiapa yang memiliki paling banyak perkakasan' [7].