Tether Lancar TurboQuant: Jimat Memori AI Sehingga 5 Kali Ganda, Buka Jalan untuk AI Tempatan yang Berkuasa
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan... Teknologi ini, berdasarkan algoritma Google Research, kini menjadi teras kepada QVAC SDK 0.12.0,...
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan...
Teknologi ini, berdasarkan algoritma Google Research, kini menjadi teras kepada QVAC SDK 0.12.0, rangka kerja Tether untuk AI terdesentralisasi yang mengutamakan peranti setempat, yang turut menambah keupayaan penjana...
CEO Paolo Ardoino menyatakan langkah ini adalah strategik, dengan alasan jika hanya pusat data terbesar boleh menjalankan AI canggih, maka 'AI akan dibentuk oleh sesiapa yang memiliki paling banyak perkakasan' [7].
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
Pada 1 Jun 2026, Kumpulan Penyelidikan AI Tether melancarkan alat sumber terbuka yang berpotensi membebaskan AI canggih daripada belenggu pusat data yang besar. Alat ini, TurboQuant, ialah implementasi sedia-pengeluaran bagi algoritma Google Research yang direka untuk menghapuskan kesesakan memori terbesar dalam model bahasa besar (LLM). Dengan mengurangkan memori yang diperlukan untuk konteks kerja AI sehingga 5 kali ganda, TurboQuant membolehkan pembangun menjalankan sesi AI berkonteks panjang yang meluas pada peranti yang sama yang sudah mereka miliki—komputer riba, telefon, dan perkakasan tepian—tanpa menjejaskan kualiti output .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Tether Lancar TurboQuant: Jimat Memori AI Sehingga 5 Kali Ganda, Buka Jalan untuk AI Tempatan yang Berkuasa"?
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan...
What are the key points to validate first?
Tether melancarkan TurboQuant, alat sumber terbuka yang memampatkan 'ingatan kerja' (KV cache) model bahasa besar sehingga 5×, membolehkan sesi AI yang panjang dan kompleks dijalankan pada peranti harian tanpa kehilan... Teknologi ini, berdasarkan algoritma Google Research, kini menjadi teras kepada QVAC SDK 0.12.0, rangka kerja Tether untuk AI terdesentralisasi yang mengutamakan peranti setempat, yang turut menambah keupayaan penjana...
What should I do next in practice?
CEO Paolo Ardoino menyatakan langkah ini adalah strategik, dengan alasan jika hanya pusat data terbesar boleh menjalankan AI canggih, maka 'AI akan dibentuk oleh sesiapa yang memiliki paling banyak perkakasan' [7].
Ini bukan sekadar rasa ingin tahu teknikal. Pelancaran ini adalah komponen penting dalam usaha lebih besar Tether ke arah pengkomputeran terdesentralisasi, dan ia dilancarkan sebagai ciri utama QVAC SDK 0.12.0, platform syarikat untuk membina AI yang hidup sepenuhnya di luar awan .
Tembok Memori Yang Dipecahkan TurboQuant
Untuk memahami kepentingannya, kita perlu melihat bagaimana LLM "mengingat." Apabila anda berbual dengan model AI atau memintanya menganalisis dokumen panjang, model itu bukan sekadar merujuk data latihan asalnya. Ia membina memori dinamik dan masa nyata yang dipanggil cache nilai-kunci (KV), yang menyimpan konteks setiap perkataan dan interaksi yang diproses semasa sesi tersebut .
Masalahnya, cache KV ini adalah pemakan memori yang sangat rakus. Ia mengembang dengan setiap token baharu, secara senyap memakan gigabait RAM atau VRAM. Menurut Tether, untuk model berparameter 4 bilion yang berfungsi dengan kira-kira 262,000 token—mungkin perbualan berjam-jam atau keseluruhan pangkalan kod—cache KV sahaja menelan kira-kira 8 GB memori. Jalankan empat sesi sedemikian serentak, dan penggunaan memori mencecah lebih 32 GB, sebelum model itu sendiri dimuatkan .
Pertumbuhan memori yang mendadak ini adalah sebab utama tugas AI berkonteks panjang—seperti menganalisis dokumen undang-undang, meringkaskan podcast, atau mengekod dengan pembantu yang benar-benar sedar konteks—sebahagian besarnya terkurung dalam infrastruktur awan terpusat dengan deretan GPU bermemori tinggi .
Bagaimana TurboQuant Mencapai Mampatan 5× Hampir Tanpa Kehilangan Kualiti
TurboQuant menangani masalah ini secara langsung dengan teknik yang dipanggil kuantisasi cache KV agresif. Konsepnya serupa dengan memampatkan imej: ia menukar sedikit ketepatan berangka teori untuk keuntungan praktikal yang besar dalam kecekapan memori .
Begini cara ia berfungsi:
Serang Sasaran yang Tepat: Daripada memampatkan pemberat model statik—teknik lazim yang mungkin memerlukan latihan semula—TurboQuant memberi tumpuan secara eksklusif kepada nilai cache KV yang tidak menentu yang dijana pada masa inferens.
Kurangkan Ketepatan Berangka: Ia mengurangkan ketepatan nombor dalam cache KV, lazimnya daripada format titik terapung 16-bit atau 32-bit kepada hanya perwakilan 4-bit atau 2-bit .
Manfaatkan Lebihan Semula Jadi: Teknik ini berfungsi kerana pasangan nilai-kunci yang dicache mengandungi lebihan statistik yang ketara. Kaedah kuantisasi TurboQuant cukup pintar untuk mengekalkan maklumat yang penting untuk ramalan seterusnya model, menjadikan kualiti output akhir hampir tidak dapat dibezakan daripada model tanpa mampatan .
Lancaran sumber terbuka Tether bukan sekadar kertas teori. Ia adalah pakej praktikal yang merangkumi saluran paip kuantisasi penuh, penyesuai untuk rangka kerja inferens biasa, dan profil penggunaan yang ditala untuk beban kerja yang berbeza, menjadikannya sedia untuk dipasang oleh pembangun ke dalam projek mereka .
Strategi: AI Setempat Sebagai Anjakan Kuasa
Kepentingan sebenar TurboQuant menjadi jelas apabila melihat di mana ia berada: di dalam QVAC Fabric, masa jalan LLM teras bagi QVAC SDK Tether . QVAC, singkatan bagi inisiatif "Minda Berdaulat", ialah SDK sumber terbuka dan rentas platform Tether untuk membina AI terdesentralisasi yang mengutamakan peranti setempat. Ia menggabungkan keupayaan seperti penyelesaian LLM, pengecaman pertuturan, terjemahan, OCR, penjanaan imej, dan penalaan halus pada peranti di sebalik satu API bersatu yang direka untuk berjalan secara identik pada mana-mana peranti atau sistem operasi .
Dengan menyingkirkan tembok memori cache KV, TurboQuant adalah lebih daripada sekadar tweak prestasi. Ia adalah pemboleh strategik untuk visi Tether tentang AI yang berjalan pada peranti peribadi, rangkaian tempatan, dan infrastruktur rakan-ke-rakan, mengurangkan kebergantungan dunia kepada segelintir awan hiperskala terpusat .
Politik di sebalik ini adalah eksplisit. CEO Tether, Paolo Ardoino, merangka pelancaran ini dalam istilah yang jelas: “Jika AI berkonteks panjang hanya berfungsi di dalam pusat data terbesar, maka AI akan dibentuk oleh sesiapa yang memiliki paling banyak perkakasan” . TurboQuant direka sebagai jawapan praktikal kepada penumpuan kuasa itu.
Apa Lagi yang Baharu dalam QVAC SDK 0.12.0
TurboQuant adalah bintang bagi keluaran 0.12.0, tetapi ia tidak datang bersendirian. Kemas kini ini turut memperluaskan keupayaan multimodal SDK dengan cara yang ketara, berdasarkan siaran rasmi dan liputan sokongan :
Penjanaan Teks-ke-Video: Keupayaan serba baharu untuk mencipta kandungan video daripada arahan teks, memperluaskan kit alat AI generatif SDK .
Kawalan Robot: Primitif inferens dan komponen masa jalan baharu yang disertakan khusus untuk aplikasi robotik, menandakan pengembangan bercita-cita tinggi ke dunia fizikal .
Timbunan AI Lengkap: Kemas kini 0.12.0 terus membina janji QVAC sebagai satu import tunggal untuk sedozen tugas AI, termasuk transkripsi, terjemahan, teks-ke-pertuturan, dan penalaan halus LoRA pada peranti, semuanya boleh diakses melalui pakej @qvac/sdk.
Dengan melancarkan TurboQuant sebagai perisian sumber terbuka dan mengintegrasikannya terus ke dalam QVAC SDK, Tether membuat pertaruhan bahawa masa depan AI akan ditentukan oleh tempat ia berjalan—pada peranti anda, di tangan anda—sama seperti apa yang boleh dilakukannya.