Tether відкриває код TurboQuant: як складна нейромережа поміститься у ваш кишені
Tether випустила у відкритий доступ TurboQuant — інструмент, що до 5 разів стискає «робочу пам'ять» (KV кеш) великих мовних моделей. В основі технології — алгоритм Google Research, який став ядром оновлення QVAC SDK 0.12.0, програмної платформи Tether для локального децентралізованого ШІ.
ОпублікувавВідредаговано за допомогою DeepSeek-V4-Pro
Tether випустила у відкритий доступ TurboQuant — інструмент, що до 5 разів стискає «робочу пам'ять» (KV кеш) великих мовних моделей.
В основі технології — алгоритм Google Research, який став ядром оновлення QVAC SDK 0.12.0, програмної платформи Tether для локального децентралізованого ШІ.
Генеральний директор Tether Паоло Ардоіно наголошує, що це стратегічний крок: якщо лише найбільші дата центри зможуть запускати передовий ШІ, то саме власники цих потужностей формуватимуть майбутнє ШІ [7].
What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve uTether's TurboQuant technology compresses the KV cache in LLMs by up to 5×, enabling complex AI to run locally. (Image: AI-generated)
AI Prompt
Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
openai.com
1 червня 2026 року дослідницька група Tether AI зробила те, чого давно чекали розробники та ентузіасти штучного інтелекту: випустила у відкритий доступ TurboQuant — готовий до роботи інструмент, який обіцяє визволити передовий ШІ з лещат величезних дата-центрів. За своєю суттю, це практична реалізація алгоритму Google Research, створена для того, щоб розтрощити найбільше «пляшкове горлечко» пам'яті у великих мовних моделях (LLM). Зменшуючи пам'ять, необхідну для «робочого контексту» ШІ, до 5 разів, TurboQuant дозволяє розробникам запускати безперервні, довготривалі сесії штучного інтелекту на пристроях, які ми вже маємо — ноутбуках, телефонах і периферійному обладнанні — без жодної шкоди для якості результату .
Studio Global AI
Continue your research
This page includes a source-backed answer you can continue inside Studio Global.
What is the short answer to "Tether відкриває код TurboQuant: як складна нейромережа поміститься у ваш кишені"?
Tether випустила у відкритий доступ TurboQuant — інструмент, що до 5 разів стискає «робочу пам'ять» (KV кеш) великих мовних моделей.
What are the key points to validate first?
Tether випустила у відкритий доступ TurboQuant — інструмент, що до 5 разів стискає «робочу пам'ять» (KV кеш) великих мовних моделей. В основі технології — алгоритм Google Research, який став ядром оновлення QVAC SDK 0.12.0, програмної платформи Tether для локального децентралізованого ШІ.
What should I do next in practice?
Генеральний директор Tether Паоло Ардоіно наголошує, що це стратегічний крок: якщо лише найбільші дата центри зможуть запускати передовий ШІ, то саме власники цих потужностей формуватимуть майбутнє ШІ [7].
Це не просто технічна цікавинка. Реліз є ключовою частиною ширшої стратегії Tether з переходу до децентралізованих обчислень, і він виходить як головна функція QVAC SDK 0.12.0, платформи компанії для створення ШІ, який живе повністю за межами хмари .
У що впирається пам'ять і як TurboQuant ламає цю стіну
Щоб зрозуміти важливість цього кроку, треба розібратися, як саме мовні моделі «запам'ятовують» розмову. Коли ви спілкуєтесь з ШІ-асистентом або просите його проаналізувати довгий документ, модель не просто звертається до своїх початкових тренувальних даних. Вона будує динамічну, оперативну пам'ять, яка називається ключ-значення кеш (KV-кеш). Саме там зберігається контекст кожного вашого слова та кожної взаємодії під час сесії .
Проблема в тому, що цей KV-кеш — ненажерливий «пожирач» пам'яті. Він роздувається з кожним новим токеном (умовною одиницею тексту), непомітно споживаючи гігабайти оперативної або відеопам'яті. За даними Tether, для 4-мільярдної моделі, що працює з приблизно 262 000 токенів (а це можуть бути години чату або ціла кодова база), лише один KV-кеш з'їдає близько 8 ГБ пам'яті. Запустіть чотири такі сесії одночасно, і ви отримаєте понад 32 ГБ використаної пам'яті, ще до того, як ви взагалі завантажите саму модель .
Це вибухове зростання споживання пам'яті і є головною причиною, чому довготривалі ШІ-завдання — як-от аналіз юридичних документів, розшифрування багатогодинних подкастів чи написання коду з дійсно контекстно-залежним помічником — здебільшого залишалися в'язнями централізованої хмарної інфраструктури з її рядами потужних GPU .
Як TurboQuant досягає майже безвтратного стиснення в 5 разів
TurboQuant атакує цю проблему в лоб за допомогою техніки, що називається агресивне квантування KV-кешу. Концепція схожа на стиснення зображення: ви жертвуєте крихітною часткою теоретичної числової точності заради величезного практичного виграшу в ефективності використання пам'яті .
Ось як це працює:
Влучити в правильну ціль: Замість стискати статичні ваги моделі (поширений метод, який часто вимагає перенавчання), TurboQuant фокусується виключно на мінливих значеннях KV-кешу, що генеруються під час роботи моделі.
Зменшити числову точність: Він знижує точність чисел у KV-кеші, зазвичай перетворюючи їх із 16-бітного або навіть 32-бітного формату з рухомою комою до всього лише 4-бітного або 2-бітного представлення .
Використати природну надлишковість: Техніка працює, тому що кешовані пари «ключ-значення» містять значну статистичну надлишковість. Метод квантування TurboQuant достатньо розумний, щоб зберегти інформацію, яка справді важлива для наступного передбачення моделі, роблячи кінцеву якість виводу майже невідмінною від нестисненої моделі .
Реліз Tether з відкритим кодом — це не просто теоретична стаття. Це практичний пакет, який містить повний конвеєр квантування, адаптери для популярних фреймворків і профілі розгортання, налаштовані під різні робочі навантаження. Усе готове для того, щоб розробники могли під'єднати це до своїх проєктів «з коробки» .
Стратегія: Локальний ШІ як зміна балансу сил
Справжнє значення TurboQuant стає очевидним, коли дивишся, де він «живе»: всередині QVAC Fabric, основного середовища виконання LLM у складі QVAC SDK від Tether . QVAC, що розшифровується як ініціатива «Суверенний розум» (Sovereign Mind), — це кросплатформний SDK з відкритим кодом для створення локального, децентралізованого ШІ. Він об'єднує такі можливості, як генерація тексту, розпізнавання мови, переклад, оптичне розпізнавання символів (OCR), генерація зображень і тонке налаштування моделей на пристрої за єдиним уніфікованим API, який працює однаково на будь-якому пристрої чи операційній системі .
Усуваючи «стіну пам'яті» KV-кешу, TurboQuant стає чимось більшим, ніж просто покращення продуктивності. Це стратегічний інструмент для втілення бачення Tether про ШІ, що працює на персональних пристроях, у локальних мережах і пірінговій (peer-to-peer) інфраструктурі, зменшуючи залежність світу від жменьки централізованих гіпермасштабованих хмар .
Політичний підтекст цього є відвертим. Генеральний директор Tether Паоло Ардоіно сформулював це жорстко: «Якщо довгоконтекстний ШІ працює лише в найбільших дата-центрах, то ШІ формуватиметься тим, хто володіє найбільшою кількістю обладнання» . TurboQuant задуманий як практична відповідь на цю концентрацію влади.
Що ще нового в QVAC SDK 0.12.0
TurboQuant став зіркою версії 0.12.0, але прийшов не один. Оновлення також суттєво розширило мультимодальні можливості SDK, згідно з офіційним релізом та супутніми публікаціями :
Генерація тексту у відео: Абсолютно нова функція для створення відеоконтенту з текстових підказок, що розширює набір генеративних інструментів SDK .
Керування роботами: Включені нові примітиви для логічного висновування та компоненти виконання, спеціально призначені для застосувань у робототехніці. Це сигналізує про амбіції вийти у фізичний світ .
Повний стек ШІ: Оновлення 0.12.0 продовжує розвивати обіцянку QVAC бути єдиним імпортом (import) для десятка ШІ-завдань, включаючи транскрибування, переклад, синтез мовлення та локальне доналаштування за методом LoRA. Усе це доступно через пакет @qvac/sdk.
Випускаючи TurboQuant як відкрите програмне забезпечення та інтегруючи його безпосередньо в QVAC SDK, Tether робить ставку на те, що майбутнє штучного інтелекту визначатиметься не лише тим, що він може робити, а й тим, де він працює — на вашому пристрої, у ваших руках.