أصدرت تيثير أداة 'توربو كوانت' مفتوحة المصدر، والتي تضغط الذاكرة العاملة لنماذج اللغة الكبيرة (ذاكرة KV) بما يصل إلى 5 أضعاف، مما يجعل تشغيل جلسات ذكاء اصطناعي طويلة ومعقدة على الأجهزة اليومية أمراً ممكناً دون فقدان ا... هذه التقنية، المبنية على خوارزمية من أبحاث جوجل، أصبحت الآن جزءاً أساسياً من الإصدار 0.12.0 من م...

Create a landscape editorial hero image for this Studio Global article: What is Tether's open-source TurboQuant implementation, what problem does it solve for large language model inference, how does it achieve u. Article summary: Now I have comprehensive information. Let me compile the answer.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open Source Breakthrough In LLM Efficiency - Open Source For You" Reference image 2: visual subject "The method compresses large language model (LLM) KV-cache to 3.5 bits per channel, delivering nearly 6× memory reduction, faster inference" source context "Google TurboQuant Signals Open
في الأول من يونيو 2026، أطلق فريق أبحاث الذكاء الاصطناعي في شركة تيثير (Tether) أداة مفتوحة المصدر تعد بتحرير الذكاء الاصطناعي المتقدم من أغلال مراكز البيانات الضخمة. الأداة، التي تحمل اسم توربو كوانت (TurboQuant)، هي تطبيق جاهز للإنتاج لخوارزمية طورتها أبحاث جوجل، وهي مصممة لسحق أكبر عنق زجاجة في الذاكرة يواجه نماذج اللغة الكبيرة (LLMs). من خلال خفض الذاكرة المطلوبة لسياق العمل في الذكاء الاصطناعي بما يصل إلى 5 أضعاف، تتيح توربو كوانت للمطورين تشغيل جلسات ذكاء اصطناعي مترامية الأطراف وذات سياقات طويلة على نفس الأجهزة التي يحملونها معهم يومياً — حواسيب محمولة، هواتف، وأجهزة طرفية — دون التضحية بجودة المخرجات .
هذا الإصدار ليس مجرد فضول تقني. إنه جزء أساسي من توجه تيثير الأوسع نحو الحوسبة اللامركزية، وقد صدر كميزة رئيسية في الإصدار 0.12.0 من منصة QVAC SDK، منصة الشركة لبناء ذكاء اصطناعي يعيش بالكامل خارج السحابة .
لفهم أهمية هذا الإنجاز، يجب النظر في كيفية "تذكر" نماذج اللغة الكبيرة. عندما تجري محادثة مع نموذج ذكاء اصطناعي أو تطلب منه تحليل مستند طويل، فإن النموذج لا يكتفي بالرجوع إلى بيانات تدريبه الأصلية. إنه يبني ذاكرة ديناميكية فورية تُعرف باسم ذاكرة التخزين المؤقتة للمفتاح والقيمة (KV Cache)، والتي تخزن سياق كل كلمة وتفاعل تمت معالجته خلال تلك الجلسة .
المشكلة أن ذاكرة KV هذه شرهة للذاكرة بشكل هائل. إنها تتضخم مع كل رمز (Token) جديد، وتستهلك بصمت غيغابايتات من ذاكرة الوصول العشوائي (RAM) أو ذاكرة بطاقة الرسوميات (VRAM). وفقاً لتيثير، بالنسبة لنموذج بـ 4 مليارات معامل (Parameter) يعمل مع حوالي 262,000 رمز — وهو ما قد يمثل ساعات من المحادثة أو قاعدة بيانات برمجية كاملة — فإن ذاكرة KV وحدها تلتهم حوالي 8 غيغابايت من الذاكرة. قم بتشغيل أربع جلسات من هذا القبيل في وقت واحد، وستواجه استهلاكاً يزيد عن 32 غيغابايت، قبل أن تقوم حتى بتحميل النموذج نفسه .
هذا النمو المتفجر للذاكرة هو السبب الرئيسي وراء بقاء مهام الذكاء الاصطناعي ذات السياق الطويل — مثل تحليل مستند قانوني، أو تلخيص بودكاست، أو البرمجة بمساعدة مساعد يفهم السياق حقاً — حبيسة البنية التحتية السحابية المركزية بما فيها من صفوف من وحدات معالجة الرسوميات عالية الذاكرة .
تعالج توربو كوانت هذه المشكلة مباشرة باستخدام تقنية تُعرف باسم التكميم العدواني لذاكرة KV المؤقتة (Aggressive KV Cache Quantization). الفكرة مشابهة لضغط صورة: تقايض جزءاً صغيراً جداً من الدقة العددية النظرية بمكاسب هائلة في كفاءة الذاكرة .
إليك آلية العمل:
إن إصدار تيثير المفتوح المصدر ليس مجرد ورقة بحثية نظرية، بل هو حزمة عملية تتضمن مسار تكميم كامل، ومحولات لأطر عمل الاستدلال الشائعة، وملفات تعريف نشر مضبوطة لمختلف أحمال العمل، مما يجعله جاهزاً للمطورين لتوصيله بمشاريعهم .
تتضح الأهمية الحقيقية لتوربو كوانت عندما تنظر إلى موطنها: داخل QVAC Fabric، محرك تشغيل نماذج اللغة الكبيرة الأساسي في منصة QVAC SDK من تيثير . ترمز QVAC إلى مبادرة "العقل السيد (Sovereign Mind)"، وهي منصة تطوير برمجيات مفتوحة المصدر ومتعددة الأنظمة من تيثير لبناء ذكاء اصطناعي محلي أولاً ولامركزي
. تجمع المنصة قدرات مثل إكمال النصوص، التعرف على الكلام، الترجمة، التعرف البصري على الأحرف (OCR)، توليد الصور، والضبط الدقيق على الجهاز خلف واجهة برمجة تطبيقات (API) موحدة يُقصد بها أن تعمل بشكل متماثل على أي جهاز أو نظام تشغيل
.
بإزالة جدار ذاكرة KV المؤقتة، فإن توربو كوانت هي أكثر من مجرد تحسين في الأداء. إنها عامل تمكين استراتيجي لرؤية تيثير للذكاء الاصطناعي الذي يعمل على الأجهزة الشخصية والشبكات المحلية والبنية التحتية للنظير (P2P)، مما يقلل من اعتماد العالم على عدد قليل من السحابات العملاقة المركزية .
السياسة هنا واضحة وصريحة. لقد صاغ الرئيس التنفيذي لشركة تيثير، باولو أردوينو، هذا الإصدار بعبارات قاطعة: "إذا كان الذكاء الاصطناعي طويل السياق يعمل فقط داخل أكبر مراكز البيانات، فإن الذكاء الاصطناعي سيتشكل بيد من يمتلك أكبر قدر من العتاد" . صُممت توربو كوانت لتكون إجابة عملية على هذا التركيز للسلطة.
كانت توربو كوانت نجمة الإصدار 0.12.0، لكنها لم تأتِ بمفردها. لقد وسّع هذا التحديث أيضاً قدرات المنصة متعددة الوسائط (Multimodal) بطرق كبيرة، وفقاً للإصدار الرسمي والتغطية الداعمة له :
@qvac/sdk بإصدار توربو كوانت كبرنامج مفتوح المصدر ودمجها مباشرة في QVAC SDK، تراهن تيثير على أن مستقبل الذكاء الاصطناعي سيتحدد بمكان تشغيله — على جهازك، بين يديك — بقدر ما يتحدد بما يمكنه فعله.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
أصدرت تيثير أداة 'توربو كوانت' مفتوحة المصدر، والتي تضغط الذاكرة العاملة لنماذج اللغة الكبيرة (ذاكرة KV) بما يصل إلى 5 أضعاف، مما يجعل تشغيل جلسات ذكاء اصطناعي طويلة ومعقدة على الأجهزة اليومية أمراً ممكناً دون فقدان ا...
أصدرت تيثير أداة 'توربو كوانت' مفتوحة المصدر، والتي تضغط الذاكرة العاملة لنماذج اللغة الكبيرة (ذاكرة KV) بما يصل إلى 5 أضعاف، مما يجعل تشغيل جلسات ذكاء اصطناعي طويلة ومعقدة على الأجهزة اليومية أمراً ممكناً دون فقدان ا... هذه التقنية، المبنية على خوارزمية من أبحاث جوجل، أصبحت الآن جزءاً أساسياً من الإصدار 0.12.0 من منصة QVAC SDK، إطار عمل تيثير للذكاء الاصطناعي المحلي واللامركزي، والذي أضاف أيضاً قدرات توليد الفيديو من النص والتحكم بال...
يرى المدير التنفيذي باولو أردوينو أن هذا التحول استراتيجي، بحجة أنه إذا كان الذكاء الاصطناعي المتقدم حكراً على مراكز البيانات العملاقة، فإن 'الذكاء الاصطناعي سيتشكل بيد من يمتلك أكبر قدر من العتاد' [7].