كيف يولد نموذج ZAYA1‑8B‑Diffusion‑Preview من Zyphra 16 رمزًا في آن واحد ويُسرّع استدلال الذكاء الاصطناعي
نموذج ZAYA1‑8B‑Diffusion‑Preview يحول نموذج ZAYA1‑8B القائم على Mixture‑of‑Experts إلى نموذج انتشار يولد 16 رمزًا بالتوازي، مع تسريع فك الترميز المعلن بين 4.6× و7.7× حسب طريقة أخذ العينات. بدل التوليد المتسلسل رمزًا تلو الآخر، يستخدم النموذج توليد كتل من الرموز دفعة واحدة، ما يقلل اختناقات عرض نطاق الذاكرة ويستفيد ب...
نشر بواسطةتم التحرير باستخدام GPT-5.5تم إنشاء الصور باستخدام GPT Image 2
نموذج ZAYA1‑8B‑Diffusion‑Preview يحول نموذج ZAYA1‑8B القائم على Mixture‑of‑Experts إلى نموذج انتشار يولد 16 رمزًا بالتوازي، مع تسريع فك الترميز المعلن بين 4.6× و7.7× حسب طريقة أخذ العينات.
بدل التوليد المتسلسل رمزًا تلو الآخر، يستخدم النموذج توليد كتل من الرموز دفعة واحدة، ما يقلل اختناقات عرض نطاق الذاكرة ويستفيد بشكل أفضل من قدرة المعالجة المتوازية في وحدات GPU.
إذا أثبتت هذه الطريقة فعاليتها في الإنتاج، فقد تقلل تكلفة الاستدلال وتسّرع تدريب نماذج التعلم المعزز التي تعتمد على توليد أعداد ضخمة من الاستجابات التجريبية.
What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion lDiffusion-style language models can draft multiple tokens simultaneously instead of generating them sequentially.
موجّه الذكاء الاصطناعي
Create a landscape editorial hero image for this Studio Global article: What is Zyphra’s new ZAYA1-8B-Diffusion-Preview model, how does converting its autoregressive ZAYA1-8B into a Mixture-of-Experts diffusion l. Article summary: Zyphra’s ZAYA1-8B-Diffusion-Preview is an experimental diffusion-language version of its ZAYA1-8B MoE model, designed to decode blocks of text in parallel rather than strictly one token at a time. Zyphra claims it can ge. Topic tags: general, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class. Zyphra AI has released ZAYA1-8B, a small Mixture of Experts (MoE) langu" source context "Zyphra Releases ZAYA1-8B: A Reasoning MoE Trained on AMD Hardware That Punches Far Above Its Weight Class
openai.com
نهج الانتشار لتسريع فك الترميز في نماذج اللغة
أطلقت شركة Zyphra نسخة تجريبية من نموذجها اللغوي تحت اسم ZAYA1‑8B‑Diffusion‑Preview، وهو نموذج تجريبي يعتمد على أسلوب الانتشار (Diffusion) بدل الأسلوب التقليدي للتوليد التسلسلي. الفكرة الأساسية هي أن النموذج لا ينتج النص رمزًا واحدًا في كل خطوة، بل يقترح كتلًا من 16 رمزًا دفعة واحدة.
تقول Zyphra إن هذه الطريقة قد تحقق تسريعًا نظريًا في فك الترميز يصل إلى 4.6 مرات باستخدام ما تسميه “المُعيِّن الخالي من الخسارة” (lossless sampler)، وقد يصل إلى 7.7 مرات باستخدام أسلوب مزج اللوغِتات (logit‑mixing sampler)، مع تأثير محدود على جودة النتائج وفق إعدادات التشغيل.
اللافت في هذه النسخة أنها لم تُدرَّب كنموذج انتشار من البداية، بل جرى تحويل نموذج لغوي تقليدي مدرَّب مسبقًا إلى نسخة تعتمد على الانتشار، ما يشير إلى إمكانية إعادة استخدام نماذج اللغة الحالية بهذه الطريقة.
Studio Global AI
مواصلة البحث الخاص بك
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
ما هي الإجابة المختصرة على "كيف يولد نموذج ZAYA1‑8B‑Diffusion‑Preview من Zyphra 16 رمزًا في آن واحد ويُسرّع استدلال الذكاء الاصطناعي"؟
نموذج ZAYA1‑8B‑Diffusion‑Preview يحول نموذج ZAYA1‑8B القائم على Mixture‑of‑Experts إلى نموذج انتشار يولد 16 رمزًا بالتوازي، مع تسريع فك الترميز المعلن بين 4.6× و7.7× حسب طريقة أخذ العينات.
ما هي النقاط الأساسية التي يجب التحقق منها أولاً؟
نموذج ZAYA1‑8B‑Diffusion‑Preview يحول نموذج ZAYA1‑8B القائم على Mixture‑of‑Experts إلى نموذج انتشار يولد 16 رمزًا بالتوازي، مع تسريع فك الترميز المعلن بين 4.6× و7.7× حسب طريقة أخذ العينات. بدل التوليد المتسلسل رمزًا تلو الآخر، يستخدم النموذج توليد كتل من الرموز دفعة واحدة، ما يقلل اختناقات عرض نطاق الذاكرة ويستفيد بشكل أفضل من قدرة المعالجة المتوازية في وحدات GPU.
ماذا يجب أن أفعل بعد ذلك في الممارسة العملية؟
إذا أثبتت هذه الطريقة فعاليتها في الإنتاج، فقد تقلل تكلفة الاستدلال وتسّرع تدريب نماذج التعلم المعزز التي تعتمد على توليد أعداد ضخمة من الاستجابات التجريبية.
تعتمد النسخة التجريبية على النموذج الأساسي ZAYA1‑8B، وهو نموذج تفكير يعتمد على بنية Mixture‑of‑Experts (MoE).
يضم النموذج أكثر قليلًا من 8 مليارات معلمة إجمالًا، لكن أثناء الاستدلال يتم تفعيل حوالي 760 مليون معلمة فقط. هذا التصميم يسمح بالحفاظ على أداء قوي مع تقليل تكلفة الحوسبة مقارنة بالنماذج الكثيفة التقليدية.
في نماذج MoE يتم توجيه كل رمز إلى مجموعة صغيرة من "الخبراء" داخل الشبكة العصبية بدل استخدام النموذج كاملًا في كل خطوة، وهو ما يقلل استهلاك الموارد الحسابية.
لماذا التوليد التسلسلي بطيء؟
معظم نماذج اللغة الكبيرة اليوم تعتمد على التوليد التلقائي التسلسلي (Autoregressive Generation). في هذا الأسلوب يعتمد كل رمز جديد على جميع الرموز السابقة.
ببساطة، تتم العملية كالتالي:
يولد النموذج الرمز التالي
يتم تحديث ذاكرة KV cache الخاصة بالتسلسل
تتكرر العملية للرمز التالي
هذه الآلية تجعل التوليد متسلسلًا بالكامل، أي لا يمكن تنفيذ الخطوات بالتوازي بسهولة. وغالبًا ما يؤدي ذلك إلى اختناقات في عرض نطاق الذاكرة عند الوصول المتكرر إلى KV cache أثناء التوليد.
كيف يولد نموذج الانتشار 16 رمزًا في خطوة واحدة
في نموذج Zyphra الجديد يتغير مسار فك الترميز جذريًا.
بدل توقع رمز واحد فقط، يقوم النموذج باقتراح مجموعة من الرموز المرشحة دفعة واحدة. وفي الإصدار التجريبي تبلغ الكتلة 16 رمزًا في كل خطوة انتشار.
تتم العملية تقريبًا كالتالي:
يولد النموذج عدة مسودات مرشحة لكتلة من الرموز.
يقوم المُعيِّن (sampler) بتقييم الرموز المقبولة.
تُضاف الرموز المقبولة إلى النص النهائي ثم تبدأ خطوة انتشار جديدة.
لأن جميع الرموز المرشحة تشترك في نفس المقدمة النصية وحالة KV cache، يستطيع النموذج تنفيذ حسابات متوازية لعدة رموز في تمريرة واحدة عبر الشبكة العصبية.
بهذا يتحول عبء المعالجة من كونه محدودًا بسرعة الذاكرة إلى حسابات متوازية كثيفة، وهو النوع من العمليات التي تتفوق فيها وحدات معالجة الرسوميات GPU.
طريقتان لأخذ العينات وسرعات مختلفة
التحسن في السرعة يعتمد على طريقة أخذ العينات المستخدمة أثناء التوليد.
المُعيِّن الخالي من الخسارة (Lossless Sampler)
يعتمد قواعد قبول تشبه أسلوب speculative decoding
تحقق Zyphra به تسريعًا يقارب 4.6 مرات مقارنة بالتوليد التقليدي
صُمم لتجنب انخفاض منهجي في نتائج التقييم
مُعيِّن مزج اللوغِتات (Logit‑Mixing Sampler)
يمزج توزيعات الاحتمالات من نموذج الانتشار والنموذج التلقائي
يرفع معدل قبول الرموز المقترحة
يمكن أن يصل التسريع إلى 7.7 مرات، مع احتمال انخفاض طفيف في الجودة
هذه النتائج مستندة أساسًا إلى تقارير Zyphra نفسها، لذلك ستبقى الاختبارات المستقلة مهمة لمعرفة الأداء الفعلي في الاستخدامات العملية.
لماذا يُعد التدريب على عتاد AMD أمرًا لافتًا
جانب آخر غير معتاد في المشروع هو بيئة التدريب. تشير Zyphra إلى أن النموذج هو أول نموذج لغة بالانتشار يتم تدريبه على وحدات GPU من AMD بدل البنية التحتية القائمة غالبًا على Nvidia.
إذا أثبتت التجارب إمكانية تكرار هذه النتائج، فقد يشير ذلك إلى أن تدريب وتشغيل نماذج اللغة الكبيرة لا يقتصر بالضرورة على منظومة واحدة من العتاد، ما قد يوسع المنافسة في سوق البنية التحتية للذكاء الاصطناعي.
آلية Compressed Convolutional Attention
يتضمن نموذج ZAYA1‑8B أيضًا آلية تسمى Compressed Convolutional Attention (CCA). الهدف منها تقليل التكلفة الحسابية لعمليات الانتباه أثناء العمليات المتوازية الكبيرة.
هذا مهم خصوصًا لأن فك الترميز بالانتشار يشبه إلى حد ما مرحلة prefill الكبيرة في الاستدلال، حيث تتم معالجة عدد كبير من الرموز في وقت واحد. تقليل تكلفة الانتباه يجعل توليد عدة رموز بالتوازي أكثر كفاءة.
ماذا يعني ذلك لتكلفة الاستدلال
إذا تحققت مكاسب السرعة المعلنة في أنظمة الإنتاج، فقد يؤدي ذلك إلى تأثيرات واضحة على اقتصاديات تشغيل النماذج:
زيادة عدد الرموز المنتجة في الثانية لكل GPU
انخفاض تكلفة الرمز الواحد
تقليل زمن الاستجابة للردود الطويلة
مع ذلك تشير Zyphra إلى أن أنظمة الاستدلال لنماذج الانتشار ما تزال أقل نضجًا من الأنظمة التقليدية، لذلك قد تختلف النتائج الواقعية عن الأرقام النظرية.
التأثير المحتمل على تدريب التعلم المعزز
تعتمد نماذج التفكير الحديثة غالبًا على التعلم المعزز باستخدام عمليات توليد كثيرة أثناء التدريب (rollouts). سرعة التوليد تحدد مباشرة عدد الاستجابات التي يمكن تجربتها.
لذلك فإن فك الترميز الأسرع قد يؤدي إلى:
تقليل تكلفة تدريب نماذج RL
تمكين تجارب أوسع في حسابات وقت الاختبار
توليد عدد أكبر من مسارات التفكير لكل سؤال
في العديد من خطوط تدريب النماذج المتقدمة، يعد توليد النصوص أحد أكبر مصادر التكلفة الحسابية.
اتجاه جديد نحو “ذكاء أعلى لكل دولار”
يمثل ZAYA1‑8B‑Diffusion‑Preview مثالًا على توجه متزايد في صناعة الذكاء الاصطناعي: التركيز ليس فقط على زيادة حجم النماذج، بل على تحسين الكفاءة الاقتصادية للحوسبة.
يجمع هذا المشروع عدة استراتيجيات للكفاءة:
بنية Mixture‑of‑Experts
فك الترميز بأسلوب الانتشار
آليات انتباه أكثر كفاءة
استخدام بنية تدريب بديلة عن Nvidia
إذا أثبتت هذه الأفكار نجاحها على نطاق واسع، فقد تعيد تشكيل طريقة تحسين نماذج اللغة مستقبلًا، ليس فقط من حيث القدرة، بل أيضًا من حيث السرعة والتكلفة وكفاءة العتاد. في الوقت الحالي يمثل النموذج عرضًا مبكرًا لفكرة أن تحويل النماذج التلقائية التقليدية إلى نماذج انتشار قد يكون طريقًا واعدًا لتسريع توليد النصوص.