Qwen3.8 Flash Next הושק ב 26 באוגוסט 2026 כמודל פתוח ורב מודלי, שנועד להציג את הארכיטקטורה המתוכננת למשפחת Qwen4. המודל כולל רשת ראשית של 125 מיליארד פרמטרים ורכיב הטמעות N gram בהיקף 51 מיליארד פרמטרים, אך מפעיל כ 6 מיליארד פרמטרים בלבד בכל טוקן.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba ו-Qwen פרסמו ב-26 באוגוסט 2026 את Qwen3.8-Flash-Next — מודל רב-מודלי בקודקלים פתוחים, שנועד להיות הצצה מעשית לארכיטקטורה שתשמש את משפחת Qwen4. דיווחים נוספים על ההשקה הופיעו ב-27 באוגוסט. 1
2
15
הנקודה החשובה: זה לא דגם הדגל הסופי של Qwen4, ואף לא הכרזה על השקת Qwen4 עצמו. מדובר בתצוגה מקדימה טכנולוגית פתוחה, שמאפשרת לחוקרים ולמפתחים לבחון את התכנון, להכין כלי הרצה ולספק משוב עוד לפני הגעת המשפחה המלאה. 2
3
15
Qwen3.8-Flash-Next מבוסס על ארכיטקטורת Mixture of Experts, או MoE — גישה שבה לא כל חלקי המודל מופעלים עבור כל טוקן. הוא כולל:
השילוב נועד לשמור על קיבולת ייצוגית גדולה, בלי לשלם בכל שלב את מלוא עלות החישוב של מודל צפוף שבו כל הפרמטרים פעילים כל הזמן.
המודל שוחרר בגרסה רגילה ובגרסת FP8 דרך Hugging Face ו-ModelScope. 3
8 חשוב גם להבחין בין השמות: Qwen3.8-Flash הוא המודל המיועד לשימושי מוצר ולשירות API, ואילו Qwen3.8-Flash-Next הוא הגרסה הפתוחה, המשמשת כתצוגה מקדימה של הארכיטקטורה.
1
2
15
למודל יש חלון הקשר טבעי של 262,144 טוקנים. ניתן להרחיב אותו עד מיליון טוקנים באמצעות YaRN — ולכן אין להתייחס למיליון טוקנים כאל מגבלת ברירת המחדל, אלא כתצורה מורחבת שיש לבחון בנפרד. 1
4
16
חלון כזה עשוי להתאים לניתוח מסמכים גדולים, מאגרי קוד, שיחות ארוכות וחומרי מחקר. עם זאת, אורך הקשר לבדו אינו מבטיח ביצועים טובים: גם שיטת ההרצה, החומרה, הקוונטיזציה ואסטרטגיית השליפה משפיעים על התוצאה בפועל.
Qwen3.8-Flash-Next משלב בין Gated DeltaNet (GDN) לבין Qwen Sparse Attention (QSA). GDN נועד לדחוס מידע מההיסטוריה, בעוד QSA משתמש במפתח קל משקל כדי לאתר ולבחור מקטעים רלוונטיים של ההקשר, במקום להפעיל קשב מלא על כל הטוקנים הקודמים. 4
המטרה היא להפחית את העלות ואת זמן העיבוד כאשר רצף הקלט מתארך. Qwen מדווחת על עד פי 7.6 במהירות של שלב ה-prefill ועד פי 4.9 במהירות הפענוח ברצפים של מיליון טוקנים. מדובר בנתונים מטעם החברה, והתוצאה תלויה בחומרה, במימוש, באורך הרצף ובתנאי הבדיקה. 4
רכיב ה-N-gram מוסיף למודל קיבולת ייצוגית, בלי לדרוש עיבוד פעיל של כל הפרמטרים בכל טוקן. לפי התיאור הטכני, ניתן להעביר את טבלת ההטמעות לזיכרון המארח ולבצע prefetching אסינכרוני, כך שהעברת הנתונים תתרחש במקביל לחישובי המודל. 4
זהו כיוון משמעותי עבור מפעילי מודלים גדולים: בהרצות אמיתיות, מיקום הזיכרון ותנועת הנתונים עשויים להיות חשובים לא פחות ממספר הפרמטרים הכולל — במיוחד בעבודה עם מסמכים ארוכים או בעיבוד אצווה בהיקף גבוה.
התצוגה המקדימה כוללת שינויים גם בתהליך האימון. Qwen מדווחת על שימוש באופטימייזר Muon, התאמות לאופן שבו הוא פועל לצד AdamW ובאופן ניהול הפרמטרים, וכן על חוק קנה מידה חדש שהותאם לארכיטקטורה. 4
לכן מדובר ביותר ממשקלות של מודל עם שכבת קשב שונה. זהו ניסוי פומבי במתכון רחב יותר לבניית מודלים שמציעים קיבולת כוללת גדולה, אך דורשים מעט יחסית חישוב פעיל.
Qwen טוענת שאימון Qwen3.8-Flash דרש בערך תשיעית מעלות האימון של Qwen3.7-Plus, תוך שיפור בביצועים במשימות תכנות ועבודה משרדית. Reuters דיווחה באופן עצמאי על טענות החברה בנוגע לירידה בעלויות ולשיפור בתחומים אלה. 1
4
הדיווחים על ההשקה מציינים את הציונים הבאים:
Alibaba מציבה את התוצאות הללו לפני DeepSeek V4 Flash בקטגוריית המודלים המשתלמים. עם זאת, מדובר בהשוואות שדווחו על ידי החברה, והחומרים הזמינים אינם מוכיחים שהן שוחזרו באופן בלתי תלוי ובתנאי הערכה זהים. 4
מחיר ה-API שפורסם עבור Qwen3.8-Flash הוא 1 יואן למיליון טוקנים נכנסים ו-3 יואן למיליון טוקנים יוצאים, ללא הבחנה בין שעות שיא לשעות שפל בחומרי ההשקה. 1
4 השוואה ישירה לשירותים אחרים תלויה בגרסת המודל, באורך ההקשר, במטמון, ברמת השירות ובכמות הפלט הנדרשת.
המשקלים הפתוחים הופכים את Qwen3.8-Flash-Next למעבדת ניסויים זמינה עוד לפני Qwen4. מפתחים יכולים להתחיל להתאים כלי inference, לבחון קוונטיזציה ושיטות serving, ולמדוד את התנהגות הארכיטקטורה על עומסי העבודה שלהם במקום להמתין למימוש הסופי של Qwen4. 2
3
15
המודל עשוי להיות רלוונטי במיוחד ליישומים כמו:
אלה שימושים הגיוניים הנגזרים מתכנון חלון הקשר ומהיקף הפרמטרים הפעילים — לא הבטחה שהמודל יהיה עדיף על כל חלופה צפופה או על מודלים המבוססים על קשב מלא. דרישות החומרה, תוכנת ההרצה, איכות הקוונטיזציה, שיטת השליפה והרכב המשימה יקבעו את העלות והביצועים בפועל.
החשיבות של Qwen3.8-Flash-Next אינה בכך שהוא כבר הוכתר כמודל הטוב ביותר בכל קטגוריה. הערך המרכזי שלו הוא בכך שהוא חושף מוקדם ובאופן שניתן לבדיקה את הכיוון הארכיטקטוני של Alibaba לקראת Qwen4.
המודל מציע לבחון האם שילוב של קשב דליל ודחוס, הטמעות עזר גדולות ומספר קטן של פרמטרים פעילים יכול להוזיל עיבוד של הקשרים ארוכים מאוד — בלי לפגוע באיכות במידה שאינה מקובלת.
מנגד, הטענות החזקות ביותר על מהירות, הישגי benchmark, עלות אימון ויתרון כלכלי מגיעות ברובן מ-Qwen או מדיווחים המבוססים על הצהרותיה. נדרשות בדיקות בלתי תלויות על חומרות שונות, בשפות שונות, באורכי הקשר המלאים, במשימות רב-מודליות ובזרימות עבודה של סוכני AI.
המסקנה הזהירה והמבוססת ביותר היא ש-Qwen3.8-Flash-Next הוא מודל MoE רב-מודלי פתוח, המשמש כתצוגה מקדימה טכנולוגית של Qwen4 וכשרטוט שניתן לבדיקה לבניית מערכות AI יעילות יותר בהקשרים ארוכים במיוחד.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next הושק ב 26 באוגוסט 2026 כמודל פתוח ורב מודלי, שנועד להציג את הארכיטקטורה המתוכננת למשפחת Qwen4.
Qwen3.8 Flash Next הושק ב 26 באוגוסט 2026 כמודל פתוח ורב מודלי, שנועד להציג את הארכיטקטורה המתוכננת למשפחת Qwen4. המודל כולל רשת ראשית של 125 מיליארד פרמטרים ורכיב הטמעות N gram בהיקף 51 מיליארד פרמטרים, אך מפעיל כ 6 מיליארד פרמטרים בלבד בכל טוקן.
הוא תומך באופן טבעי בהקשר של 262,144 טוקנים, עם אפשרות להרחבה עד מיליון טוקנים באמצעות YaRN; ביצועי המהירות והעלות שפורסמו עדיין זקוקים לאימות בלתי תלוי.