הטענה המרכזית של Moonshot היא שיכולות חזית דורשות שני מנופים: הגדלת קיבולת המודל לפני ההשקה, והקצאת יותר חישוב להסקה, לכלים ולפתרון משימות סוכני לאחר ההשקה. Kimi K3 משתמשת ב־MoE כדי להחזיק 2.8 טריליון פרמטרים בסך הכול, אך להפעיל כ־104 מיליארד בלבד בכל טוקן; במקביל, KDA, Gated MLA, AttnRes, Stable LatentMoE ו־Moon...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI מציגה את Kimi K3 כהימור על שני צירי סקיילינג: לבנות מודל גדול בהרבה לפני הפריסה, ואז לספק לו די חישוב בזמן ההפעלה כדי שיוכל להסיק, להשתמש בכלים, לגלוש, לכתוב קוד ולתקן טעויות. האתגר המרכזי הוא כלכלי: הגדלת הצפיפות והעומק של המודל אינה מספיקה אם עלות ההגשה של הקשר ארוך הופכת את היכולות הללו לבלתי מעשיות. העיצוב של K3 נועד להגדיל את הקיבולת הכוללת, ובו בזמן לרסן את החישוב והזיכרון הנדרשים לכל טוקן שנוצר. 1
Kimi K3 מתוארת כמודל מולטימודלי מקורי מסוג Mixture of Experts (MoE), עם 2.8 טריליון פרמטרים בסך הכול, כ־104 מיליארד פרמטרים פעילים לכל טוקן, וחלון הקשר של עד מיליון טוקנים. 1
17
שני המספרים הללו מודדים דברים שונים:
זהו היתרון המעשי של MoE: K3 יכולה להיות גדולה בהרבה ממודל צפוף בעל טביעת חישוב דומה לכל טוקן. ההגשה עדיין אינה זולה — 104 מיליארד פרמטרים פעילים הם היקף משמעותי — אך אין צורך לשלם בכל טוקן את עלות ההסקה של רשת צפופה בת 2.8 טריליון פרמטרים. 1
לכן הטענה של Moonshot אינה רק ש״יותר פרמטרים זה טוב יותר״. הטענה היא שחישוב מותנה יכול להפוך קיבולת מודל בהיקף חדש לשימושית במשימות ארוכות ומתמשכות.
חלון של מיליון טוקנים הוא אתגר לא רק באימון, אלא גם בזמן ההסקה: מנגנון קשב רגיל עלול לצבור עלויות זיכרון וחישוב גדלות ככל שהרצף מתארך. K3 משתמשת בארכיטקטורה היברידית המשלבת Kimi Delta Attention (KDA) עם Gated Multi-head Latent Attention (Gated MLA). לפי הדיווח, עמוד השדרה של המודל כולל 69 שכבות KDA ו־24 שכבות Gated MLA, בעיקר בתבנית של שלוש שכבות KDA לכל שכבת MLA אחת. 1
12
KDA היא רכיב הקשב הליניארי של המודל. במקום לשמור מטמון מפתחות־וערכים רגיל שהולך וגדל לאורך כל ההיסטוריה בכל שכבה כזו, היא משתמשת במצב חוזר בגודל קבוע. המטרה היא שהזיכרון ועבודת הפענוח לא יגדלו עם ההקשר הקודם באותה צורה שבה הם גדלים בקשב מלא. 1
הדוח מתאר גם חסם תחתון לקצב הדעיכה של KDA. זה אינו רק פרט של מודל: החסם מונע ערכי דעיכה זעירים במיוחד, שמקשים על חישוב נומרי יעיל, ומאפשר מימוש חסימתי המתאים להרצה על ליבות טנזור. 1
חזרה ליניארית לבדה עשויה שלא להציע את אותה יכולת שליפה סלקטיבית מכל ההקשר, כפי שמציע קשב מלא. לכן K3 שומרת שכבות Gated MLA לאורך הרשת. בתכנון ההיברידי המדווח, KDA מספקת עיבוד מתמשך וזול יחסית, ואילו MLA מספקת מדי פעם שליפה גלובלית. 1
הייחוד כאן הוא ההתייחסות להקשר ארוך כבעיית מערכות לא פחות מאשר כבעיית ארכיטקטורה. חלון הקשר גדול חשוב בעיקר אם המודל עדיין מסוגל לאתר את המידע הרלוונטי ולייצר תשובה בעלות ובקצב סבירים.
הרכיב הארכיטקטוני השני הוא Attention Residuals (AttnRes). ל־K3 יש 93 שכבות, והדוח משתמש ב־AttnRes כדי לאפשר לשכבות מאוחרות לשלוף ייצוגים דחוסים מגושי עומק מוקדמים, במקום לכפות על כל המידע לעבור אך ורק שכבה אחר שכבה. 1
מבחינה רעיונית, KDA מטפלת בזרימת המידע לאורך הרצף, ואילו AttnRes מטפלת בזרימת המידע לאורך עומק הרשת. השילוב חשוב במיוחד במודל עמוק שבו חלק ניכר מהשכבות משתמש בקשב ליניארי: החלפת קשב גלובלי יקר מועילה רק אם מידע שימושי אינו הולך לאיבוד או מתנתק בעת שהאקטיבציות עוברות ברשת. 1
שכבת ה־MoE של K3 כוללת לפי הדיווח 896 מומחים מנותבים, שמתוכם נבחרים 16 מומחים לכל טוקן. 1
6 זהו המנגנון שמאפשר את הפער בין כמות הפרמטרים הכוללת לכמות הפעילה.
גישת Stable LatentMoE מתמקדת בשמירה על ניתוב יציב ומאוזן. היא מנסחת את הקצאת המומחים ברמת האצווה כבעיית אופטימיזציה, ומוסיפה איזון מבוסס קוונטילים. הדוח גוזר אופטימום מדויק תחת ההנחות שלו; בעת פריסה, לעומת זאת, הניתוב משתמש בהטיות קבועות למומחים ובבחירת top-k רגילה, ולא פותר מחדש את בעיית האיזון עבור כל אצוות הסקה. 1
ההבחנה הזו חשובה: שיווי משקל אופטימלי נטען הוא תוצאה של נוסחת הניתוב בדוח, ולא הבטחה לכך שכל עומס עבודה אמיתי יחלק את הטוקנים באופן מושלם בין המומחים.
מודלי MoE גדולים יוצרים גם בעיית תקשורת: טוקנים שנבחרו עשויים להישלח בין התקנים כדי להגיע למומחים שהוקצו להם. כאשר מומחים מסוימים מקבלים ביקוש גבוה במיוחד, נתיב התקשורת האיטי ביותר עלול לקבוע את זמן ההשהיה.
Moonshot מציגה את MoonEP כשכבת המערכות המשלימה לתקשורת מקבילית בין מומחים. תפקידה לצמצם חוסר איזון בהחלפות all-to-all שנוצרות בגלל ניתוב דליל, ובכך לסייע להפוך את מאגר המומחים הגדול לבר־אימון ובר־הגשה. 1
זו נקודה מרכזית בטענת K3 הרחבה יותר: ארכיטקטורה, ניתוב ותקשורת אינם הסברים נפרדים לביצועים. נדרשים שלושתם כדי לתרגם קיבולת דלילה תיאורטית לתפוקה ממשית.
הציר השני בתזה של K3 הוא מה שקורה לאחר האימון המקדים. Moonshot מתארת תשתית למסלולי למידת חיזוק הכוללים משימות ארוכות, כלים, כתיבת קוד, גלישה ופתרון בעיות איטרטיבי. הדוח מתאר גם זיקוק של מורים מרובים בתחומי ידע והסקה למערכת אחת. 1
סביבת התמיכה היא מערכת ארגזי חול קלה המבוססת על מכונות וירטואליות, שנועדה ליצור, לצלם מצב ולהמשיך סביבות משימה בקנה מידה גדול. הנתונים המדווחים כוללים 51.2 מיליון מופעי sandbox, זמני snapshot של 133 אלפיות השנייה וזמני שחזור של 49 אלפיות השנייה. 1
המטרה האסטרטגית פשוטה: אם המודל אמור להשקיע יותר חישוב בזמן אמת בתכנון, בקריאות לכלים, בבדיקת עבודה או בהמשך משימה ארוכה, סביבת האימון חייבת לחשוף אותו למסלולים כאלה. היכולת לעצור, להסתעף ולשחזר סביבות בזול הופכת ליותר מעשי להפיק מסלולי אימון רבים יותר.
אין פירוש הדבר שכל תשובה של המודל מקבלת אוטומטית חישוב בלתי מוגבל. הטענה היא שמערכת K3 יכולה להמיר צעדים נוספים והקשר נוסף לשיפור בביצוע המשימה, במקום להסתמך רק על מודל מאומן גדול יותר.
Kimi K3 מדווחת על 91.2% ב־BrowseComp, אמת מידה לחיפוש מידע ארוך־טווח. גם לוח דירוג של צד שלישי מציג ל־K3 ציון 91.2%, אם כי הדירוגים ותצורות הדיווח עשויים להשתנות לאורך זמן. 18
התוצאה מתיישבת עם מטרת המוצר: מודל שנבנה סביב הקשר ארוך, אימון סוכני והסקה בזמן אמת אמור להיבחן במשימות מורכבות של חיפוש מידע. אך אין מדובר בניסוי שמבודד את תרומתו של כל רכיב בנפרד.
ציון יחיד במדד אינו יכול לומר כמה מהתוצאה נובע מ־KDA, מ־AttnRes, מניתוב המומחים, מתשתית התקשורת, מסביבות ה־RL, מהזיקוק, מהפרומפטינג או מהגדרות ההסקה. הפרשנות החזקה ביותר היא שהמערכת המדווחת מתפקדת היטב כמכלול משולב — לא שחידוש ארכיטקטוני אחד לבדו מסביר את הציון. 1
18
K3 מוצגת לעיתים כאתגר למודלים פתוחים גדולים אחרים, כולל מערכות של DeepSeek. המסקנה הנתמכת מהדוח אינה טבלת ליגה סופית של התקדמות במודלים פתוחים, אלא דגש תכנוני אחר: Moonshot מקדמת מערך שמשלב קיבולת דלילה עצומה, עיבוד יעיל של הקשר ארוך ותשתיות פוסט־אימון לסוכנים. 1
17
המאמר עצמו תומך במפרט ובבחירות התכנון של K3. הוא אינו קובע כשלעצמו שמודלים פתוחים אחרים ״נתקעו״, ואינו מבודד יתרון ארכיטקטוני מכריע מול מתחרה מסוים. אלו טענות שוק רחבות יותר, שדורשות השוואות עקביות ומשוחזרות באופן עצמאי.
קל במיוחד לפרש יתר על המידה השוואות של מחיר לטוקן או עלות למשימה. הן עשויות להשתנות לפי הפרומפט, מידת המאמץ בהסקה, אורך ההקשר, caching, שימוש בכלים, הנחות תפוקה, תאריך התמחור ומסגרת ההערכה.
השוואה שפורסמה בחומרים הזמינים מעריכה עלות למשימה שהושלמה של כ־0.94 דולר עבור K3 וכ־1.04 דולר עבור GPT-5.6 Sol. הדבר עשוי לרמוז על יתרון מתון באותה תצורה מסוימת, אך אינו מבסס טענה גורפת שלפיה K3 עולה חצי מ־Sol. 20
המסקנה השימושית והעמידה יותר היא ש־K3 היא ניסיון להפוך יכולות סוכניות עם הקשר ארוך לאמינות מבחינה כלכלית, בקנה מידה גדול בהרבה של מודל כולל. השאלה אם היא אכן משיגה יתרון כזה בפועל תלויה בהערכות שניתן לשחזר ובחישוב עלויות המתאים לכל פריסה.
הדוח הטכני של Kimi K3 מציג טיעון סקיילינג מלא. הסקיילינג שלפני הפריסה מגיע מ־MoE עם 2.8 טריליון פרמטרים וכ־104 מיליארד פרמטרים פעילים לטוקן. הסקיילינג שלאחר הפריסה מגיע מאימון והגשה של מודל היכול לנצל הקשר ארוך, כלים, שלבי הסקה ומסלולים סוכניים. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP ותשתית ארגזי החול ל־RL הם חלקים של אותה הצעה: התנהגות סוכנית ברמת חזית דורשת לא רק מודל גדול יותר, אלא תכנון שהופך יותר הקשר ויותר עבודה בזמן ההסקה לשימושיים. טענות המדדים הן עדות מעודדת לגישה המשולבת, אך נכון לקרוא אותן כתוצאות מדווחות ברמת המערכת — ולא כהוכחה סופית לתרומתו של כל רכיב. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
הטענה המרכזית של Moonshot היא שיכולות חזית דורשות שני מנופים: הגדלת קיבולת המודל לפני ההשקה, והקצאת יותר חישוב להסקה, לכלים ולפתרון משימות סוכני לאחר ההשקה.
הטענה המרכזית של Moonshot היא שיכולות חזית דורשות שני מנופים: הגדלת קיבולת המודל לפני ההשקה, והקצאת יותר חישוב להסקה, לכלים ולפתרון משימות סוכני לאחר ההשקה. Kimi K3 משתמשת ב־MoE כדי להחזיק 2.8 טריליון פרמטרים בסך הכול, אך להפעיל כ־104 מיליארד בלבד בכל טוקן; במקביל, KDA, Gated MLA, AttnRes, Stable LatentMoE ו־MoonEP נועדו להפוך הקשר ארוך וניתוב מומחים לישימים תפעולית.
השוואות עלות דורשות זהירות: פרסום אחד מעריך עלות של כ־0.94 דולר למשימה שהושלמה ב־K3, לעומת 1.04 דולר ב־GPT 5.6 Sol — פער שאינו תומך בטענה כללית שלפיה K3 עולה חצי.