הטענה המרכזית של Kimi K3 היא שיש להרחיב שני משאבים משלימים: קיבולת מודל באימון, וחישוב בזמן ההסקה עבור חשיבה, כלים וסוכנים. למודל 2.78 טריליון פרמטרים בסך הכול, אך 104.2 מיליארד בלבד מופעלים לכל טוקן — יתרון כלכלי אפשרי של ארכיטקטורת MoE.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
המסר האסטרטגי של Moonshot AI בדוח Kimi K3 אינו רק „המודל שלנו גדול יותר”. הטענה היא שהתקדמות בחזית ה-AI תלויה בהגדלה של שני סוגי משאבים במקביל:
לפי הדוח, K3 מנסה להפוך את שני הכיוונים לכלכליים יותר: להחזיק מודל ענק, בלי לשלם בכל טוקן את עלות ההסקה של מודל צפוף בגודל זהה; ובמקביל לבנות מערכות שמאפשרות למצות את היכולת הזו במשימות ארוכות ורב־שלביות. 1
K3 מתואר כמודל מולטימודאלי טבעי מסוג Mixture-of-Experts (MoE), עם 2.78 טריליון פרמטרים בסך הכול ו-104.2 מיליארד פרמטרים פעילים לכל טוקן, לצד חלון הקשר של עד מיליון טוקנים. 1
ההבחנה הזו היא לב הטיעון. במודל MoE, מנגנון ניתוב בוחר לכל טוקן רק חלק מהמומחים הרלוונטיים במקום להפעיל את כל משקלי המודל. לכן, לפי Moonshot, אפשר להגדיל מאוד את הקיבולת הכוללת — כלומר את כמות היכולות שהמודל יכול לאחסן — בלי לשלם את מחיר ההסקה של מודל צפוף בן 2.78 טריליון פרמטרים על כל טוקן.
זה אינו אומר שההסקה זולה במונחים מוחלטים: 104.2 מיליארד פרמטרים פעילים הם עדיין היקף גדול מאוד. אבל זהו ניסיון לשבור את הקישור הישיר בין גודל הקיבולת הכולל לבין העלות לכל טוקן.
תיקון חשוב לטענות שהתפרסמו סביב המודל: הדוח מייחס ל-K3 אקסטרפולציה טבעית עד מיליון טוקנים, לא 100 אלף. האימון מתחיל באורך רצף של 8,000 טוקנים ובהמשך עולה ל-64,000 טוקנים. לפי הדוח, המודל אינו משתמש בהטמעות מיקום מפורשות; במקום זאת, השערים והדעיכה החוזרים של KDA אמורים לקודד די מידע מיקומי כדי לאפשר את ההתרחבות, ללא התאמת RoPE. 1
אחת הבעיות המרכזיות בסוכני AI היא שהקשר ארוך עלול להיות יקר: מנגנוני קשב גלובליים רגילים נדרשים להתמודד עם כמות גדולה והולכת של מידע קודם. Kimi Delta Attention, או KDA, מחליף חלק גדול מהקשב הריבועי במצב חוזר בגודל קבוע. לפי הטענה, עלות הפענוח והמצב לכל טוקן אינם גדלים עם ההקשר הקודם באותו אופן שבו גדל מטמון KV של קשב מלא. 1
Moonshot אינה מוותרת לחלוטין על שליפה גלובלית. היא משלבת בכל בלוק שלוש שכבות KDA ולאחריהן שכבת Gated MLA, ביחס של 3:1. KDA אמור לספק עיבוד רציף וזול יותר של רצפים, ואילו MLA מחזיר יכולת של שליפה גלובלית סלקטיבית. 1
הגבול התחתון המדווח לקצב הדעיכה ב-KDA אינו מוצג רק כהחלטת מודל: הוא גם אמצעי יישומי למניעת דעיכות זעירות שעלולות ליצור בעיות נומריות, ולאפשר חישוב מקוטע שמתאים יותר לחומרת Tensor Cores. 1
K3 כולל 93 שכבות, וחלק ניכר מהן מבוסס על קשב ליניארי. במבנה כזה קיים סיכון שמידע שימושי יהפוך למבודד לאורך עומק הרשת, אם כל שכבה חייבת לקבל אותו אך ורק דרך השכבה שלפניה.
לשם כך הדוח מציג Attention Residuals (AttnRes): מסלול שמאפשר לשכבות מאוחרות לשלוף ייצוגים דחוסים מבלוקים מוקדמים יותר בעומק הרשת. במילים פשוטות, לא כל פרט חשוב חייב לשרוד מעבר רציף דרך עשרות שכבות. הטענה היא שהמנגנון מסייע לשמר איכות, תוך החלפה של חלק גדול מהקשב הגלובלי היקר ב-KDA. 1
בציר ה„רוחב”, K3 משתמש ב-Stable LatentMoE: יש בו 896 מומחים, והניתוב בוחר 16 מהם לכל טוקן. 1
שפע מומחים מותנה פותח קיבולת גדולה, אך יוצר בעיית איזון: אם יותר מדי טוקנים נשלחים לאותם מומחים, נוצרים צווארי בקבוק. שיטת איזון הקוונטילים של Moonshot מתארת את הניתוב כבעיית הקצאה מאוזנת וגוזרת אופטימום מדויק תחת הנחות ברמת האצווה. בהפעלה עצמה, לעומת זאת, הנתב משתמש בהטיות קבועות למומחים ובבחירת top-k רגילה — הוא אינו מריץ את פותר האיזון בכל בקשה. 1
זו נקודה חשובה לקריאה זהירה: „שיווי משקל מושלם” הוא תוצאה עבור בעיית האופטימיזציה וההנחות שהוגדרו, ולא הבטחה שכל אצווה אמיתית בפריסה תהיה מאוזנת באופן מושלם.
גם התקשורת בין מאיצים חיונית. במודל MoE גדול, טוקנים צריכים להגיע למומחים שנבחרו עבורם, לעיתים על פני מכונות או מאיצים שונים. MoonEP נועד לאזן את תקשורת ה-all-to-all שנוצרת מביקוש לא אחיד למומחים, כדי שהשהיות של חלקי הרשת לא יבטלו את יתרון ה-MoE. 1
לכן, הארכיטקטורה ותשתית המערכות אינן שני הסברים נפרדים להישגים: הן תלויות זו בזו. מודל עם מאות מומחים אינו משתלם אם אי אפשר לנתב אליו טוקנים במהירות וביציבות.
החידוש שמודגש בדוח אינו מסתכם בגודל המודל. Moonshot טוענת שביצועי AI מתקדמים דורשים גם יותר חישוב בזמן ההסקה: תכנון, גלישה, שימוש בכלים, הפעלת קוד, הסתעפות בין מסלולי פתרון ותיקון עצמי.
לשם כך מתואר צי של סביבות ארגז חול המבוססות על מכונות וירטואליות קלות. הרעיון הוא לייצר מסלולי חיזוק (RL) ארוכים וניתנים לאימות, ולאפשר הסתעפות או חידוש של מסלולים באמצעות תמונות מצב (snapshots) בעלות נמוכה יותר. כך ניתן לאמן מודל לנצל יותר צעדים בזמן מבחן, במקום להסתמך רק על מודל קדם־מאומן גדול אך קפוא. 1
הדוח מתאר גם זיקוק של מורי חשיבה ותחום מרובים למערכת אחת. המטרה היא להעביר התנהגויות מתמחות, בלי להפעיל תשעה מודלים נפרדים בעת השירות. 1
בלוח תוצאות חיצוני של BrowseComp, נכון ל-2 בספטמבר 2026, Kimi K3 מדורג עם 91.2%. BrowseComp נועד למדוד יכולת מחקר וגלישה באינטרנט במשימות מורכבות, ולא רק ידע פנימי שנלמד באימון. 4
אם התוצאה תשוחזר באופן עקבי, היא תחזק את הטענה ש-K3 חזק במיוחד במשימות חיפוש מידע ארוכות־אופק וסוכנים. אך היא אינה מבודדת את הסיבה להצלחה: אי אפשר להסיק מציון אחד כמה תרמו כל אחד מ-KDA, AttnRes, ניתוב ה-MoE, סביבת ה-RL, הזיקוק או תוספת החישוב בזמן ההסקה. זו תוצאת מערכת מקצה לקצה.
לא נמצא בדוח הטכני, או במקור עצמאי בעל סמכות גבוהה, אימות לטענות מדויקות שלפיהן K3 עולה „חצי מ-GPT-5.6 Sol”, או שהוא מפגר בדיוק בארבע נקודות אחרי „Claude Fable 5” ב-Kimi Code Bench בעלות של 38% בלבד.
השוואה אחת מציגה עלות מוערכת של כ-0.94 דולר למשימה שהושלמה עבור K3, מול כ-1.04 דולר עבור GPT-5.6 Sol — פער שאינו קרוב ל-50%. 8 עלויות כאלה תלויות בהגדרות ההרצה, באורך הפרומפטים, בשימוש בכלים, ברמת המאמץ ובתאריך המחירון; בלי harness מפורסם וחשבונאות עלויות מלאה, אין לייחס להן משמעות אוניברסלית.
Kimi K3 מציע טיעון ארכיטקטוני רחב יותר מתחרות מחיר: כדי לעבור את מחסום הטריליון ולתרגם חלון הקשר ארוך להתנהגות סוכנית שימושית, מודלים פתוחים זקוקים לשילוב של קיבולת מותנית, קשב חסכוני, ניתוב ותקשורת יעילים, ותשתית אימון והסקה למשימות ארוכות.
זהו טיעון סביר, אך עדיין יש להפריד בין חזון המערכת לבין הוכחה סיבתית מלאה. הדוח מציג את המרכיבים ואת התוצאות הכוללות; הוא אינו מוכיח לבדו את תרומתו המדויקת של כל רכיב, ואינו מבסס את הטענה שמודלים פתוחים אחרים „נתקעו” סביב טריליון פרמטרים.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
הטענה המרכזית של Kimi K3 היא שיש להרחיב שני משאבים משלימים: קיבולת מודל באימון, וחישוב בזמן ההסקה עבור חשיבה, כלים וסוכנים.
הטענה המרכזית של Kimi K3 היא שיש להרחיב שני משאבים משלימים: קיבולת מודל באימון, וחישוב בזמן ההסקה עבור חשיבה, כלים וסוכנים. למודל 2.78 טריליון פרמטרים בסך הכול, אך 104.2 מיליארד בלבד מופעלים לכל טוקן — יתרון כלכלי אפשרי של ארכיטקטורת MoE.
חלון ההקשר המדווח הוא עד מיליון טוקנים, והארכיטקטורה משלבת KDA, Gated MLA, Attention Residuals וניתוב מומחים.