זהו סיפורה של אותה השקה — מה המודל יכול לעשות בפועל, כמה הוא עולה, ומדוע הוא מהווה רגע משמעותי בתחרות הבינה המלאכותית בין ארה"ב לסין.
Kimi K3 קיבל ציון 57.1 במדד העצמאי Artificial Analysis Intelligence Index v4.1, מה שממקם אותו במקום השלישי בעולם אחרי Claude Fable 5 (60) ו-GPT-5.6 Sol (59) . הפער הוא כשלוש נקודות — צמוד יחסית בסטנדרטים היסטוריים — אך ברור: מבחן האינטליגנטי הרחב ביותר עדיין מעדיף את הדגמים המובילים מארה"ב
. Moonshot עצמה הודתה זאת בפומבי, כשאמרה ש-K3 "עדיין מפגר אחרי המודלים הקנייניים החזקים ביותר" של אנתרופיק ו-OpenAI בביצועים מצטברים כלליים
.
היכן ש-K3 מוביל הוא במבחנים סוכניים (Agentic Benchmarks) ספציפיים בעולם האמיתי:
| מבחן | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
בחמישה מבחנים סוכניים אלה, בתוספת Program Bench (77.8), K3 ניצח ב-5 מתוך 6, תוך שהוא גובר גם על Fable 5 וגם על GPT-5.6 Sol במבחנים הספציפיים הללו . הוא גם עלה באופן משמעותי על ביצועי Claude Opus 4.8 בכל מבחן שפורסם — תוצאה משמעותית כי Opus 4.8 מתומחר ב-5 דולר לקלט ו-25 דולר למוצא למיליון טוקנים, מה שהופך אותו למתחרה ישיר מבחינת עלות
.
ב-Arena, פלטפורמת ההעדפה האנושית העיוורת של אוניברסיטת ברקלי, K3 הגיע לראש טבלת מובילי הקידוד זמן קצר לאחר ההשקה . הערכות ההשוואה ההמונית של Arena הראו ש-K3 תופס את המקום הראשון בפיתוח אתרים בצד הלקוח (front-end) עם ציון 1,679, לפני Fable 5 (1,631) ו-GPT-5.6 Sol (1,618)
.
ב-אופטימיזציית ליבת GPU — הטכניקות המשפרות את האינטראקציה של מודלי AI עם החומרה — Moonshot דיווחה ש-K3 "עלה משמעותית" על Opus 4.8, GPT-5.6 Sol, ו-GPT-5.5 . זה משמעותי מבחינה מסחרית, כי אופטימיזציית ליבה טובה יותר פירושה זמן השהייה (latency) נמוך יותר ותפוקה (throughput) גבוהה יותר על אותה חומרה.
המודל משתמש בארכיטקטורת MoE (Mixture of Experts) דלילה (sparse) עם 896 מומחים, שרק 16 מהם מופעלים לכל טוקן, מה שהופך אותו לכמעט שווה בעלות ההסקה (inference) ל-GPT-5.6 Sol, למרות היותו בעל 2.8 טריליון פרמטרים בסך הכל . הוא מציג גם את Kimi Delta Attention (KDA) ו-Attention Residuals (AttnRes) — רכיבים ארכיטקטוניים חדשניים שנועדו לשפר חשיבה על הקשרים ארוכים
.
אחד ההיבטים המשבשים ביותר של Kimi K3 מבחינה שיווקית הוא תמחור ה-API שלו, הנמוך משמעותית ממודלי הדגל האמריקאיים:
| מודל | קלט (למיליון טוקנים) | מוצא (למיליון טוקנים) |
|---|---|---|
| Kimi K3 | 3.00$ | 15.00$ |
| GPT-5.6 Sol | 5.00$ | 30.00$ |
| Claude Fable 5 | 10.00$ | 50.00$ |
| Claude Opus 4.8 | 5.00$ | 25.00$ |
Kimi K3 עולה כ-40% פחות מ-GPT-5.6 Sol וכ-70% פחות מ-Claude Fable 5 במחירון . שלושת המודלים יושבים על סולם של 3.3×: Fable 5 עולה פי 3.3 מ-Kimi K3 גם בקלט וגם במוצא, עם GPT-5.6 Sol בדיוק באמצע
.
בנוסף, ל-K3 יש תעריף קלט במטמון (cache-hit) של 0.30 דולר למיליון טוקנים — זול פי 10 מהתעריף הרגיל (cache-miss) — עבור שאילתות הקשר שכבר נענו בעבר . על בסיס כל משימה, ההערכה היא ש-K3 עולה 50-65% פחות מהדגלים האמריקאיים
.
התמחור של Moonshot עבור K3 מסמן שינוי ניכר: המודל מתומחר כעת כמו מודל גבולי (frontier model) ולא כמו אופציה תקציבית . דגמי Kimi קודמים כמו K2.5 ו-K2.6 תומחרו ב-0.60 דולר קלט ו-2.50-4.00 דולר מוצא, מה שהופך את K3 ליקר בערך פי 3-4 מהקודמים שלו
. עם זאת, הוא נשאר זול יותר מהמודלים הבכירים בארה"ב תוך שהוא מספק ביצועים דומים או טובים יותר במשימות סוכניות ספציפיות.
ב-19 ביולי 2026 — כ-48 שעות לאחר ההשקה — הודיעה Moonshot AI כי היא עוצרת זמנית הרשמות חדשות ל-Kimi K3. החברה פרסמה ב-X: "Kimi K3 קיבל הרבה יותר אהבה ממה שציפינו, וה-GPUs שלנו מרגישים את זה. במהלך 48 השעות האחרונות, הביקוש התקרב לגבולות הקיבולת הנוכחית שלנו" .
החברה אמרה שהיא תיתן עדיפות לכוח עיבוד למשתמשים קיימים ותוסיף קיבולת במהירות האפשרית, ותכנן לפתוח מחדש מקומות הרשמה בקבוצות . למשתמשים קיימים נשארה גישה מלאה, ושירותי API וארגוניים המשיכו לפעול
.
כלי תקשורת רבים ציינו כי האירוע מדגיש את אילוצי כוח העיבוד המתמשכים של סין, הנובעים מהגבלות ייצוא השבבים האמריקאיות . ה-South China Morning Post כתב שהמצב "מדגיש את האתגרים העומדים בפני מעבדות AI סיניות בשירות מוצריהן למשתמשים גלובליים"
. משקלי המודל המלאים (full weights), שיאפשרו לצדדים שלישיים להריץ אותו על החומרה שלהם, לא היו צפויים להגיע עד 27 ביולי — מה שהותיר את Moonshot כספקית כוח ההסקה היחידה במהלך חלון ההשקה
.
Moonshot ניצלה את ההשהיה כדי לפצל את תוכניות המנוי שלה לשתיים: Kimi Membership (עבור אתר, אפליקציה ו-Work) ו-Kimi Code Membership (עבור זרימות עבודה בקידוד), מבנה מחדש שנועד להקצות טוב יותר משאבי עיבוד .
להשקת Kimi K3 היו השפעות מרחיקות לכת מעבר למבחני AI. ה-Straits Times דיווח ישירות ש-K3 "הזין נפילת טכנולוגיה", וכלי תקשורת רבים קישרו את ההשקה למימוש רווחים במניות המוליכים למחצה וה-AI האמריקאיות . למרות שלא ניתן היה לאשר באופן עצמאי נתונים ספציפיים לגבי מגמת מדד פילדלפיה למוליכים למחצה או מניית Nvidia מתוך מערך המקורות הזמין, ההקשר השוקי הרחב של המימוש מתועד היטב.
בצד הארגוני, רויטרס דיווחה ב-20 ביולי 2026 כי עצירת ההרשמות "בא בזמן שהחברה מחפשת גיוס הון נוסף, כשמקורות אומרים שהיא צועדת לקראת הנפקה ראשונית בבורסת הונג קונג" . עם זאת, שום מקור במערך הראיות הזמין לא אישר החלטת בעלי מניות ספציפית בדבר יעד שווי של 30 מיליארד דולר. דיווח רויטרס מזכיר דחיפה להנפקה ללא ציון יעד שווי
.
משקלי המודל המלאים של Kimi K3 מתוכננים לפרסום פומבי ב-27 ביולי 2026 . זהו פרט קריטי, שכן פירושו שמפתחים וארגונים יוכלו בסופו של דבר להוריד, להריץ, לבדוק, לכוונן (fine-tune) ולהחזיק במודל, במקום רק לשכור אותו דרך API
. פריסה דו-שלבית — API תחילה, משקלים פתוחים אחד-עשר ימים לאחר מכן — היא הצורה של כל ההכרזה
.
לפני שחרור המשקלים הפתוחים, מפתחים יכולים לגשת ל-K3 דרך kimi.com, Kimi API, או OpenRouter . המודל מדבר ב-SDK של OpenAI, תומך ב-tool calling, פלט מובנה (structured output), ו-caching אוטומטי של הקשר, ויש לו חלון הקשר של 1 מיליון טוקנים ללא תוספת תשלום עבור הקשר ארוך
.
עם זאת, הרצת מודל עם 2.8 טריליון פרמטרים באופן מקומי אינה עניין של מה בכך. גודל הקובץ מוערך בכ-1.5 TB, והחומרה המומלצת כוללת 64+ כרטיסי NVIDIA H100 ברמה ארגונית . עבור רוב הצוותים, ה-API יישאר נקודת הגישה המעשית.
Kimi K3 אינו המודל שמדיח את GPT-5.6 Sol או Claude Fable 5 באינטליגנציה הכוללת — Moonshot עצמה אומרת זאת. אבל הוא המודל שמוכיח שמערכת במשקלים פתוחים יכולה להתחרות במודלים קנייניים גבוליים במשימות ספציפיות בעלות ערך מסחרי, תוך עלות של שבריר מהמחיר. זהו המודל הפתוח הגדול ביותר ששוחרר אי פעם, והוא הגיע עם מספיק ביקוש בעולם האמיתי כדי לקרוס את תשתית ה-GPU של חברה תוך יומיים.
השילוב הזה — ביצועים גבוליים במבחנים סוכניים, תמחור אגרסיבי, משקלים פתוחים, ואות ברור של ביקוש — הופך את K3 לאבן דרך משמעותית בנוף הבינה המלאכותית, בלי קשר למיקומו בטבלת מובילים כזו או אחרת.