מדד LLM Token Expenditure Index של Silicon Data, המסומן SDLLMTK, הגיע ב-1 בספטמבר 2026 ל-0.97 דולר למיליון טוקנים — שפל חדש ופחות ממחצית השיא שנרשם מוקדם יותר בקיץ. התחרות האגרסיבית במחירי ממשקי API בסין סייעה לשנות את הציפיות לגבי עלות ההסקה (inference) במודלי שפה גדולים.
2
4
אבל נתון זה אינו מעיד על היחלשות הביקוש ל-AI. המדד מודד את המחיר האפקטיבי המשוקלל לפי שימוש למיליון טוקנים, ולא את מספר הטוקנים הכולל שנצרך או את כלל הדולרים שמוציאים ארגונים על בינה מלאכותית.
2
4
מה בדיוק מודד נתון ה-97 סנט
Silicon Data מתארת את SDLLMTK כמדד למחירי הסקה משולבים במודלי שפה גדולים: הוא מחבר בין מחירי ספקים לבין דפוסי צריכה בפועל על פני קבוצת מודלים מוגדרת, וכך מייצר מחיר שוק אפקטיבי למיליון טוקנים.
2
4
ההבחנה הזו מהותית. אם לקוחות מעבירים חלק גדול יותר מהעומסים למודלים זולים, המדד יכול לרדת גם כאשר נפח הטוקנים הכולל — ואף סך ההוצאה על AI — עולה. לכן זהו מדד של מחיר ותמהיל שימוש, לא מדד להכנסות כלל השוק.
כיצד תחרות ה-API בסין שינתה את התמהיל
מלחמת המחירים יצרה חלופות זולות במיוחד למשימות שאינן מחייבות את המודל המתקדם והיקר ביותר. DeepSeek V4-Flash, למשל, הוצג במחיר של 0.14 דולר למיליון טוקני קלט ו-0.28 דולר למיליון טוקני פלט.
49
במאי 2026 DeepSeek קיצצה ב-75% את מחירי V4-Pro, צעד שסוקר כהחרפה של התחרות בין ספקיות מודלים סיניות.
58 מהלכי תמחור נוספים והיצע זול ברחבי האקוסיסטם הסיני הגבירו את הלחץ על ספקים המתחרים על עומסי הסקה בהיקף גבוה.
4
52
הראיות מצביעות על קשר חזק בין סביבת התחרות הזאת לבין הירידה במחיר המשוקלל של טוקנים. עם זאת, הן אינן מאפשרות לכמת במדויק כמה מהירידה נזקפת לזכות מעבדה, מודל או קיצוץ מחיר יחיד. גם שיפור ביעילות המודלים, הרחבת קיבולת מחשוב והחלטות ניתוב של הלקוחות משפיעים על המדד.
למה הוצאה על AI יכולה לעלות כשהטוקנים זולים יותר
הנוסחה הבסיסית היא:
הוצאה כוללת על טוקנים = מחיר אפקטיבי לטוקן × נפח הטוקנים
כאשר המחיר ליחידה יורד, יותר שימושים הופכים לכדאיים כלכלית: אפשר להפעיל יותר תהליכי אוטומציה, להשתמש בפרומפטים ובהקשרים ארוכים יותר, לייצר יותר קוד ולהריץ יותר מערכות מבוססות סוכני AI. אם נפח הטוקנים גדל מהר יותר מכפי שהמחיר האפקטיבי יורד, ההוצאה הכוללת עולה.
דפוס זה תואם דיווחים שלפיהם המחיר לטוקן ירד ביותר מ-90% מאז 2023, בעוד ההוצאה על שימוש במודלי שפה גדולים בערך הוכפלה מאז סוף 2025.
41
43 המנגנון אינו כשל של הורדות המחירים: הסקה זולה מרחיבה את מגוון המשימות שכדאי להפוך לאוטומטיות.
נפחי הטוקנים בסין ממחישים את התגובה לביקוש
לפי תחזיות ממשלתיות שצוטטו ברויטרס, צריכת הטוקנים היומית בסין עברה את 140 טריליון במרץ 2026, לעומת 100 טריליון בסוף 2025.
18
גם דיווחי חברות מצביעים על אותה מגמה. China Merchants Bank מסר שתפוקת הטוקנים היומית הממוצעת שלו עלתה ביותר מ-78% לעומת השנה הקודמת; דיווח נפרד העמיד את הצריכה היומית של הבנק על כ-33 מיליארד טוקנים בסוף מאי.
19
29 דיווחים נוספים ציינו שחלק מהבנקים בסין רשמו זינוקים גדולים אף יותר בשימוש היומי הממוצע בטוקנים.
20
המספרים האלה אינם מדד ישיר להכנסות מ-API, ואינם מוכיחים שכל עומס עבודה מייצר ערך כלכלי. אך הם כן מראים שהסקה זולה יותר מתורגמת לשימוש רחב בהרבה ובקנה מידה משמעותי.
נקודת הלחץ של ספקיות המודלים
עבור רוכשי AI, ירידת מחירי ההסקה היא יתרון ברור. עבור ספקיות המודלים, היא מייצרת משוואה עסקית קשה יותר: ההכנסה מכל טוקן עלולה לרדת, בזמן שהוצאות על שבבים, מרכזי נתונים, אימון מודלים ופיתוח ממשיכות להיות גבוהות.
השאלה המרכזית כבר אינה אם לקוחות יצרכו טוקנים זולים — הראיות מצביעות שכן. השאלה היא אם נפחי שימוש גבוהים יותר, מוצרים פרימיום והצעות לארגונים יוכלו לייצר הכנסות יציבות ושיפור פריון מדיד במהירות מספקת, כדי להצדיק את המשך ההשקעות בתשתיות. הירידה במדד העלתה חששות לגבי כוח התמחור של ספקיות המודלים.
4
36
מה כדאי לעקוב אחריו
לא די במחירון של מודל אחד. המדדים החשובים הם:
- מחיר טוקנים אפקטיבי משוקלל, כמו SDLLMTK, שמראה לאן הלקוחות מפנים בפועל עומסי עבודה.
2
- נפח הטוקנים, כדי לבדוק אם מחירים נמוכים מרחיבים את הביקוש.
- הכנסות ושיעורי רווחיות, כדי להבין אם הספקיות מסוגלות להפוך את הגידול בשימוש לעסק בר-קיימא.
- איכות עומסי העבודה, משום שצריכת טוקנים גבוהה כשלעצמה אינה מעידה על ערך עסקי.
השורה התחתונה: תחרות ה-API הזולה בסין סייעה להפוך את ההסקה במודלי שפה גדולים לזולה בהרבה והורידה את המחיר המשוקלל של השוק אל מתחת לדולר למיליון טוקנים. אלא שהמחירים הנמוכים מעודדים שימוש רב יותר — ולכן צריכת הטוקנים וההוצאה הכוללת על AI יכולות להמשיך לעלות במקביל.
2
4
41