| GPT-5.6 Terra | 2 דולר | 12 דולר | הוזלה של 20% — מ-2.50 ו-15 דולר |
| GPT-5.6 Sol | 5 דולר | 30 דולר | ללא שינוי; נוסף מצב Fast |
במונחי קלט ופלט יחד, השימוש ב-Luna עולה כעת 1.40 דולר למיליון טוקנים, ואילו Terra עולה 14 דולר למיליון טוקנים . לשם השוואה, המחירים המקוריים היו 7 דולר למיליון טוקנים עבור Luna ו-17.50 דולר עבור Terra, בחישוב קלט ופלט יחד.
מצב Fast של Sol מציע מהירות של עד פי 2.5 ממצב Standard, במחיר כפול, ללא שינוי ברמת האינטליגנציה של המודל .
החלק החריג במהלך אינו רק גודל ההנחה, אלא גם הדרך שבה OpenAI אומרת שהגיעה אליה. ב-29 ביולי דיווחה החברה כי GPT-5.6 Sol שכתב וייעל באופן אוטונומי את ליבות ה-GPU בסביבת הייצור — קוד ברמה נמוכה שמפעיל בפועל את המודלים על שבבי החישוב .
באמצעות סביבת הפיתוח Codex, Sol התחבר לתשתיות הפנימיות של OpenAI, תכנן והריץ מאות ניסויים ארכיטקטוניים, העלה גרסאות לניסוי, ניטר את התוצאות ושיפר את הקוד בסבבים חוזרים . המודל למד גם תחביר בשפות Triton ו-Gluon, המשמשות במחסנית הליבות של OpenAI .
לפי הנתונים שפרסמה OpenAI, התוצאות כללו:
השיפור לא הסתכם בקוד של ה-GPU. דיווחים נוספים מציינים שדרוגים באיזון העומסים, כך שהבקשות מנותבות באופן דינמי לפי מיקום גיאוגרפי, סוג המאיץ וזמינות המטמון . בנוסף, מטמון הקלט נשמר למשך כ-30 דקות, וקריאה מקלט שנשמר במטמון זולה ב-90% מקריאה מקלט חדש .
במילים פשוטות: OpenAI הצליחה לשפר את היעילות של כל שרשרת ההרצה — מהניתוב בין שרתים ועד הקוד שמפעיל את המעבדים הגרפיים — ולכן יכלה להעביר חלק מהחיסכון ללקוחות ה-API.
המהלך מגיע בשוק שבו ביצועים גבוהים כבר אינם מספיקים. חברות צריכות להציע גם עלות נמוכה, מהירות וגמישות תפעולית.
ב-17 ביולי השיקה Moonshot AI הסינית את Kimi K3, מודל בעל 2.8 טריליון פרמטרים, שאותו הציגה החברה כמודל ה-AI הגדול בעולם במשקולות פתוחות . במבחני קוד לפיתוח ממשקי משתמש, Kimi K3 השיג ביצועים שהשתוו או עלו על GPT-5.6 Sol ועל מודלים של Anthropic .
ב-Leaderboard של Arena למבחני Frontend Code קיבל Kimi K3 ציון 1,679 נקודות — יותר מ-GPT-5.6 Sol ומ-Fable 5 . מחקר עצמאי שפורסם ב-30 ביולי מצא כי Kimi K3 הגיע לתוצאה דומה ל-Claude Opus 5 במבחן הנדסת ממשקים, אך עלות הרצת המבחן המלא הייתה 7.17 דולר לעומת 21.17 דולר עבור Opus 5 .
לפי דיווחים, Microsoft אף שקלה לבחון את Kimi K3 בתוך Copilot וב-Azure. שילוב כזה עשוי לחסוך לה עד 600 מיליון דולר, או כ-60% מעלות הטוקן .
Anthropic השיקה ב-24 ביולי את Claude Opus 5 במחיר של 5 דולר למיליון טוקני קלט — מחצית מהמחיר של Fable 5 — והדגם גבר על Fable 5 בכמה מבחני ביצועים . הדבר הפעיל לחץ ישיר על שכבת הפרימיום שבה מתחרה GPT-5.6 Sol.
במקביל, Google ו-Microsoft השיקו ביולי כמה מודלים זולים יחסית, והחריפו את התחרות בפלחי הביניים והמחיר הנמוך . מבחינת OpenAI, התוצאה היא צורך להציע דגם כניסה אגרסיבי במיוחד, בלי לוותר על Sol כמוצר פרימיום.
לכן Luna מתפקד למעשה כ-"loss leader" — דגם שמושך שימושים בהיקף גבוה וברגישות גבוהה למחיר — בעוד Sol נשאר הבחירה למשימות מורכבות וללקוחות שמוכנים לשלם יותר עבור יכולות מתקדמות .
הורדת המחירים אינה מתרחשת בחלל ריק. ככל שסוכני AI מבצעים יותר פעולות באופן אוטונומי, ארגונים חוששים מחשבונות בלתי צפויים ודורשים שליטה תקציבית הדוקה יותר.
ב-22 ביולי 2026 הוסיפה OpenAI מגבלות חודשיות קשיחות על הוצאות API . בניגוד לתקרות הרכות שנוספו קודם ל-ChatGPT Enterprise ושימשו בעיקר למעקב, מגבלה קשיחה גורמת לבקשות API להיכשל עם שגיאת HTTP 429 לאחר מיצוי התקציב שהוגדר . מנהלים יכולים להגדיר את התקרה ברמת הארגון או הפרויקט, והיא מתאפסת בתחילת מחזור החיוב הבא .
Amazon וחברות גדולות נוספות דווחו כמי שמטילות מגבלות פנימיות או מגבלות על הוצאות AI של לקוחות, בזמן שהן בוחנות בקפדנות רבה יותר את התשואה על ההשקעה . לפי Reuters, מחלקות הרכש מתחילות להתייחס ל-AI כפי שהן מתייחסות לשירותי ענן: תקציבים ייעודיים, הקצאות מוגבלות ואישור של מנהלי מערכות מידע לפריסות רחבות .
המסר ברור: התקופה שבה ארגונים היו מוכנים "להוציא כל סכום" כדי להטמיע AI מתחלפת בניהול תקציבי הדוק. גם אם המחיר לכל טוקן יורד, השימוש הכולל במודלים ממשיך לגדול — ולכן תקרת הוצאה שאכן עוצרת בקשות הופכת לכלי תפעולי חשוב.
המשמעות הרחבה יותר היא שמלחמת המחירים בתחום ה-AI אינה נובעת רק מתחרות בין חברות. היא מונעת גם מהנדסת יעילות — כולל מצב יוצא דופן שבו מודל מסייע לייעל את קוד הייצור שמפעיל אותו — ומהלחץ של לקוחות ארגוניים להוכיח שהשימוש ב-AI מצדיק את העלות.
אם מגמות אלה יימשכו, סביר שהמחירים ימשיכו לרדת, בעוד שההבדל בין ספקי AI ייקבע יותר ויותר לפי עלות למשימה, מהירות, אמינות וכלי בקרת תקציב — ולא רק לפי הציון במבחן ביצועים.