| GPT-5.6 Terra — wariant zrównoważony | 2 dol. | 12 dol. | -20 proc., wcześniej 2,50 i 15 dol. |
| GPT-5.6 Sol — model flagowy | 5 dol. | 30 dol. | Cena bez zmian; dodano tryb Fast |
Przy prostym zsumowaniu stawek wejściowych i wyjściowych Luna kosztuje łącznie 1,40 dol. za 1 mln tokenów, a Terra — 14 dol. za 1 mln tokenów . Tak niska cena ma uczynić Lunę szczególnie atrakcyjną w zadaniach realizowanych na dużą skalę.
Sol nie został przeceniony, ale otrzymał tryb Fast. Ma on działać do 2,5 raza szybciej niż standardowe przetwarzanie, przy dwukrotnie wyższej cenie i bez deklarowanej utraty jakości modelu .
Najbardziej nietypowym elementem tej historii jest sposób, w jaki OpenAI opisuje źródło oszczędności. 29 lipca firma poinformowała, że GPT-5.6 Sol autonomicznie przepisał i zoptymalizował produkcyjne kernele GPU — niskopoziomowy kod, który pozwala uruchamiać modele na sprzęcie .
Za pośrednictwem środowiska programistycznego Codex model miał łączyć się z wewnętrzną infrastrukturą OpenAI, projektować i przeprowadzać setki eksperymentów architektonicznych, uruchamiać wdrożenia, monitorować ich działanie i iteracyjnie poprawiać wyniki . Model nauczył się również składni języków Triton i Gluon, wykorzystywanych w stosie kerneli OpenAI .
Według danych przedstawionych przez OpenAI efekty obejmują :
Dekodowanie spekulatywne to technika przyspieszania generowania odpowiedzi, w której mniejszy „model roboczy” przewiduje kolejne tokeny, a większy model je weryfikuje.
Raporty wskazują także na szersze zmiany w infrastrukturze: przebudowę mechanizmów równoważenia obciążenia, dynamiczne kierowanie zapytań zależnie od lokalizacji, rodzaju akceleratora i dostępności pamięci podręcznej oraz usprawnienia prompt cache . Pamięć podręczna może być utrzymywana przez około 30 minut, a odczyt z cache ma kosztować o 90 proc. mniej niż przetwarzanie świeżych danych wejściowych .
Obniżka o 80 proc. tak krótko po premierze nie jest wyłącznie efektem prac inżynieryjnych. OpenAI działa na rynku, na którym różnica między możliwościami modeli a ich ceną szybko się zmniejsza.
17 lipca chiński startup Moonshot AI zaprezentował Kimi K3 — model o 2,8 bln parametrów, określany jako największy model z otwartymi wagami . W testach programowania interfejsów internetowych Kimi K3 miał dorównywać GPT-5.6 Sol i modelom Anthropic, a w rankingu Arena Frontend Code uzyskał 1679 punktów, wyprzedzając GPT-5.6 Sol i Fable 5 .
W niezależnym teście opublikowanym 30 lipca przez Startrise AI Labs Kimi K3 zremisował z Claude Opus 5 w zadaniu z zakresu inżynierii front-endowej, a pełne przeprowadzenie testu kosztowało 7,17 dol. wobec 21,17 dol. w przypadku Opus 5 .
Microsoft miał rozważać przetestowanie Kimi K3 w usłudze Copilot. Według doniesień mogłoby to przynieść firmie oszczędności sięgające 600 mln dol., czyli 60 proc. kosztu tokenów .
Anthropic 24 lipca wprowadził Claude Opus 5 z ceną 5 dol. za 1 mln tokenów wejściowych — o połowę niższą niż w przypadku Fable 5. Model ma również przewyższać Fable 5 w kilku testach porównawczych . To bezpośrednio zwiększa presję na segment, w którym konkuruje GPT-5.6 Sol.
Google i Microsoft wprowadziły w lipcu kolejne modele nastawione na niższy koszt, co dodatkowo utrudnia OpenAI obronę pozycji w segmencie średnim i budżetowym . W efekcie Luna może pełnić rolę modelu przyciągającego klientów realizujących bardzo duże i wrażliwe cenowo wolumeny, podczas gdy Sol pozostaje najdroższą, najbardziej zaawansowaną opcją .
Presja cenowa pojawia się w momencie, gdy przedsiębiorstwa coraz dokładniej kontrolują wydatki na AI. Firmy zaczynają zarządzać wykorzystaniem modeli podobnie jak kosztami usług chmurowych: ustalają budżety, limity i procedury akceptacji dla większych wdrożeń .
22 lipca 2026 r. OpenAI dodało do platformy API egzekwowalne miesięczne limity wydatków . Administrator może ustawić limit dla całej organizacji albo konkretnego projektu. Po jego wyczerpaniu kolejne żądania API mogą zostać odrzucone, a limit odnawia się wraz z rozpoczęciem następnego cyklu rozliczeniowego .
To rozwiązanie różni się od wcześniejszych miękkich limitów i paneli monitorujących. Nie służy wyłącznie do obserwowania wydatków — może faktycznie zatrzymać kolejne wywołania API po przekroczeniu budżetu.
Według doniesień Amazon i inne duże przedsiębiorstwa również wprowadzają wewnętrzne oraz przeznaczone dla klientów ograniczenia wydatków na AI, ponieważ coraz dokładniej analizują zwrot z inwestycji . Era podejścia „wydajmy tyle, ile trzeba” ustępuje erze budżetowania i kontroli kosztów.
Najważniejszy wniosek jest szerszy niż sam cennik OpenAI. Wojna cenowa na rynku AI przyspiesza, a jej źródłem są jednocześnie konkurencja, modele z otwartymi wagami i postęp w optymalizacji infrastruktury. Jeśli modele będą coraz skuteczniej pomagać w ulepszaniu kodu, routingu i procesów obsługi, dalsze obniżki cen mogą stać się jednym z głównych sposobów walki o klientów. Dla przedsiębiorstw oznacza to tańszy dostęp do AI, ale także konieczność dokładniejszego zarządzania tym, gdzie i jak modele są wykorzystywane.