| GPT-5.6 Terra – vyvážená varianta | 2,00 USD | 12,00 USD | Pokles o 20 %, z 2,50 USD / 15 USD |
| GPT-5.6 Sol – vlajkový model | 5,00 USD | 30,00 USD | Cena beze změny; přibyl režim Fast |
U Luny tak kombinovaná cena vstupu a výstupu klesla na 1,40 USD za milion tokenů. Terra vychází při stejném součtu na 14 USD za milion tokenů .
Sol zůstává prémiovou volbou. Jeho režim Fast má být až 2,5krát rychlejší než standardní zpracování, stojí dvojnásobek standardní ceny a podle OpenAI nemění úroveň inteligence modelu .
Nejzajímavější částí oznámení není samotný ceník, ale způsob, jakým OpenAI hledalo úspory. Společnost 29. července uvedla, že GPT-5.6 Sol prostřednictvím vývojového prostředí Codex autonomně přepisoval a optimalizoval produkční GPU jádra – nízkoúrovňový kód, který zajišťuje běh modelů na grafických procesorech .
Podle zveřejněného popisu se model připojil k interní infrastruktuře OpenAI, navrhl a spustil stovky experimentů s architekturou, sledoval nasazení změn a postupně upravoval řešení podle výsledků . Naučil se také syntaxi jazyků Triton a Gluon, které OpenAI používá ve svém zásobníku pro GPU jádra .
OpenAI uvádí dva měřitelné výsledky :
Spekulativní dekódování používá menší „návrhový model“, který předpovídá další tokeny. Výkonnější model pak tyto návrhy rychle ověřuje, což může urychlit generování odpovědí.
Úspory ale nevznikly jen v samotném kódu GPU. Zprávy zmiňují také přepracování vyvažování zátěže, které rozděluje požadavky podle geografické polohy, typu akcelerátoru a dostupnosti mezipaměti . Významnou roli hraje i prompt caching: při opakovaném použití stejného vstupu může být načtení uložených dat až o 90 % levnější než zpracování nového vstupu. Doba uchování mezipaměti je přibližně 30 minut .
Cenový krok přichází v době, kdy se trh s pokročilými modely rychle mění.
Čínský startup Moonshot AI uvedl 17. července model Kimi K3 s 2,8 bilionu parametrů. Jde o model s otevřenými vahami, který lze na rozdíl od běžných proprietárních systémů provozovat a upravovat ve vlastním prostředí. Moonshot jej označil za největší model tohoto typu na světě .
Kimi K3 v některých testech programování uživatelských rozhraní překonal GPT-5.6 Sol i model Anthropic Fable 5. V žebříčku Arena Frontend Code získal 1 679 bodů . Nezávislé měření společnosti Startrise AI Labs zveřejněné 30. července pak uvádělo srovnatelný výkon Kimi K3 a Claude Opus 5 při výrazně nižších nákladech na celý test: 7,17 USD oproti 21,17 USD .
Microsoft podle dostupných zpráv zvažoval testování Kimi K3 v Copilotu. Případné nasazení by podle odhadů mohlo společnosti ušetřit až 600 milionů USD, respektive 60 % nákladů na token .
Anthropic uvedl 24. července Claude Opus 5 s cenou 5 USD za milion vstupních tokenů – polovinu ceny modelu Fable 5. Opus 5 zároveň v několika benchmarcích překonal Fable 5 . To vytváří tlak především na prémiovou cenovou kategorii, kde soutěží GPT-5.6 Sol.
Google a Microsoft v červenci představily několik cenově efektivních modelů, což dále zvyšuje konkurenci ve střední a nejlevnější části trhu . OpenAI proto může Lunu využít jako velmi levnou variantu pro úlohy s vysokým objemem požadavků, zatímco Sol si ponechává úlohu prémiového produktu .
Zlevnění je také reakcí na změnu ve firemním nákupním chování. Podniky stále častěji požadují pevné rozpočty a kontrolu nad tím, kolik mohou AI nástroje utratit – podobně jako u cloudových služeb.
OpenAI 22. července přidalo do platformy API vynutitelné měsíční limity výdajů . Správci mohou nastavit rozpočet pro celou organizaci nebo konkrétní projekt. Po jeho vyčerpání další požadavky selžou s chybou HTTP 429, tedy nikoli jen upozorněním v administraci . Limit se obnoví na začátku dalšího fakturačního období.
Jde o rozdíl oproti dřívějším měkkým limitům, které především zobrazovaly přehled využití. Tvrdý limit skutečně zastaví další API požadavky, a může tak zabránit nečekanému nárůstu nákladů například u autonomních AI agentů.
Reuters popisuje širší posun ve firemním nákupu: rozpočty na AI se stále častěji schvalují samostatně, mají pevné stropy a u rozsáhlejších projektů vyžadují souhlas IT vedení . Zprávy zároveň uvádějí, že Amazon a další velké firmy zavádějí interní či zákaznické limity, protože pečlivěji posuzují návratnost AI investic .
Hlavní závěr je širší než samotná sleva. Ceny pokročilé AI začínají ovlivňovat nejen nové modely a konkurenční nabídky, ale také optimalizace na úrovni celého výpočetního zásobníku. Pokud se podobné techniky – včetně využití modelu při úpravě vlastního produkčního kódu – budou dál zlepšovat, mohou zákazníci očekávat další tlak na pokles cen. Současně ale firmy budou stále pečlivěji hlídat, kolik AI skutečně spotřebuje jejich rozpočet.