| GPT-5.6 Terra | 2,00 $ | 12,00 $ | −20 %, aiemmin 2,50 $ / 15 $ |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ | Hinta ennallaan, uusi Fast-tila |
Lunan syöte- ja tulostehinnan yhteissumma on nyt 1,40 dollaria miljoonaa tokenia kohti, mikä tekee siitä yhden markkinoiden edullisimmista huippuluokan malleista . Terran vastaava yhteissumma on 14 dollaria.
Solin uusi Fast-tila tuottaa vastauksia enintään 2,5 kertaa Standard-tilaa nopeammin. Se maksaa kaksinkertaisen hinnan Standard-käsittelyyn verrattuna, eikä OpenAI:n mukaan heikennä mallin älykkyyttä .
Hinnanleikkauksen kiinnostavin yksityiskohta liittyy OpenAI:n infrastruktuuriin. Yhtiö kertoi 29. heinäkuuta, että GPT-5.6 Sol oli osallistunut omien tuotannossa käytettävien GPU-ytimiensä uudelleenkirjoittamiseen ja optimointiin . GPU-ytimet ovat matalan tason ohjelmakoodia, joka ohjaa mallin ajamista laskentaraudalla.
OpenAI:n Codex-kehitysympäristön kautta Sol yhdisti työskentelynsä yhtiön sisäiseen infrastruktuuriin, suunnitteli ja ajoi satoja arkkitehtuurikokeita, käynnisti käyttöönottoja, seurasi niiden tuloksia ja teki uusia kierroksia niiden perusteella . Malli opetteli myös OpenAI:n kernelipinossa käytettyjen Triton- ja Gluon-kielten syntaksia .
OpenAI:n ilmoittamat tulokset olivat seuraavat :
Spekulatiivinen dekoodaus on tekniikka, jossa pienempi niin sanottu luonnosmalli ennustaa seuraavia tokeneita etukäteen. Näin varsinainen malli voi käsitellä hyväksyttävät ennusteet nopeammin.
Lisäksi OpenAI:n koko päättely- ja palvelupinoa on raportoitu tehostetun. Kuormantasausta on uudistettu niin, että pyyntöjä voidaan jakaa dynaamisesti esimerkiksi sijainnin, kiihdytintyypin ja välimuistin saatavuuden perusteella . Prompt-välimuistin käyttöikä on noin 30 minuuttia, ja välimuistista luetun syötteen kerrotaan maksavan 90 prosenttia vähemmän kuin uuden syötteen .
OpenAI ei laske hintoja tyhjiössä. Tekoälymallien kilpailu on muuttunut nopeasti heinäkuun aikana, ja erityisesti avointen painojen mallit haastavat suljettujen palvelujen hinnoittelua.
Moonshot AI julkaisi 17. heinäkuuta Kimi K3 -mallin, jonka koko on 2,8 biljoonaa parametria. Pekingiläisen startup-yrityksen mukaan kyseessä on maailman suurin avoimilla painoilla julkaistu tekoälymalli .
Kimi K3 ylsi Frontend Code -vertailussa 1 679 pisteeseen ja päihitti kyseisessä Arena-listauksessa GPT-5.6 Solin ja Anthropicin Fable 5:n . Startrise AI Labsin 30. heinäkuuta julkaisemassa riippumattomassa testissä Kimi K3 puolestaan sijoittui lähelle Claude Opus 5:tä, mutta koko testikokonaisuuden ajaminen maksoi 7,17 dollaria, kun Opus 5:n kohdalla hinta oli 21,17 dollaria .
Microsoftin on lisäksi raportoitu harkinneen Kimi K3:n testaamista Copilotissa. Ratkaisu voisi raporttien mukaan säästää yhtiölle jopa 600 miljoonaa dollaria eli 60 prosenttia tokenikustannuksista .
Myös Anthropic julkaisi Claude Opus 5:n 24. heinäkuuta viiden dollarin syötehinnalla miljoonaa tokenia kohti. Hinta oli puolet Fable 5:n hinnasta, ja Opus 5 päihitti Fable 5:n useissa vertailuissa . Google ja Microsoft toivat heinäkuussa markkinoille useita kustannustehokkaita malleja, mikä lisää painetta etenkin keski- ja edullisemmissa hintaluokissa .
Tässä asetelmassa OpenAI näyttää sijoittavan Lunan suurten volyymien ja hintaherkkien tehtävien malliksi – käytännössä houkutustuotteeksi – ja jättävän Solin premium-vaihtoehdoksi vaativaan päättelyyn .
Hintojen lasku liittyy myös yritysasiakkaiden muuttuneisiin odotuksiin. Tekoälymenoja seurataan yhä enemmän samalla tavalla kuin pilvipalvelukuluja: käyttöä budjetoidaan, tiimeille asetetaan rajoja ja suuret käyttöönotot vaativat johdon hyväksynnän .
OpenAI lisäsi 22. heinäkuuta API-alustalleen valvottavat kuukausittaiset kulurajat . Organisaatio- tai projektitasolle asetettava tiukka raja voi pysäyttää API-pyynnöt, kun kuukausibudjetti on käytetty loppuun. Tällöin pyynnöt palauttavat HTTP 429 -virheen, ja raja nollautuu seuraavan laskutuskauden alussa .
Olennaista on ero aiempiin seurantatoimintoihin: kyse ei ole vain ilmoituksesta tai hallintapaneelin mittarista, vaan rajasta, joka voi todella estää uudet API-pyynnöt budjetin täytyttyä.
Amazonin ja muiden suuryritysten kerrotaan puolestaan asettaneen sisäisiä ja asiakaspuolen rajoja tekoälymenoille, kun investointien tuottoa arvioidaan aiempaa tarkemmin . Reutersin mukaan yritysten hankintapolitiikassa tekoälyä käsitellään nyt enemmän pilvipalvelujen kuin rajattoman kokeilun tapaan .
OpenAI:n API-asiakkaille vaikutus on lyhyellä aikavälillä selvä:
Laajempi viesti on, että tekoälyn hintasota on jo käynnissä. Hintoja painavat sekä kilpailijat että infrastruktuurin tehostuminen – jopa siinä määrin, että malli on OpenAI:n mukaan auttanut optimoimaan omaa tuotantokoodiaan. Kun avoimilla painoilla julkaistut mallit kurovat suorituskykyeroa umpeen ja yritykset vaativat tiukkoja kulukattoja, uusia hinnanlaskuja voidaan odottaa myös muualla alalla.