For norske lesere som ikke følger KI-utviklingen tett, kan begreper som "inferens" og "tokens" være ukjente. Inferens er rett og slett det som skjer når en trent KI-modell brukes til å svare på spørsmål, skrive tekst eller analysere data – altså selve bruken av modellen. Et token er en liten enhet med tekst, omtrent som en stavelse eller et ord. Prisen per million tokens er derfor et mål på hvor mye det koster å få en KI-modell til å gjøre et stykke arbeid.
Jefferies' rapport – Investeringsbanken publiserte 10. august 2026 en rapport som viser at prisene for bedrifters KI-bruk nådde et bunnivå. Dataene, som ble sitert av SCMP, viste en gjennomsnittspris på 1,16–1,18 dollar per million tokens i perioden 6.–8. august . Dette er en nedgang på omtrent 43 prosent fra 2,04 dollar 31. mai .
Silicon Datas LLM Token Expenditure Index – Indeksen viste at gjennomsnittsprisen falt fra over 2 dollar per million tokens i starten av juni til 1,20 dollar i første uke av august – en nedgang på omtrent 40 prosent på to måneder . 27. juli viste indeksen 1,43 dollar, noe som bekrefter den fallende trenden . Silicon Data peker direkte på kinesiske åpne modeller som en hovedårsak til nedgangen .
OpenAI kuttet API-prisene med opptil 80 prosent, med henvisning til effektivitetsforbedringer i infrastrukturen. Flere medier, deriblant CNBC og Forbes, beskrev dette som en opptrapping av KI-priskrigen .
OpenAI oppga at reduksjonene skyldtes interne optimaliseringer, inkludert omskriving av kjerneprogramvare og spekulativ dekoding, som ga 20–35 prosent bedre effektivitet i inferensarbeid .
Med en pris på omtrent en tidel av premiummodellene ble DeepSeek V4 Flash den modellen som satte gulvprisen og tvang frem ytterligere kompresjon i markedet. Ifølge analyseselskapet Artificial Analysis er den estimerte kostnaden per oppgave omtrent 3 cent . Modellen slår DeepSeek sin egen V4 Pro Preview på alle agentiske benchmark-tester, til en tredjedel av output-prisen .
Opus 5 ble lansert til 5 dollar per million input-tokens og 25 dollar per million output-tokens – identisk med forgjengeren Opus 4.8 – med en rask modus til 2 ganger basisprisen (10/50 dollar) . Selv om Opus 5 ikke kuttet prisene i seg selv, la lanseringen av en modell med nesten samme intelligens som flaggskipet Fable 5 til halve prisen press på konkurrentene og utvidet antallet rimelige alternativer for bedrifter .
OpenAIs 80-prosentskutt (30. juli), DeepSeeks Flash-priser under 0,30 dollar (31. juli), Anthropics konkurransedyktige Opus 5-lansering (24. juli) og den utbredte bruken av billige kinesiske åpne modeller har samlet presset markedsindeksen fra 2,04 dollar i slutten av mai til 1,16–1,18 dollar i starten av august – en nedgang på 43 prosent på ti uker .
Jefferies-analytikere ledet av Thomas Chong tilskrev nedgangen til en "intensiverende global priskrig" og en "økning i bruken av rimelige kinesiske åpne modeller" . Markedsreaksjonen var ikke begrenset til prising: Jefferies argumenterte også for at fallende token-kostnader kan øke etterspørselen etter KI og investeringer i infrastruktur .
Silicon Datas offentlige indeks viste 1,43 dollar 27. juli, mens den rapporterte 1,20 dollar i starten av august, noe som tyder på en kraftig akselerasjon i slutten av juli og starten av august drevet av OpenAIs og DeepSeeks kunngjøringer . Indeksen blander priser og bruk, noe som betyr at en nedgang kan reflektere enten fallende listepriser eller en endring i etterspørselen mot billigere modeller – Silicon Data selv har advart mot å lese den som en ren prislapp .