Jefferies Research – Investeringsbanken offentliggjorde den 10. august 2026 en rapport, der viste, at enterprise AI-inferenspriserne var faldet til årets lavpunkt. Deres data, citeret af SCMP, viste gennemsnitlige inferenspriser på $1,16–$1,18 pr. million tokens fra 6.-8. august 2026 . Det er et fald på cirka 43% i forhold til $2,04 den 31. maj .
Silicon Datas LLM Token Expenditure Index – Indekset faldt fra over $2 pr. million tokens i starten af juni til $1,20 i den første uge af august – et fald på omkring 40% på to måneder . En måling den 27. juli viste $1,43, hvilket bekræfter den nedadgående tendens . Silicon Data peger specifikt på kinesiske open-weight-modeller som en primær årsag til faldet i indeksgennemsnittet .
OpenAI sænkede API-priserne med op til 80% med henvisning til forbedringer i infrastruktureffektivitet. Trækket pressede markedsgennemsnittet direkte ned; CNBC og Forbes beskrev det som en optrapning af AI-priskrigen .
OpenAI tilskrev reduktionerne til interne optimeringer, herunder kernel-omskrivninger og spekulativ afkodning, som angiveligt gav 20-35% effektivitetsforbedringer i inferensarbejdsbyrder .
Den 31. juli 2026 udgav DeepSeek V4-Flash-0731 i offentlig beta med uændrede priser:
Til cirka en tiendedel af prisen på premium-modeller satte DeepSeek V4 Flash en bundpris, der tvang en bredere markedskompression. Ifølge benchmark-firmaet Artificial Analysis er V4 Flash's estimerede pris pr. opgave cirka 3 cent . Modellen slår DeepSeeks egen V4 Pro preview på alle agentiske benchmarks, som DeepSeek har offentliggjort, til en tredjedel af output-prisen .
Opus 5 blev lanceret til $5 pr. million input-tokens og $25 pr. million output-tokens – identisk med forgængeren Opus 4.8 – med en hurtig tilstand til 2x basispris ($10/$50) . Selvom Opus 5 ikke selv sænkede priserne, lagde lanceringen til en konkurrencedygtig