De kosten voor AI inferentie voor bedrijven zijn in de eerste week van augustus 2026 gedaald naar een jaarlijks dieptepunt van gemiddeld $1,16–$1,18 per miljoen tokens. De belangrijkste veroorzakers: OpenAI verlaagde op 30 juli de prijzen voor GPT 5.6 Luna met 80% (naar $0,20/$1,20 per miljoen tokens) en DeepSeek la...
Research answer

Create a landscape editorial hero image for this Studio Global article: What caused enterprise AI inference costs to hit their lowest level in 2026 in early August, and what specific price data, trends, and compe. Article summary: Enterprise AI inference costs hit a 2026 low in early August, averaging **$1.16–$1.18 per million tokens** — a ~43% drop from $2.04 on May 31 — driven by an intensifying global price war, OpenAI's steep cuts, and the sur. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
De kosten voor AI-inferentie voor bedrijven zijn begin augustus 2026 op het laagste punt van het jaar beland, met een gemiddelde van $1,16–$1,18 per miljoen tokens — een daling van ongeveer 43% ten opzichte van $2,04 op 31 mei. Deze historische prijsdaling wordt gedreven door een intensiverende wereldwijde prijzenoorlog, forse prijsverlagingen van OpenAI en de opmars van goedkope Chinese opensource-modellen, zo blijkt uit onderzoek van zakenbank Jefferies en de index van Silicon Data .
Jefferies Research — De investeringsbank publiceerde op 10 augustus 2026 een rapport waarin staat dat de gemiddelde AI-inferentieprijzen voor bedrijven tussen 6 en 8 augustus daalden naar $1,16–$1,18 per miljoen tokens . Dat is een daling van ruwweg 43% ten opzichte van de $2,04 op 31 mei
.
Silicon Data's LLM Token Expenditure Index — Deze index toont een daling van de gemiddelde prijs van boven de $2 per miljoen tokens begin juni naar $1,20 in de eerste week van augustus — een daling van ongeveer 40% in twee maanden tijd . Een momentopname van 27 juli liet nog $1,43 zien, wat de neerwaartse trend bevestigt
. Silicon Data noemt Chinese opengewicht-modellen expliciet als een van de belangrijkste factoren die de index omlaag hebben getrokken
.
OpenAI verlaagde de API-prijzen met maar liefst 80% en noemde efficiëntieverbeteringen in de infrastructuur als reden. Deze zet werd door CNBC en Forbes omschreven als een escalatie van de AI-prijzenoorlog en drukte direct de marktgemiddelden .
OpenAI schreef de prijsverlagingen toe aan interne optimalisaties, waaronder herschrijvingen van de 'kernel' en speculatieve decodering, die naar verluidt 20-35% efficiëntiewinst opleverden bij inferentietaken .
Op 31 juli 2026 bracht DeepSeek V4-Flash-0731 uit in een openbare bèta, met de volgende prijzen:
Met een prijs die ongeveer een tiende is van die van premium modellen, werd DeepSeek V4 Flash de bodemprijs die de hele markt omlaag dwong. Volgens het benchmarkbedrijf Artificial Analysis bedragen de geschatte kosten per taak voor V4 Flash ongeveer 3 dollarcent . Het model verslaat DeepSeeks eigen V4 Pro preview op elke agentische benchmark die DeepSeek heeft gepubliceerd, en dat voor een derde van de outputprijs
.
Opus 5 kwam op de markt voor $5 per miljoen input tokens en $25 per miljoen output tokens — identiek aan zijn voorganger Opus 4.8 — met een snelle modus voor het dubbele van de basisprijs ($10/$50) . Hoewel Opus 5 zijn prijzen niet verlaagde, zette de lancering in een concurrerende 'bijna-vlaggenschip'-klasse (bijna de intelligentie van Fable 5 voor de helft van de prijs) de concurrentie onder druk en vergrootte het de hoeveelheid goedkope opties voor bedrijven
.
De 80%-prijsverlaging van OpenAI (30 juli), de extreem lage Flash-prijzen van DeepSeek (31 juli), de concurrerende lancering van Opus 5 door Anthropic (24 juli) en de wijdverbreide adoptie van goedkope Chinese opensource-modellen door bedrijven, zorgden ervoor dat de marktindex daalde van $2,04 eind mei naar $1,16–$1,18 begin augustus — een daling van 43% in tien weken tijd .
Jefferies-analisten onder leiding van Thomas Chong schrijven de daling toe aan een 'intensiverende wereldwijde prijzenoorlog' en een 'explosie in de adoptie van betaalbare Chinese opengewicht-modellen' . De marktreactie bleef niet beperkt tot prijzen: Jefferies betoogde ook dat dalende tokenkosten de AI-vraag en investeringen in infrastructuur zouden kunnen stimuleren
.
Silicon Data's openbare index stond op 27 juli op $1,43, terwijl het gerapporteerde cijfer voor begin augustus $1,20 was. Dit suggereert een steile versnelling van de daling eind juli/begin augustus, veroorzaakt door de aankondigingen van OpenAI en DeepSeek . De index combineert prijzen en gebruik, wat betekent dat een daling zowel kan wijzen op dalende catalogusprijzen als op een verschuiving in de vraag naar goedkopere modellen. Silicon Data zelf heeft gewaarschuwd dat de index niet als een pure prijsmaatstaf moet worden gezien
.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
De kosten voor AI inferentie voor bedrijven zijn in de eerste week van augustus 2026 gedaald naar een jaarlijks dieptepunt van gemiddeld $1,16–$1,18 per miljoen tokens.
De kosten voor AI inferentie voor bedrijven zijn in de eerste week van augustus 2026 gedaald naar een jaarlijks dieptepunt van gemiddeld $1,16–$1,18 per miljoen tokens. De belangrijkste veroorzakers: OpenAI verlaagde op 30 juli de prijzen voor GPT 5.6 Luna met 80% (naar $0,20/$1,20 per miljoen tokens) en DeepSeek lanceerde op 31 juli V4 Flash 0731 voor extreem lage prijzen ($0,14/$0,...
Anthropic voegde op 24 juli concurrentiedruk toe met de lancering van Claude Opus 5 tegen $5/$25 per miljoen tokens, een prijs die onveranderd bleef maar wel een krachtig presterend model dichter bij de bedrijven bracht.