Kostnaden för AI inferens med jämförbar kapacitet har enligt breda uppskattningar fallit med omkring 95 procent på två år, samtidigt som kostnaderna för halvledare och finansiering stiger. Nvidia redovisade 96,2 miljarder dollar i intäkter under räkenskapsårets andra kvartal 2027, en ökning på 106 procent.
Research answer

Create a landscape editorial hero image for this Studio Global article: How is the AI market being squeezed as token prices fall roughly 95% since early 2024—illustrated by the free near-frontier Ox Alpha model a. Article summary: The AI economy is experiencing a margin-and-financing squeeze: model capability is becoming commoditized faster than the physical infrastructure needed to produce it. That favors scarce-hardware suppliers in the near ter. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
AI-marknaden dras just nu åt två motsatta håll. Priset för att använda avancerade modeller rasar: en kostnadsfri modell kallad Ox Alpha uppges ha dykt upp nära teknikens framkant, samtidigt som OpenAI i juli sänkte priserna på två GPT-5.6-nivåer med 80 respektive 20 procent. 1716 Bredare uppskattningar pekar på att kostnaden för AI-inferens med jämförbar kapacitet har minskat med ungefär 95 procent under de senaste två åren. 22
Samtidigt blir de fysiska systemen som krävs för att leverera dessa token dyrare. Samsung har höjt priserna på vissa avancerade tillverkningstjänster för chip med upp till 15 procent och räknar med att den globala minnesbristen ska förvärras och bestå till 2028. 3233
Det skapar ett ovanligt ekonomiskt mönster: priset på det som säljs faller, medan kostnaden för kritiska insatsvaror fortsätter att stiga.
Den viktigaste skiljelinjen går mellan ett intelligenslager som blir mer standardiserat och ett infrastrukturlager där utbudet är begränsat.
Tillgång till generella modeller blir allt enklare att ersätta. Om en leverantör sänker sina API-priser, lanserar en mindre modell eller erbjuder en kapabel modell gratis, ökar pressen på konkurrenterna att svara. OpenAI:s prisförändringar i juli sänkte exempelvis indata-priset för GPT-5.6 Luna från 1 dollar till 0,20 dollar per miljon token och priset för Terra från 2,50 dollar till 2 dollar. 16
Infrastrukturen fungerar annorlunda. Avancerad chipproduktion, höghastighetsminne, nätverk, elförsörjning och kompletta AI-serversystem kan inte byggas ut lika snabbt som mjukvarupriser kan sänkas. Samsung har sagt att kunder efterfrågar fleråriga leveransavtal och att bristen kan bli mer akut fram till 2028. 33
Rapporter om planerade prishöjningar på mer än 15 procent för Nvidia-baserade servrar visar hur leverantörer kan försöka föra kostnaderna vidare till kunderna. Det är dock inte ett officiellt prisbesked från Nvidia. 36
För leverantörer av AI-tjänster är problemet enkelt att beskriva: intäkten per token kan falla även när användningen ökar, medan kostnaderna för kapacitet, energi, hårdvara och finansiering inte behöver minska i samma takt.
Nvidias resultat för räkenskapsårets andra kvartal 2027 visar att infrastrukturboomen fortfarande är exceptionellt stark. Bolaget rapporterade intäkter på 96,2 miljarder dollar, upp 106 procent från året före, samt ett justerat resultat per utspädd aktie på 2,22 dollar. 60 Ledningen har dessutom signalerat att intäkterna under räkenskapsåret 2028 kan växa med omkring 70 procent. 51
Siffrorna visar dock inte att hela AI-ekonomin har löst sitt lönsamhetsproblem. De visar att efterfrågan på knappa acceleratorer fortfarande är mycket stark. Nvidia befinner sig i en flaskhals där kunderna konkurrerar om tillgången på hårdvara.
Samtidigt börjar stigande minneskostnader påverka kvaliteten på tillväxten. Nvidia räknar med en bruttomarginal på omkring 74 procent under det följande kvartalet, ned från 75 procent i det rapporterade kvartalet. Rapporteringen om utsikterna kopplar en del av pressen till minnespriser. 51
Det behöver inte betyda att Nvidias affärsmodell håller på att falla samman. Men framtida resultat kan i högre grad bero på prishöjningar, systemintegration, nätverk, mjukvara och förmågan att hantera leveranskedjan – inte enbart på att sälja chip med hög knapphetsmarginal.
Broadcom illustrerar en annan del av pressen. Reuters och Bloomberg har rapporterat att bolaget förhandlar om att ta upp mer än 60 miljarder dollar i lån till en AI-chipfinansiering som skulle gynna Anthropic och andra kunder. Konstruktionen kan innehålla omkring 30 miljarder dollar i efterställd skuld tillsammans med en senior säkerställd del, men villkoren är fortfarande under förhandling. 12
Det är en viktig skillnad: det handlar om föreslagen finansiering, inte om ett genomfört lån. Beloppen bör därför ses som en diskuterad storleksordning, inte som en färdig transaktion.
Den ekonomiska frågan är om AI-intäkterna från chipen blir tillräckligt stabila för att bära skuldtjänsten. Ett chip kan vara tekniskt värdefullt men ändå bli en svag belånad investering om modellpriserna faller, kundkoncentrationen är hög, utrustningens restvärde sjunker eller refinansiering blir dyrare.
Det är därför kreditmarknaderna spelar roll. När infrastruktur finansieras med stora mängder skuld blir fallande tokenpriser mer än en prissättningsfråga för mjukvarubolag. De kan också påverka de kassaflöden som ska bära leasingavtal, specialföretag, leverantörer och långivare.
De stora molnbolagen är bättre positionerade än fristående modellleverantörer. De kan paketera AI med befintliga molntjänster, företagsmjukvara, annonsering, data och distributionskanaler. De kan också subventionera AI-funktioner och tjäna pengar på kunden på andra håll.
Det innebär ändå inte automatiskt att varje AI-investering ger en attraktiv avkastning. Billigare modeller kan öka användningen samtidigt som intäkten per enhet minskar. Överkapacitet kan förvandla AI till en funktion med lägre marginal i molnverksamheten, snarare än en separat vinstmotor.
Den centrala frågan är därför inte hur många token som behandlas, utan om kunderna betalar tillräckligt för den produktivitet, de intäkter eller de kostnadsbesparingar som AI faktiskt skapar.
För företag är fallande inferenspriser genuint positiva. Lägre kostnader gör det lättare att testa AI-tillämpningar, automatisera avgränsade arbetsflöden och använda starkare modeller i uppgifter som tidigare inte klarade en ekonomisk lönsamhetskontroll.
Men tokenkostnaden är bara en del av kalkylen. Företag måste fortfarande betala för integration, databeredning, säkerhetskontroller, styrning, utvärdering och förändringsarbete. En billigare API-faktura garanterar inte en positiv avkastning på investeringen.
Marknaden går därför mot en mer krävande fråga: vilket mätbart affärsresultat skapar varje enhet AI-beräkning? Företag som kan koppla modell användning till intäkter eller verifierbara besparingar har bättre förutsättningar än företag som samlar på sig kapacitet utan ett tydligt användningsområde.
Investerare behöver skilja mellan exponering mot knappa insatsvaror och exponering mot standardiserad modellåtkomst.
Den utbudsbegränsade sidan omfattar minnen, avancerad chipproduktion, nätverk, el och integrerade acceleratorsystem. Dessa verksamheter kan behålla förhandlingsstyrka så länge kunder konkurrerar om kapacitet. Samsungs prishöjningar och prognos om fortsatt brist är tecken på den nuvarande leverantörsmakten. 3233
Modellåtkomst möter ett svårare test. Gratis eller kraftigt rabatterade modeller kan bredda marknaden, men gör det också svårt att hålla uppe höga priser på likartad inferens. Hållbar ekonomi kan i stället kräva egen distribution, data, specialiserade arbetsflöden, avtalsbunden efterfrågan eller mjukvara som fångar värde bortom själva token.
Kreditinvesterare bör särskilt granska kontrakterade kassaflöden, kundkoncentration, hårdvarans restvärde, skuldstruktur och tidpunkter för refinansiering. Den föreslagna Broadcom-finansieringen är en användbar varningssignal eftersom den visar hur snabbt AI-infrastruktur kan bli en finansieringsfråga – inte bara en teknikfråga. 12
AI-boomen följer inte en enda kostnadskurva. Intelligensen blir billigare och mer tillgänglig, medan den fysiska kapacitet som krävs för att producera den fortfarande är knapp och dyr.
Den obalansen förklarar hur Nvidia kan rapportera extraordinär tillväxt och samtidigt varna för marginalpress. Den förklarar också varför en föreslagen chipfinansiering på tiotals miljarder dollar väcker intresse på kreditmarknaderna trots att AI-efterfrågan fortfarande är stark.
Nästa fas avgörs därför inte enbart av hur kapabla modellerna blir. Den avgörs av om kunderna kan omvandla billig intelligens till varaktiga kassaflöden innan dyr, skuldfinansierad datorkapacitet måste refinansieras.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kostnaden för AI inferens med jämförbar kapacitet har enligt breda uppskattningar fallit med omkring 95 procent på två år, samtidigt som kostnaderna för halvledare och finansiering stiger.
Kostnaden för AI inferens med jämförbar kapacitet har enligt breda uppskattningar fallit med omkring 95 procent på två år, samtidigt som kostnaderna för halvledare och finansiering stiger. Nvidia redovisade 96,2 miljarder dollar i intäkter under räkenskapsårets andra kvartal 2027, en ökning på 106 procent.
Broadcom diskuterar fortfarande en AI chipfinansiering på mer än 60 miljarder dollar.