Små lokale sprogmodeller (≤20 mia. parametre) på almindelige laptops og desktops kan nu præcist besvare 88,7 % af alle enkeltstående chat og ræsonneringsforespørgsler, ifølge et stort Stanford studie fra november 2025.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the Stanford University study published as a preprint in November 2025 find about the performance, accuracy, "intelligence per watt. Article summary: ## Key Findings from the Stanford "Intelligence Per Watt" Study (November 2025 Preprint). Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Økonomien bag kunstig intelligens er måske på vej mod et grundlæggende skifte. En omfattende undersøgelse fra Stanford University, offentliggjort som et preprint i november 2025, viser, at små sprogmodeller (såkaldte 'small language models'), der kører på almindelige stationære og bærbare computere, nu kan håndtere langt størstedelen af de opgaver, som tidligere krævede dyre cloud-baserede AI-systemer .
Forskningen, ledt af Jon Saad-Falcon, Avanika Narayan og kolleger ved Stanfords Hazy Research-gruppe og Together AI, introducerer en ny målestok kaldet Intelligence Per Watt (IPW) – defineret som den gennemsnitlige opgavenøjagtighed divideret med det gennemsnitlige strømforbrug under inferens – for at skabe en ensartet måde at sammenligne lokale og cloud-baserede AI-systemer på .
Studiets empiriske arbejde er omfattende: det benchmarker over 20 lokale sprogmodeller på tværs af 8 forskellige acceleratorer (herunder dem fra Apple, AMD og NVIDIA) ved hjælp af 1 million virkelige enkeltstående chat- og ræsonneringsforespørgsler . Hovedresultaterne er slående:
IPW er elegant enkel: den dividerer den nøjagtighed, en model opnår på en given opgave, med den strøm, den bruger under inferens . Dette står i kontrast til den almindelige praksis med at evaluere AI-modeller isoleret set, hvor man ignorerer energiomkostningerne og hardwarekravene.
Metrikken indfanger en central indsigt: den mest kapable model er ikke nødvendigvis den mest effektive eller praktiske. En lille model, der kører på en laptop, kan levere 95 % af nøjagtigheden fra en kæmpe cloud-model, mens den bruger en brøkdel af energien .
Et af studiets mest økonomisk betydningsfulde resultater vedrører, hvad der sker, når man ikke vælger mellem lokalt og cloud – men bruger begge dele intelligent.
Oracle-routing, et hypotetisk perfekt system, der tildeler hver forespørgsel til den mindste egnede model, kunne teoretisk set reducere energiforbruget med 80,4 %, beregningskraften med 77,3 % og omkostningerne med 73,8 % sammenlignet med en ren cloud-implementering .
En praktisk, realistisk router testet i relateret forskning opnåede lignende resultater: den reducerede energien med 77,1 %, beregningskraften med 67,1 % og omkostningerne med 60,2 % i forhold til virkelige trafikfordelinger, alt imens den opretholdt sammenlignelig opgavenøjagtighed .
Dette er ikke en futuristisk mulighed. Forskningen viser, at hybride lokal-cloud-arkitekturer allerede er levedygtige og dramatisk kan sænke omkostningerne ved at levere AI-inferens.
Stanford-studiet kommer ikke med eksplicitte økonomiske forudsigelser for nogen virksomhed. Den udvikling, det dokumenterer, har dog klare og strukturelle implikationer for virksomheder, der er afhængige af cloud-API'er .
Lokale modeller dækker allerede cirka 89 % af enkeltstående forespørgsler til en dramatisk lavere pris . IPW er forbedret 5,3 gange på blot to år og fortsætter med at accelerere
. Smart routing kunne skære cloud-inferensomkostningerne med 60 % eller mere for de resterende forespørgsler, der sendes til skyen
.
Hvis denne tendens bliver operationaliseret i stor skala, kunne kunder erstatte størstedelen af deres cloud-API-forespørgsler med næsten omkostningsfri lokal inferens og kun reservere cloud-kald til de sværeste cirka 11 % af opgaverne, som lokale modeller endnu ikke kan håndtere .
Kommentarer, der fortolker studiet, har bemærket, at fremtiden for AI kan byde på 'små, billige og urentable' modeller for frontløber-AI-virksomheder . Det økonomiske incitament skifter mod lokale, open-weight-alternativer, der underbyder cloud-API-priserne – en dynamik, der kunne omforme forretningsmodellerne for virksomheder som OpenAI, Anthropic og xAI.
Dette studie er ét datapunkt i en større tendens. Stanford HAI's '2025 AI Index Report' viste, at inferensomkostningerne for et system, der præsterer på niveau med GPT-3.5, faldt over 280 gange mellem november 2022 og oktober 2024 . På hardwaresiden er omkostningerne faldet med 30 % årligt, mens energieffektiviteten er forbedret med 40 % hvert år
.
Open-weight-modeller er også ved at indhente de lukkede modeller og reducerede præstationsforskellen fra 8 % til blot 1,7 % på nogle benchmarks på et enkelt år .
Selvom resultaterne er imponerende, er det vigtigt at bemærke studiets omfang. Det tester kun enkeltstående forespørgsler – simple chat-svar og selvstændige ræsonneringsopgaver. Det evaluerer ikke lokale modeller på samtaler med flere omgange, lang kontekstræsonnering eller komplekse agentiske arbejdsgange – alle områder, hvor cloud-modeller har en betydelig fordel .
De testede lokale modeller (≤20 mia. parametre) kan heller ikke matche de allerbedste cloud-modeller på de sværeste problemer. Studiets forfattere er klare omkring dette: nøjagtigheden varierer betydeligt efter domæne, og tallet på 88,7 % skjuler svagere præstationer inden for tekniske og videnskabelige områder .
Stanfords 'Intelligence Per Watt'-studie giver stærke empiriske beviser for, at lokal AI har krydset en kritisk tærskel. For størstedelen af hverdagens forespørgsler – kreative opgaver, ledelse, salg, underholdning – er en lille model på en laptop allerede tilstrækkelig . Det hurtige tempo af forbedringer tyder på, at denne dækning kun vil udvide sig.
For virksomheder er implikationen klar: den mest omkostningseffektive AI-infrastruktur er i stigende grad en hybrid en, der ruter simple forespørgsler til lokale modeller og reserverer cloud-kapacitet til de sværeste opgaver. Tiden, hvor hver eneste forespørgsel blev sendt til en massiv cloud-model mod et gebyr per token, er måske ved at være forbi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Små lokale sprogmodeller (≤20 mia. parametre) på almindelige laptops og desktops kan nu præcist besvare 88,7 % af alle enkeltstående chat og ræsonneringsforespørgsler, ifølge et stort Stanford studie fra november 2025.
Små lokale sprogmodeller (≤20 mia. parametre) på almindelige laptops og desktops kan nu præcist besvare 88,7 % af alle enkeltstående chat og ræsonneringsforespørgsler, ifølge et stort Stanford studie fra november 2025. Andelen af forespørgsler, som lokale modeller kan håndtere kompetent, er steget fra blot 23,2 % i 2023 til 71,3 % i 2025 – en 3,1 dobling af dækningen.
En intelligent routing løsning, der sender hver forespørgsel til den mindste egnede model, kan reducere omkostningerne til cloud inferens med 60,2 % uden at gå på kompromis med nøjagtigheden.