Malé lokální jazykové modely (≤20 mld. parametrů) na běžných noteboocích a desktoppech nyní zvládnou správně zodpovědět 88,7 % jednokolových chatovacích a logických dotazů, ukazuje rozsáhlá předtisková studie Stanford...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did the Stanford University study published as a preprint in November 2025 find about the performance, accuracy, "intelligence per watt. Article summary: ## Key Findings from the Stanford "Intelligence Per Watt" Study (November 2025 Preprint). Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
Ekonomika umělé inteligence stojí možná na prahu zásadního obratu. Rozsáhlá studie ze Stanfordské univerzity, zveřejněná jako předtisk v listopadu 2025, zjistila, že malé jazykové modely běžící na běžných desktopových a laptopových počítačích dnes zvládnou naprostou většinu úkolů, které dříve vyžadovaly drahé cloudové AI systémy .
Výzkum, který vedli Jon Saad-Falcon, Avanika Narayan a jejich kolegové ze stanfordské skupiny Hazy Research a společnosti Together AI, zavádí novou metriku nazvanou Inteligence na watt (IPW) – definovanou jako průměrná přesnost úlohy dělená průměrným příkonem během inference – která poskytuje jednotný způsob srovnání lokálních a cloudových AI systémů .
Empirická práce studie je rozsáhlá: testuje přes 20 lokálních jazykových modelů napříč 8 různými akcelerátory (včetně těch od Applu, AMD a Nvidie) na 1 milionu reálných jednokolových chatovacích a logických dotazů . Hlavní výsledky jsou ohromující:
IPW je elegantně jednoduchá: dělí přesnost, které model dosahuje na daném úkolu, výkonem, který spotřebuje během inference . To je v kontrastu s běžnou praxí hodnocení AI modelů izolovaně, kdy se ignorují energetické náklady a硬warové požadavky.
Metrika zachycuje klíčový postřeh: nejschopnější model není nutně ten nejefektivnější nebo nejpraktičtější. Malý model běžící na notebooku může poskytnout 95 % přesnosti obřího cloudového modelu, přitom spotřebuje zlomek energie .
Jeden z finančně nejvýznamnějších nálezů studie se týká toho, co se stane, když si nevybíráte mezi lokálním a cloudovým řešením – ale použijete obojí inteligentně.
„Oracle routing“, hypotetický dokonalý systém, který přiřadí každý dotaz nejmenšímu schopnému modelu, by mohl teoreticky snížit spotřebu energie o 80,4 %, výpočetní výkon o 77,3 % a náklady o 73,8 % ve srovnání s čistě cloudovým nasazením .
Praktický, realistický směrovač testovaný v souvisejícím výzkumu dosáhl podobných výsledků: snížil spotřebu energie o 77,1 %, výpočetní výkon o 67,1 % a náklady o 60,2 % při reálném rozložení provozu, a to vše při zachování srovnatelné přesnosti úloh .
To není futuristická možnost. Výzkum dokazuje, že hybridní lokálně-cloudové architektury jsou již nyní životaschopné a mohou dramaticky snížit náklady na poskytování AI inference.
Studie Stanfordu neobsahuje explicitní finanční předpovědi pro žádnou společnost. Trajektorie, kterou dokumentuje, má však jasné a strukturální důsledky pro společnosti závislé na cloudových API .
Lokální modely již pokrývají přibližně 89 % jednokolových dotazů za dramaticky nižších nákladů . IPW se zlepšila 5,3× za pouhé dva roky a tempo zrychluje
. Chytré směrování by mohlo snížit náklady na cloudovou inferenci o 60 % nebo více u zbývajících dotazů odesílaných do cloudu
.
Pokud se tento trend začne ve velkém uplatňovat v praxi, zákazníci by mohli nahradit většinu svých dotazů na cloudová API téměř bezplatnou lokální inferencí a cloudová volání by si vyhradili pouze pro nejtěžších ~11 % úkolů, které lokální modely zatím nezvládnou .
Komentáře interpretující studii poznamenaly, že budoucnost AI může být ve znamení „malých, levných a nerentabilních“ modelů pro společnosti na hraně možností . Ekonomická motivace se přesouvá k lokálním alternativám s otevřenou vahou, které podrážejí ceny cloudových API – dynamika, která by mohla přetvořit obchodní modely společností jako OpenAI, Anthropic a xAI.
Tato studie je jedním z mnoha bodů v širším trendu. Zpráva AI Index 2025 ze Stanford HAI zjistila, že náklady na inferenci systému na úrovni GPT-3.5 klesly mezi listopadem 2022 a říjnem 2024 více než 280krát . Na硬warové úrovni náklady klesají ročně o 30 %, zatímco energetická účinnost se každoročně zlepšuje o 40 %
.
Modely s otevřenou vahou rovněž stahují náskok uzavřených modelů; na některých benchmarkech se rozdíl ve výkonu zmenšil z 8 % na pouhých 1,7 % během jediného roku .
Ačkoli jsou výsledky působivé, je důležité si uvědomit rozsah studie. Testuje pouze jednokolové dotazy – jednoduché chatovací odpovědi a samostatné logické úlohy. Nehodnotí lokální modely na vícekolových konverzacích, logice s dlouhým kontextem nebo složitých agentních pracovních postupech, ve všech oblastech, kde si cloudové modely udržují výraznou výhodu .
Testované lokální modely (≤20 mld. parametrů) se také nemohou rovnat těm nejlepším cloudovým modelům v nejtěžších problémech. Autoři studie to jasně uvádějí: přesnost se výrazně liší podle domény a číslo 88,7 % maskuje slabší výkon v technických a vědeckých oblastech .
Studie „Inteligence na watt“ ze Stanfordu poskytuje silný empirický důkaz, že lokální AI překročila kritickou hranici. Pro většinu každodenních dotazů – kreativní úkoly, řízení, prodej, zábava – je malý model na notebooku již zcela dostačující . Rychlé tempo zlepšování naznačuje, že se toto pokrytí bude jen rozšiřovat.
Pro firmy je závěr jasný: nákladově nejefektivnější AI infrastrukturou je stále častěji hybridní řešení, které směruje jednoduché dotazy na lokální modely a cloudovou kapacitu si vyhrazuje pro ty nejtěžší úkoly. Éra posílání každého dotazu masivnímu cloudovému modelu za poplatek za token se možná chýlí ke konci.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Malé lokální jazykové modely (≤20 mld. parametrů) na běžných noteboocích a desktoppech nyní zvládnou správně zodpovědět 88,7 % jednokolových chatovacích a logických dotazů, ukazuje rozsáhlá předtisková studie Stanford...
Malé lokální jazykové modely (≤20 mld. parametrů) na běžných noteboocích a desktoppech nyní zvládnou správně zodpovědět 88,7 % jednokolových chatovacích a logických dotazů, ukazuje rozsáhlá předtisková studie Stanford... Podíl dotazů, které lokální modely zvládnou, vzrostl z pouhých 23,2 % v roce 2023 na 71,3 % v roce 2025, tedy 3,1násobné zvýšení pokrytí.
Chytré směrování dotazů („oracle routing“), které přiřadí každý požadavek nejmenšímu schopnému modelu, může snížit náklady na cloudovou inferenci o 60,2 % při zachování srovnatelné přesnosti.