Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning. Platformen blev lanceret 24.
Udgivet afBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette er Liquid AI’s gratis open source-platform til at måle, hvordan AI-modeller fungerer, når de kører direkte på en enhed. Den blev lanceret 24. august i samarbejde med Artificial Analysis. 9
11
Det centrale er, at Pipette ikke reducerer en AI-test til ét tal for modellen. I stedet vurderer den hele implementeringen: modellen, dens kvantiseringsformat, den valgte runtime, den konkrete enhed og den arbejdsbelastning, der bruges i testen. 4
11
Den offentlige udgivelse indeholder et datasæt med mere end 1.000 laboratorieverificerede konfigurationer og fem målepunkter for lokal inferens. Ranglisten dækker over 30 modeller, syv kvantiseringsmuligheder og fire indledende enheder. 4
11
Målingerne omfatter blandt andet:
Det betyder, at en høj genereringshastighed ikke nødvendigvis er nok til at vinde en sammenligning. En model kan for eksempel generere mange tokens i sekundet, men bruge mere hukommelse eller være langsommere om at levere det første svar. 4
11
Pipette har klienter til både iOS og Android. Modellerne downloades til enheden og testes lokalt, så målingen handler om telefonens eller computerens faktiske ydelse – ikke om forbindelsen til en ekstern server. Den første modelpulje omfatter Liquid AI’s LFM-familie samt mindre tredjepartsmodeller som Gemma og Nanbeige. 8
10
Liquid AI’s modelbibliotek indeholder modeller med kontekstvinduer på 32.000 tokens og i ét tilfælde 128.000 tokens. Det er dog modelkapaciteter og ikke nødvendigvis den standardiserede arbejdsbelastning, som bruges i Pipettes første sammenligninger. 2
Kvantisering reducerer præcisionen i en models talrepræsentation for at gøre modellen mindre og lettere at køre lokalt. Det kan sænke hukommelseskravene, men påvirker samtidig den konkrete balance mellem hastighed, kvalitet og kompatibilitet.
Artificial Analysis’ mobilevaluering fokuserede på modeller, der kunne være inden for 8 GB ved 4-bit-kvantisering. Her blev kontekstlængden begrænset til 16.000 tokens. 8
9
Pipettes offentlige inferensdatasæt beskriver derudover kontekster fra 256 til 8.192 tokens i de publicerede konfigurationer. Derfor bør man ikke blande en models maksimale kontekstvindue sammen med den kontekstgrænse, der bruges i en bestemt benchmarktest. 11
Pipettes vigtigste bidrag er ikke kun selve ranglisten, men metoden bag den. Resultaterne er knyttet til en fuldt beskrevet konfiguration, kommer fra verificerede laboratoriekørsler og ledsages af offentliggjorte testprotokoller. 4
11
Platformen fastlåser også bestemte softwareafhængigheder. De aktuelle offentlige ydelsesresultater kræver eksempelvis specifikke builds af llama.cpp, blandt andet b10216 og b10516. Det mindsker risikoen for, at forskelle mellem runtime-versioner skjuler sig i sammenligningen. 6
Det er mere informativt end at sammenligne en leverandørs isolerede tal for “tokens pr. sekund”. Men det fjerner ikke al variation. Temperatur, operativsystemets tilstand, den konkrete model af enheden, mængden af RAM, backend, strømforbrug og længere tids belastning kan stadig påvirke resultatet.
For at to resultater reelt kan sammenlignes, skal de relevante felter derfor matche – især model, kvantisering, runtime, enhed og arbejdsbelastning.
Et iPhone 17 Pro-resultat på 48,37 genereringstokens i sekundet for Gemma 4 E2B i 4-bit-format via Apple MLX er stærkt for netop den opsætning. Det bør læses som “Gemma 4 E2B + 4-bit + MLX/Metal + iPhone 17 Pro” og ikke som en universel score for alle Gemma-modeller eller alle telefoner. 4
5
I Artificial Analysis’ mobilevaluering med en kontekstgrænse på 16.000 tokens delte Nanbeige4.2-3B og LFM2.5-2.6B førstepladsen med en gennemsnitlig score på 63. 8
9
Der er dog en vigtig forskel mellem platformene:
Det gør de første iPhone-versus-Android-tal mindre egnede som direkte sammenligning af selve mobilchipsene. Apple-resultater kan drage fordel af GPU-acceleration, mens Android-resultaterne afspejler CPU-inferens. Android-tallene kan stadig sige noget om CPU-ydelse og brugeroplevelsen med denne backend, men de beviser ikke, at den samlede lokale AI-hardware i den ene telefon er hurtigere end i den anden. 4
10
Android-resultater med NPU- eller tilsvarende GPU-acceleration vil være nødvendige, hvis platformene skal sammenlignes mere retfærdigt.
Pipette lanceres på et tidspunkt, hvor chipproducenter fremhæver hurtigere lokale og agentiske AI-arbejdsbelastninger. Qualcomm oplyser, at Snapdragon 8 Elite Gen 5’s tredje generation af Oryon-CPU’en når op på 4,74 GHz. Qualcomm hævder desuden 20 procent højere CPU-ydelse og 35 procent bedre CPU-strømeffektivitet for platformen. 14
Qualcomm har separat forhåndsannonceret en efterfølgende Snapdragon-topmodel med en Oryon-CPU, der sigter mod 5 GHz, samt en FlexCache-arkitektur, som dynamisk deler cache mellem kernerne. Det peger på en branche, der forsøger at gøre lokal AI hurtigere og mere responsiv. 9
13
Men clockfrekvens alene fortæller ikke, hvor hurtigt en sprogmodel kører. Runtime, hukommelsesbåndbredde, cacheadfærd, kvantisering, GPU- eller NPU-backend, temperatur og grænser for vedvarende strømforbrug spiller også en rolle.
Liquid AI har meldt ud, at platformen skal udvides med flere enheder og test af NPU-acceleration. Det vil gøre Pipette mere nyttig, fordi den kan skelne mellem gevinster fra CPU, GPU og NPU under sammenlignelige arbejdsbelastninger. Indtil da er den mest forsigtige konklusion, at Pipette er et gennemsigtigt værktøj til at benchmarke komplette lokale AI-opsætninger – ikke en endelig rangliste over mobilhardware. 4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning.
Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning. Platformen blev lanceret 24. august i samarbejde med Artificial Analysis og kombinerer målinger af inferens med evaluering af modellernes kvalitet på mobilen.
Den offentlige database indeholder mere end 1.000 laboratorieverificerede konfigurationer og dækker over 30 modeller, syv kvantiseringsmuligheder og fire indledende enheder.
Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning. Platformen blev lanceret 24.
Udgivet afBilleder genereret med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette er Liquid AI’s gratis open source-platform til at måle, hvordan AI-modeller fungerer, når de kører direkte på en enhed. Den blev lanceret 24. august i samarbejde med Artificial Analysis. 9
11
Det centrale er, at Pipette ikke reducerer en AI-test til ét tal for modellen. I stedet vurderer den hele implementeringen: modellen, dens kvantiseringsformat, den valgte runtime, den konkrete enhed og den arbejdsbelastning, der bruges i testen. 4
11
Den offentlige udgivelse indeholder et datasæt med mere end 1.000 laboratorieverificerede konfigurationer og fem målepunkter for lokal inferens. Ranglisten dækker over 30 modeller, syv kvantiseringsmuligheder og fire indledende enheder. 4
11
Målingerne omfatter blandt andet:
Det betyder, at en høj genereringshastighed ikke nødvendigvis er nok til at vinde en sammenligning. En model kan for eksempel generere mange tokens i sekundet, men bruge mere hukommelse eller være langsommere om at levere det første svar. 4
11
Pipette har klienter til både iOS og Android. Modellerne downloades til enheden og testes lokalt, så målingen handler om telefonens eller computerens faktiske ydelse – ikke om forbindelsen til en ekstern server. Den første modelpulje omfatter Liquid AI’s LFM-familie samt mindre tredjepartsmodeller som Gemma og Nanbeige. 8
10
Liquid AI’s modelbibliotek indeholder modeller med kontekstvinduer på 32.000 tokens og i ét tilfælde 128.000 tokens. Det er dog modelkapaciteter og ikke nødvendigvis den standardiserede arbejdsbelastning, som bruges i Pipettes første sammenligninger. 2
Kvantisering reducerer præcisionen i en models talrepræsentation for at gøre modellen mindre og lettere at køre lokalt. Det kan sænke hukommelseskravene, men påvirker samtidig den konkrete balance mellem hastighed, kvalitet og kompatibilitet.
Artificial Analysis’ mobilevaluering fokuserede på modeller, der kunne være inden for 8 GB ved 4-bit-kvantisering. Her blev kontekstlængden begrænset til 16.000 tokens. 8
9
Pipettes offentlige inferensdatasæt beskriver derudover kontekster fra 256 til 8.192 tokens i de publicerede konfigurationer. Derfor bør man ikke blande en models maksimale kontekstvindue sammen med den kontekstgrænse, der bruges i en bestemt benchmarktest. 11
Pipettes vigtigste bidrag er ikke kun selve ranglisten, men metoden bag den. Resultaterne er knyttet til en fuldt beskrevet konfiguration, kommer fra verificerede laboratoriekørsler og ledsages af offentliggjorte testprotokoller. 4
11
Platformen fastlåser også bestemte softwareafhængigheder. De aktuelle offentlige ydelsesresultater kræver eksempelvis specifikke builds af llama.cpp, blandt andet b10216 og b10516. Det mindsker risikoen for, at forskelle mellem runtime-versioner skjuler sig i sammenligningen. 6
Det er mere informativt end at sammenligne en leverandørs isolerede tal for “tokens pr. sekund”. Men det fjerner ikke al variation. Temperatur, operativsystemets tilstand, den konkrete model af enheden, mængden af RAM, backend, strømforbrug og længere tids belastning kan stadig påvirke resultatet.
For at to resultater reelt kan sammenlignes, skal de relevante felter derfor matche – især model, kvantisering, runtime, enhed og arbejdsbelastning.
Et iPhone 17 Pro-resultat på 48,37 genereringstokens i sekundet for Gemma 4 E2B i 4-bit-format via Apple MLX er stærkt for netop den opsætning. Det bør læses som “Gemma 4 E2B + 4-bit + MLX/Metal + iPhone 17 Pro” og ikke som en universel score for alle Gemma-modeller eller alle telefoner. 4
5
I Artificial Analysis’ mobilevaluering med en kontekstgrænse på 16.000 tokens delte Nanbeige4.2-3B og LFM2.5-2.6B førstepladsen med en gennemsnitlig score på 63. 8
9
Der er dog en vigtig forskel mellem platformene:
Det gør de første iPhone-versus-Android-tal mindre egnede som direkte sammenligning af selve mobilchipsene. Apple-resultater kan drage fordel af GPU-acceleration, mens Android-resultaterne afspejler CPU-inferens. Android-tallene kan stadig sige noget om CPU-ydelse og brugeroplevelsen med denne backend, men de beviser ikke, at den samlede lokale AI-hardware i den ene telefon er hurtigere end i den anden. 4
10
Android-resultater med NPU- eller tilsvarende GPU-acceleration vil være nødvendige, hvis platformene skal sammenlignes mere retfærdigt.
Pipette lanceres på et tidspunkt, hvor chipproducenter fremhæver hurtigere lokale og agentiske AI-arbejdsbelastninger. Qualcomm oplyser, at Snapdragon 8 Elite Gen 5’s tredje generation af Oryon-CPU’en når op på 4,74 GHz. Qualcomm hævder desuden 20 procent højere CPU-ydelse og 35 procent bedre CPU-strømeffektivitet for platformen. 14
Qualcomm har separat forhåndsannonceret en efterfølgende Snapdragon-topmodel med en Oryon-CPU, der sigter mod 5 GHz, samt en FlexCache-arkitektur, som dynamisk deler cache mellem kernerne. Det peger på en branche, der forsøger at gøre lokal AI hurtigere og mere responsiv. 9
13
Men clockfrekvens alene fortæller ikke, hvor hurtigt en sprogmodel kører. Runtime, hukommelsesbåndbredde, cacheadfærd, kvantisering, GPU- eller NPU-backend, temperatur og grænser for vedvarende strømforbrug spiller også en rolle.
Liquid AI har meldt ud, at platformen skal udvides med flere enheder og test af NPU-acceleration. Det vil gøre Pipette mere nyttig, fordi den kan skelne mellem gevinster fra CPU, GPU og NPU under sammenlignelige arbejdsbelastninger. Indtil da er den mest forsigtige konklusion, at Pipette er et gennemsigtigt værktøj til at benchmarke komplette lokale AI-opsætninger – ikke en endelig rangliste over mobilhardware. 4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning.
Pipette måler en komplet lokal AI opsætning – ikke blot en enkelt models hastighed – på tværs af model, kvantisering, runtime, enhed og arbejdsbelastning. Platformen blev lanceret 24. august i samarbejde med Artificial Analysis og kombinerer målinger af inferens med evaluering af modellernes kvalitet på mobilen.
Den offentlige database indeholder mere end 1.000 laboratorieverificerede konfigurationer og dækker over 30 modeller, syv kvantiseringsmuligheder og fire indledende enheder.