Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning.
Publisert avRedigert med GPT-5.6 LunaBilder generert med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette er Liquid AIs åpen kildekode-benchmark for AI-modeller der de faktisk skal brukes: på telefoner, bærbare PC-er, stasjonære maskiner og annen kantmaskinvare. Tjenesten ble lansert i samarbeid med Artificial Analysis 24. august 2026, og måler ikke bare selve modellen. I stedet er det den komplette distribusjonen som testes – modellen, kvantiseringen, kjøremiljøet, enheten og arbeidsbelastningen samlet. 3
1
Mange AI-topplister fokuserer på evner eller oppgir ett enkelt tall for inferenshastighet. Pipette er laget for å vise hvordan hele oppsettet fungerer i praksis. Endrer man kvantisering, kjøremiljø, backend, minnebelastning eller maskinvare, kan resultatet endre seg selv om modellvektene er identiske.
Ved lanseringen fulgte det med et offentlig datasett med laboratorieverifiserte resultater fra mer enn 1 000 kombinasjoner av modell, kvantisering, kjøremiljø, enhet og kontekst. Den første utgaven dekker over 30 modeller, flere kvantiseringsformater og llama.cpp-bygg for macOS, iOS, Windows og Android. De standardiserte ytelsesmålingene bruker kontekstlengder fra 256 til 8 192 token. 3
Pipettes inferensmålinger kombineres med Artificial Analysis’ vurdering av hvor intelligente modellene er på mobilmaskinvare. Samarbeidet ser dermed både på hvor godt en modell løser oppgaver, og hvor raskt og effektivt det konkrete oppsettet kjører. 33
Pipette har egne iOS- og Android-klienter som kan kjøre modeller lokalt på en smarttelefon. Den bredere benchmark-dekningen omfatter også macOS og Windows gjennom støttede kjøremiljøer. Blant referanseenhetene i lanseringsmaterialet finner vi iPhone 17 Pro, Galaxy S26 Ultra og MacBook Pro med M5 Max-brikke. 3
38
Modellene må lastes ned til enheten før testen kan starte. Pipette måler derfor lokal inferens – ikke forsinkelsen i et skybasert API. 41
50
Topplisten inneholder Liquid AIs egen LFM2.5-familie samt modeller fra andre utviklere. Eksempler er Gemma, Nanbeige, Granite, Qwen og flere små eller komprimerte modellvarianter. 9
41
Benchmarken støtter flere kvantiseringsformater. Sammenligningen av mobilintelligens konsentrerte seg om modeller som får plass innenfor 8 GB når de kvantiseres til 4 bit, noe som gjør testen relevant for telefoner med begrenset minne. 3
41
For lokal kjøring skiller Liquid mellom GGUF, som ofte brukes med llama.cpp på CPU- og GPU-plattformer, og MLX-formatet, som er utviklet for Apple Silicon. 47 Filstørrelsen til en kvantisert modell er likevel bare én del av regnestykket. Kjøremiljøet og maskinvarebackend-en avgjør hvordan modellen faktisk behandles.
Datasettet fra lanseringen rapporterer standardiserte inferensoppsett med kontekstlengder fra 256 til 8 192 token. 3 Den separate Artificial Analysis-testen av mobilintelligens bruker en grense på 16K token.
33
Dette må ikke forveksles med modellens maksimale annonserte kontekstvindu. Liquid oppgir 32K token for mange LFM-modeller og 128K for LFM2.5-8B-A1B, men modellens teoretiske kapasitet betyr ikke at hver telefonbenchmark kjører med maksimal lengde. 47
Pipette kombinerer flere sider ved ytelsen i stedet for å redusere alt til dekoderingshastighet. De fem ytelsesmålingene dekker behandling av ledeteksten eller forhåndsutfylling, genererings- eller dekoderingshastighet, tid til første token, total tid til ferdig svar og minnebruk. 1
3
14
Det er viktig fordi et oppsett kan generere token raskt, men likevel bruke lang tid på å komme i gang, kreve for mye minne eller bli tregere når konteksten vokser. Total svartid er særlig nyttig når man skal vurdere opplevelsen av en lokal assistent slik brukeren faktisk møter den.
Artificial Analysis står for kvalitetsdelen av mobilsammenligningen, med tester av blant annet instruksjonsfølge, verktøybruk, resonnering og andre modellegenskaper. 33
Hvert resultat knyttes til en tydelig definert konfigurasjon, og Pipette publiserer protokollene som er brukt for å produsere de verifiserte dataene. Det offentlige dashbordet skiller mellom toppliste, detaljerte resultater og innsendte målinger. Dermed kan man undersøke de underliggende benchmark-radene i stedet for bare å stole på en overskrift eller rangering. 1
Metoden registrerer også avhengigheter i kjøremiljøet. Liquid opplyser for eksempel at dagens offentlige ytelsesresultater krever bestemte llama.cpp-bygg, blant annet b10216 og b10516. 2 Ved å låse programvareversjonen blir det vanskeligere å forveksle endringer i programvaren med forbedringer i maskinvare eller modell.
Dette gjør resultatene mer sammenlignbare, men fjerner ikke alle variasjoner. Temperaturbegrensning, operativsystemets tilstand, tilgjengelig enhetsminne, fastvare, valgt backend og vedvarende strømgrenser kan alle påvirke resultatet på en telefon. En måling er mest meningsfull når disse variablene er like.
De første målingene illustrerer hvorfor Pipette rapporterer komplette konfigurasjoner i stedet for å kåre én universell modellvinner.
Hovedpoenget er at kvalitet, hastighet, latenstid og minnebruk kan trekke i ulike retninger. Den raskeste modellen er ikke nødvendigvis den mest kapable, og modellen med høyest kvalitetsscore er ikke automatisk det beste valget på en telefon.
Den viktigste begrensningen i den første mobilutgaven er forskjellen mellom klientene. iOS-versjonen kan bruke GPU-beregning gjennom Apples Metal-økosystem, blant annet via MLX. Android-versjonen var i utgangspunktet begrenset til inferens på CPU. 41
50
Dermed er ikke et iPhone-resultat med MLX/Metal og et Android-resultat fra en CPU-test en ren sammenligning av telefonenes samlede AI-maskinvare. iPhone-målingen kan dra nytte av GPU-akselerasjon, mens Android-målingen viser ytelsen til CPU-løsningen som den nåværende klienten eksponerer.
Android-resultatene er fortsatt nyttige for å forstå lokal inferens på CPU og brukeropplevelsen med denne implementasjonen. De bør likevel ikke brukes til å slå fast at én telefons samlede AI-brikke er raskere enn en annens før tilsvarende GPU- eller NPU-backend-er testes med samme arbeidsbelastning.
Pipette kommer samtidig som brikkeprodusenter markedsfører raskere lokal og såkalt agentisk AI. Qualcomms Snapdragon 8 Elite Gen 5-plattform bruker en tredje generasjon Oryon-CPU med klokkehastighet på opptil 4,74 GHz, og selskapet hevder 20 prosent høyere CPU-ytelse samt 35 prosent bedre energieffektivitet for CPU-en. 24
Qualcomm har også forhåndsvist en senere flaggskipplattform med en Oryon-CPU som sikter mot 5 GHz, samt FlexCache-arkitekturen, der heterogene CPU-kjerner kan dele en dynamisk tildelt hurtigbuffer. 23
Spesifikasjonene viser hvorfor lokal AI er i ferd med å bli en maskinvarekonkurranse. Men klokkehastighet alene sier lite om ytelsen i en språkmodell. Kvantisering, minnebåndbredde, hurtigbuffer, kjøremiljø, bruk av GPU eller NPU, temperatur og vedvarende strømforbruk kan være minst like viktig.
Det er her Pipettes konfigurasjonsbaserte metode blir interessant. På lengre sikt kan benchmarken vise om en lovet brikkeforbedring faktisk gir raskere, mer responsiv og mer minneeffektiv lokal AI under en reproduserbar arbeidsbelastning. Foreløpig bør Pipette først og fremst forstås som en åpen og etterprøvbar benchmark av en komplett AI-distribusjon – ikke som en endelig rangering av iPhone mot Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning.
Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning. Benchmarken har iOS og Android apper, lokal modellkjøring, flere kvantiseringsformater og llama.cpp bygg for macOS, iOS, Windows og Android.
De første testene ga Nanbeige4.2 3B og LFM2.5 2.6B delt førsteplass med en gjennomsnittsscore på 63 i en 16K konteksttest.
Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning.
Publisert avRedigert med GPT-5.6 LunaBilder generert med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette er Liquid AIs åpen kildekode-benchmark for AI-modeller der de faktisk skal brukes: på telefoner, bærbare PC-er, stasjonære maskiner og annen kantmaskinvare. Tjenesten ble lansert i samarbeid med Artificial Analysis 24. august 2026, og måler ikke bare selve modellen. I stedet er det den komplette distribusjonen som testes – modellen, kvantiseringen, kjøremiljøet, enheten og arbeidsbelastningen samlet. 3
1
Mange AI-topplister fokuserer på evner eller oppgir ett enkelt tall for inferenshastighet. Pipette er laget for å vise hvordan hele oppsettet fungerer i praksis. Endrer man kvantisering, kjøremiljø, backend, minnebelastning eller maskinvare, kan resultatet endre seg selv om modellvektene er identiske.
Ved lanseringen fulgte det med et offentlig datasett med laboratorieverifiserte resultater fra mer enn 1 000 kombinasjoner av modell, kvantisering, kjøremiljø, enhet og kontekst. Den første utgaven dekker over 30 modeller, flere kvantiseringsformater og llama.cpp-bygg for macOS, iOS, Windows og Android. De standardiserte ytelsesmålingene bruker kontekstlengder fra 256 til 8 192 token. 3
Pipettes inferensmålinger kombineres med Artificial Analysis’ vurdering av hvor intelligente modellene er på mobilmaskinvare. Samarbeidet ser dermed både på hvor godt en modell løser oppgaver, og hvor raskt og effektivt det konkrete oppsettet kjører. 33
Pipette har egne iOS- og Android-klienter som kan kjøre modeller lokalt på en smarttelefon. Den bredere benchmark-dekningen omfatter også macOS og Windows gjennom støttede kjøremiljøer. Blant referanseenhetene i lanseringsmaterialet finner vi iPhone 17 Pro, Galaxy S26 Ultra og MacBook Pro med M5 Max-brikke. 3
38
Modellene må lastes ned til enheten før testen kan starte. Pipette måler derfor lokal inferens – ikke forsinkelsen i et skybasert API. 41
50
Topplisten inneholder Liquid AIs egen LFM2.5-familie samt modeller fra andre utviklere. Eksempler er Gemma, Nanbeige, Granite, Qwen og flere små eller komprimerte modellvarianter. 9
41
Benchmarken støtter flere kvantiseringsformater. Sammenligningen av mobilintelligens konsentrerte seg om modeller som får plass innenfor 8 GB når de kvantiseres til 4 bit, noe som gjør testen relevant for telefoner med begrenset minne. 3
41
For lokal kjøring skiller Liquid mellom GGUF, som ofte brukes med llama.cpp på CPU- og GPU-plattformer, og MLX-formatet, som er utviklet for Apple Silicon. 47 Filstørrelsen til en kvantisert modell er likevel bare én del av regnestykket. Kjøremiljøet og maskinvarebackend-en avgjør hvordan modellen faktisk behandles.
Datasettet fra lanseringen rapporterer standardiserte inferensoppsett med kontekstlengder fra 256 til 8 192 token. 3 Den separate Artificial Analysis-testen av mobilintelligens bruker en grense på 16K token.
33
Dette må ikke forveksles med modellens maksimale annonserte kontekstvindu. Liquid oppgir 32K token for mange LFM-modeller og 128K for LFM2.5-8B-A1B, men modellens teoretiske kapasitet betyr ikke at hver telefonbenchmark kjører med maksimal lengde. 47
Pipette kombinerer flere sider ved ytelsen i stedet for å redusere alt til dekoderingshastighet. De fem ytelsesmålingene dekker behandling av ledeteksten eller forhåndsutfylling, genererings- eller dekoderingshastighet, tid til første token, total tid til ferdig svar og minnebruk. 1
3
14
Det er viktig fordi et oppsett kan generere token raskt, men likevel bruke lang tid på å komme i gang, kreve for mye minne eller bli tregere når konteksten vokser. Total svartid er særlig nyttig når man skal vurdere opplevelsen av en lokal assistent slik brukeren faktisk møter den.
Artificial Analysis står for kvalitetsdelen av mobilsammenligningen, med tester av blant annet instruksjonsfølge, verktøybruk, resonnering og andre modellegenskaper. 33
Hvert resultat knyttes til en tydelig definert konfigurasjon, og Pipette publiserer protokollene som er brukt for å produsere de verifiserte dataene. Det offentlige dashbordet skiller mellom toppliste, detaljerte resultater og innsendte målinger. Dermed kan man undersøke de underliggende benchmark-radene i stedet for bare å stole på en overskrift eller rangering. 1
Metoden registrerer også avhengigheter i kjøremiljøet. Liquid opplyser for eksempel at dagens offentlige ytelsesresultater krever bestemte llama.cpp-bygg, blant annet b10216 og b10516. 2 Ved å låse programvareversjonen blir det vanskeligere å forveksle endringer i programvaren med forbedringer i maskinvare eller modell.
Dette gjør resultatene mer sammenlignbare, men fjerner ikke alle variasjoner. Temperaturbegrensning, operativsystemets tilstand, tilgjengelig enhetsminne, fastvare, valgt backend og vedvarende strømgrenser kan alle påvirke resultatet på en telefon. En måling er mest meningsfull når disse variablene er like.
De første målingene illustrerer hvorfor Pipette rapporterer komplette konfigurasjoner i stedet for å kåre én universell modellvinner.
Hovedpoenget er at kvalitet, hastighet, latenstid og minnebruk kan trekke i ulike retninger. Den raskeste modellen er ikke nødvendigvis den mest kapable, og modellen med høyest kvalitetsscore er ikke automatisk det beste valget på en telefon.
Den viktigste begrensningen i den første mobilutgaven er forskjellen mellom klientene. iOS-versjonen kan bruke GPU-beregning gjennom Apples Metal-økosystem, blant annet via MLX. Android-versjonen var i utgangspunktet begrenset til inferens på CPU. 41
50
Dermed er ikke et iPhone-resultat med MLX/Metal og et Android-resultat fra en CPU-test en ren sammenligning av telefonenes samlede AI-maskinvare. iPhone-målingen kan dra nytte av GPU-akselerasjon, mens Android-målingen viser ytelsen til CPU-løsningen som den nåværende klienten eksponerer.
Android-resultatene er fortsatt nyttige for å forstå lokal inferens på CPU og brukeropplevelsen med denne implementasjonen. De bør likevel ikke brukes til å slå fast at én telefons samlede AI-brikke er raskere enn en annens før tilsvarende GPU- eller NPU-backend-er testes med samme arbeidsbelastning.
Pipette kommer samtidig som brikkeprodusenter markedsfører raskere lokal og såkalt agentisk AI. Qualcomms Snapdragon 8 Elite Gen 5-plattform bruker en tredje generasjon Oryon-CPU med klokkehastighet på opptil 4,74 GHz, og selskapet hevder 20 prosent høyere CPU-ytelse samt 35 prosent bedre energieffektivitet for CPU-en. 24
Qualcomm har også forhåndsvist en senere flaggskipplattform med en Oryon-CPU som sikter mot 5 GHz, samt FlexCache-arkitekturen, der heterogene CPU-kjerner kan dele en dynamisk tildelt hurtigbuffer. 23
Spesifikasjonene viser hvorfor lokal AI er i ferd med å bli en maskinvarekonkurranse. Men klokkehastighet alene sier lite om ytelsen i en språkmodell. Kvantisering, minnebåndbredde, hurtigbuffer, kjøremiljø, bruk av GPU eller NPU, temperatur og vedvarende strømforbruk kan være minst like viktig.
Det er her Pipettes konfigurasjonsbaserte metode blir interessant. På lengre sikt kan benchmarken vise om en lovet brikkeforbedring faktisk gir raskere, mer responsiv og mer minneeffektiv lokal AI under en reproduserbar arbeidsbelastning. Foreløpig bør Pipette først og fremst forstås som en åpen og etterprøvbar benchmark av en komplett AI-distribusjon – ikke som en endelig rangering av iPhone mot Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning.
Pipette ble lansert 24. august 2026 og måler hele distribusjonen: modell, kvantisering, kjøremiljø, enhet og arbeidsbelastning. Benchmarken har iOS og Android apper, lokal modellkjøring, flere kvantiseringsformater og llama.cpp bygg for macOS, iOS, Windows og Android.
De første testene ga Nanbeige4.2 3B og LFM2.5 2.6B delt førsteplass med en gjennomsnittsscore på 63 i en 16K konteksttest.