Pipette måler en komplett lokal KI konfigurasjon: modell, kvantisering, kjøretid, enhet og arbeidsbelastning – ikke bare selve modellen. Plattformen ble lansert 24.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette er Liquid AIs gratis og åpne benchmarkplattform for lokal KI. Den er laget for å måle hvordan en faktisk utrulling fungerer på en bestemt enhet – ikke bare hvor god en modell ser ut på papiret. Derfor vurderes kombinasjonen av modell, kvantisering, kjøretid, maskinvare og arbeidsbelastning samlet. Plattformen ble lansert 24. august i samarbeid med Artificial Analysis. Liquid AI står for inferensmålingene, mens Artificial Analysis bidrar med evaluering av modellenes praktiske KI-egenskaper på mobile enheter. 119
Den offentlige lanseringen inkluderer et laboratorieverifisert datasett med mer enn 1 000 konfigurasjoner og fem ytelsesmål for lokal KI. Resultatlisten dekker over 30 modeller, sju kvantiseringsalternativer og fire innledende enheter. 114
Pipette tester modeller som er lastet ned til enheten og kjøres lokalt. Det finnes klienter for både iOS og Android. Modellutvalget omfatter Liquid AIs egne LFM-modeller samt mindre tredjepartsmodeller som Gemma og Nanbeige. I sammenligningen av KI-egenskaper ble modellene begrenset til dem som får plass innenfor 8 GB ved 4-biters kvantisering. 108
Målingene ser blant annet på:
Det betyr at høy genereringshastighet alene ikke nødvendigvis gir best resultat. En modell kan for eksempel generere mange token per sekund, men bruke lang tid på å starte eller kreve uvanlig mye minne.
Den publiserte testen av mobile KI-egenskaper bruker en kontekstgrense på 16 000 token. Det er viktig å skille denne standardiserte testinnstillingen fra modellens maksimale kapasitet. Liquid AIs LFM-katalog oppgir 32 000 token for mange modeller og 128 000 token for LFM2.5-8B-A1B, men det betyr ikke at disse grensene brukes i den første, sammenlignbare benchmarken. 82
Ytelsesdatasettet fra Pipette beskrives også med kontekstlengder fra 256 til 8 192 token, avhengig av konfigurasjon og arbeidsbelastning. 11
Det mest interessante ved Pipette er metoden. Resultatene knyttes til et konkret, komplett oppsett og kommer fra verifiserte laboratoriekjøringer med offentliggjorte prosedyrer. Plattformen låser dessuten programvareavhengigheter. De offentlige ytelsesresultatene krever for eksempel bestemte versjoner av llama.cpp, blant annet byggene b10216 og b10516. 4116
Det gjør sammenligningen mer etterprøvbar enn et enkelt tall fra en produsent, som «50 token per sekund». Samtidig fjerner det ikke all variasjon. Temperatur, operativsystemets tilstand, modell av telefonen, mengden RAM, valgt backend og strømbegrensninger kan påvirke resultatet. To resultater bør derfor ikke regnes som direkte sammenlignbare før disse faktorene samsvarer.
Et oppgitt resultat på 48,37 genererte token per sekund på en iPhone 17 Pro, med Gemma 4 E2B i 4-biters format gjennom Apple MLX, er sterkt for akkurat denne konfigurasjonen. Tallet bør leses som «Gemma 4 E2B + 4-biters kvantisering + MLX/Metal + iPhone 17 Pro» – ikke som en universell poengsum for alle Gemma-versjoner eller alle telefoner. 45
I testen av mobile KI-egenskaper, med 16 000 token som kontekstgrense, delte Nanbeige4.2-3B og LFM2.5-2.6B førsteplassen med en gjennomsnittsscore på 63. 98
Det er imidlertid en vesentlig forskjell mellom plattformene:
Dermed er dagens tall for iPhone og Android ikke en ren sammenligning av mobilbrikker. Apple-resultater kan inkludere GPU-akselerasjon, mens Android-resultatene gjenspeiler inferens på CPU. Android-tallene kan fortsatt si noe om CPU-ytelse og brukeropplevelse med den aktuelle kjøremotoren, men de beviser ikke at den totale lokale KI-maskinvaren i én telefon er raskere enn i en annen. 104
For en mer rettferdig sammenligning på tvers av plattformene trengs Android-backend som også utnytter NPU eller tilsvarende akselerasjon.
Lanseringen kommer samtidig som brikkeprodusenter satser på raskere lokal og agentbasert KI. Qualcomm oppgir at tredje generasjon av Oryon CPU i Snapdragon 8 Elite Gen 5 kan nå 4,74 GHz, og hevder samtidig 20 prosent høyere CPU-ytelse og 35 prosent bedre CPU-energieffektivitet for plattformen. 14
Qualcomm har også forhåndsvist en etterfølgende Snapdragon-flaggskipplattform med en Oryon CPU på opptil 5 GHz og en FlexCache-arkitektur som dynamisk deler hurtigbuffer mellom kjernene. Slike kunngjøringer peker mot raskere og mer responsiv lokal behandling, men klokkehastighet alene sier lite om hvor raskt en stor språkmodell faktisk kjører. Kjøretid, minnebåndbredde, hurtigbuffer, kvantisering, GPU- eller NPU-backend, temperatur og vedvarende strømforbruk spiller også inn. 913
Liquid AI sier at videre utvikling skal gi støtte for flere enheter og NPU-akselererte tester. Det vil gjøre Pipette mer verdifull, fordi plattformen da kan skille mellom forbedringer fra CPU, GPU og NPU under samme arbeidsbelastning. Inntil videre er den mest forsvarlige tolkningen at Pipette er et transparent verktøy for å sammenligne komplette utrullinger – ikke en endelig rangering av hvilken mobilplattform som har den raskeste KI-maskinvaren. 64
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette måler en komplett lokal KI konfigurasjon: modell, kvantisering, kjøretid, enhet og arbeidsbelastning – ikke bare selve modellen.
Pipette måler en komplett lokal KI konfigurasjon: modell, kvantisering, kjøretid, enhet og arbeidsbelastning – ikke bare selve modellen. Plattformen ble lansert 24. august i samarbeid med Artificial Analysis og kombinerer ytelsesmålinger med tester av modellenes praktiske KI egenskaper.
Den offentlige databasen inneholder mer enn 1 000 laboratorieverifiserte konfigurasjoner, over 30 modeller, sju kvantiseringsalternativer og fem ytelsesmål.