Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter. Benchmarken omfattar över 1 000 verifierade konfigurationer, fler än 30 modeller, flera kvantiseringsformat och llama.cpp på macOS, iOS, Windows och Android.
Publicerad avRedigerad med GPT-5.6 LunaBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI:s Pipette är en öppen benchmarksvit för att testa AI där modellerna faktiskt körs: på mobiler, bärbara datorer, pc-datorer och annan edge-hårdvara. Tjänsten lanserades den 24 augusti i samarbete med Artificial Analysis och gör själva installationen – inte enbart modellen – till måttenheten. 3
1
Det innebär att ett resultat alltid kopplas till en bestämd kombination av modell, kvantisering, runtime, enhet och arbetsbelastning. Samma modell kan därför prestera helt olika beroende på exempelvis minnestryck, programvaruversion, grafikbackend eller vilken processor som används.
Många AI-topplistor fokuserar på förmågor eller anger en enda siffra för inferenshastighet. Pipette försöker i stället beskriva hur hela kedjan fungerar i en verklig lokal installation.
Den första offentliga datamängden innehåller laboratorieverifierade resultat från mer än 1 000 kombinationer av modeller, kvantiseringar, runtime-miljöer, enheter och kontextlängder. Materialet omfattar över 30 modeller, flera kvantiseringsformat och llama.cpp-byggen för macOS, iOS, Windows och Android. De standardiserade mätningarna använder kontextlängder från 256 till 8 192 token. 3
Liquid AI:s inferensmätningar kombineras med Artificial Analysis tester av modellernas intelligens på mobiler. Samarbetet tittar därmed både på hur väl en modell löser uppgifter och på hur snabbt och effektivt den körs i en viss installation. 33
Pipette har inbyggda klienter för iOS och Android, så att modeller kan köras lokalt på en smartphone. Den bredare benchmarken omfattar även macOS och Windows genom stödda runtime-byggen. Bland de referensenheter som nämns i lanseringsmaterialet finns iPhone 17 Pro, Galaxy S26 Ultra och MacBook Pro med M5 Max-chip. 3
38
Modellen måste laddas ner till enheten innan testet startar. Pipette mäter alltså lokal inferens – inte svarstiden hos ett moln-API. 41
50
Topplistan innehåller Liquid AI:s egen LFM2.5-familj tillsammans med modeller från andra utvecklare. Exempel är Gemma, Nanbeige, Granite, Qwen och andra små eller komprimerade modeller. 9
41
Benchmarken stöder flera kvantiseringsformat. I mobiljämförelsen prioriterades modeller som ryms inom 8 GB när de kvantiserats till 4 bitar, vilket gör testet relevant för telefoner med begränsat minne. 3
41
För lokal körning skiljer Liquid AI mellan GGUF, som ofta används med llama.cpp på CPU- och GPU-plattformar, och MLX, som är utformat för distributioner på Apples kretsar. 47 Filstorleken hos en kvantiserad modell berättar dock inte hela historien. Det är samspelet mellan runtime, hårdvara och backend som avgör hur modellen faktiskt bearbetas.
Lanseringsdatasetet innehåller standardiserade inferenskonfigurationer med kontextlängder från 256 till 8 192 token. 3 Artificial Analysis separata intelligensjämförelse för mobiler använder en gräns på 16K token.
33
Det ska inte blandas ihop med modellens maximala angivna kontextfönster. Liquid AI:s dokumentation anger 32K token för många LFM-modeller och 128K för LFM2.5-8B-A1B. Men att en modell klarar en viss längd betyder inte att varje mobiltest körs med hela den kapaciteten. 47
Pipette reducerar inte resultatet till genererade token per sekund, utan kombinerar fem prestandamått: prompt- eller prefill-bearbetning, genererings- eller decode-hastighet, tid till första token, tiden från prompt till komplett svar samt minnesanvändning. 1
3
14
Det är viktigt eftersom en installation kan generera token snabbt men ändå vara långsam innan det första svaret kommer, använda för mycket minne eller tappa fart när kontexten växer. Den totala svarstiden ligger närmare den upplevelse en användare faktiskt får från en lokal assistent.
Artificial Analysis står för kvalitetssidan i mobiljämförelsen, med tester av bland annat instruktionsföljning, verktygsanvändning och resonemang. 33
Varje Pipette-resultat kopplas till en tydligt angiven konfiguration. Liquid AI publicerar också protokollen som används för de verifierade mätningarna. I den offentliga instrumentpanelen skiljs topplistan från detaljerade resultat och inskickade mätningar, så att det går att granska de underliggande benchmarkraderna i stället för att bara lita på en topplacering. 1
Metoden dokumenterar dessutom beroenden till runtime-miljön. Liquid AI uppger exempelvis att aktuella offentliga prestandamätningar kräver särskilda llama.cpp-byggen, däribland b10216 och b10516. 2 Genom att låsa programvaruversionen minskar risken att en förändring i runtime felaktigt tolkas som en förbättring hos modellen eller telefonen.
Det eliminerar inte all variation. Temperatur, strypning vid långvarig belastning, operativsystemets tillstånd, enhetens minne, firmware, vald backend och långvariga effektgränser kan fortfarande påverka resultatet. Två mätningar är mest rättvisa när dessa faktorer är så lika som möjligt.
De första siffrorna visar varför Pipette rapporterar kompletta konfigurationer i stället för att utse en universell vinnare bland modeller och telefoner.
Lärdomen är att kvalitet, hastighet, fördröjning och minnesåtgång kan dra åt olika håll. Den snabbaste modellen är inte automatiskt den mest kapabla, och modellen med högst kvalitetspoäng är inte nödvändigtvis den bästa för en viss telefon.
Den viktigaste begränsningen i den första mobilversionen är skillnaden mellan klienterna. iOS-versionen kan använda GPU-beräkningar genom Apples Metal-ekosystem, inklusive MLX. Android-versionen var däremot inledningsvis begränsad till CPU-inferens. 41
50
Ett iPhone-resultat som använder MLX och Metal och ett Android-resultat från enbart CPU mäter därför inte telefonernas totala AI-hårdvara på ett jämförbart sätt. iPhone-resultatet kan dra nytta av GPU-acceleration, medan Android-resultatet beskriver den CPU-väg som den aktuella klienten exponerar.
Android-resultat är fortfarande användbara för att förstå CPU-baserad lokal inferens och den användarupplevelse som den implementationen ger. De bör däremot inte användas för att slå fast att en telefons totala AI-kisel är snabbare än en annans innan motsvarande GPU- eller NPU-backend testas med samma arbetsbelastning.
Pipette lanseras samtidigt som chiptillverkare lyfter fram snabbare lokal och agentisk AI. Qualcomm uppger att Snapdragon 8 Elite Gen 5 använder en tredje generationens Oryon-processor med klockfrekvenser på upp till 4,74 GHz. Företaget hävdar också 20 procent högre CPU-prestanda och 35 procent bättre energieffektivitet för processorn. 24
Qualcomm har dessutom förhandsvisat en kommande flaggskeppsplattform med en Oryon-processor som siktar på 5 GHz och arkitekturen FlexCache. Den ska låta heterogena CPU-kärnor dela en dynamiskt tilldelad cachepool. 23
Specifikationerna visar varför lokal AI håller på att bli en hårdvarukapplöpning. Men klockfrekvensen ensam förutsäger inte hur snabbt en språkmodell körs. Kvantisering, minnesbandbredd, cachebeteende, runtime, GPU- eller NPU-användning, temperaturer och långvariga effektgränser kan vara minst lika viktiga.
Det är här Pipettes konfigurationsbaserade metod blir intressant. Benchmarkens värde ligger inte i att leverera en slutgiltig ranking mellan iPhone och Android, utan i att visa om ett påstått chiplyft faktiskt ger snabbare, mer responsiv och mer minneseffektiv lokal AI under en reproducerbar arbetsbelastning.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter.
Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter. Benchmarken omfattar över 1 000 verifierade konfigurationer, fler än 30 modeller, flera kvantiseringsformat och llama.cpp på macOS, iOS, Windows och Android.
De fem huvudmåtten är promptbearbetning, genereringshastighet, tid till första token, total svarstid och minnesanvändning.
Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter. Benchmarken omfattar över 1 000 verifierade konfigurationer, fler än 30 modeller, flera kvantiseringsformat och llama.cpp på macOS, iOS, Windows och Android.
Publicerad avRedigerad med GPT-5.6 LunaBilder genererade med GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI:s Pipette är en öppen benchmarksvit för att testa AI där modellerna faktiskt körs: på mobiler, bärbara datorer, pc-datorer och annan edge-hårdvara. Tjänsten lanserades den 24 augusti i samarbete med Artificial Analysis och gör själva installationen – inte enbart modellen – till måttenheten. 3
1
Det innebär att ett resultat alltid kopplas till en bestämd kombination av modell, kvantisering, runtime, enhet och arbetsbelastning. Samma modell kan därför prestera helt olika beroende på exempelvis minnestryck, programvaruversion, grafikbackend eller vilken processor som används.
Många AI-topplistor fokuserar på förmågor eller anger en enda siffra för inferenshastighet. Pipette försöker i stället beskriva hur hela kedjan fungerar i en verklig lokal installation.
Den första offentliga datamängden innehåller laboratorieverifierade resultat från mer än 1 000 kombinationer av modeller, kvantiseringar, runtime-miljöer, enheter och kontextlängder. Materialet omfattar över 30 modeller, flera kvantiseringsformat och llama.cpp-byggen för macOS, iOS, Windows och Android. De standardiserade mätningarna använder kontextlängder från 256 till 8 192 token. 3
Liquid AI:s inferensmätningar kombineras med Artificial Analysis tester av modellernas intelligens på mobiler. Samarbetet tittar därmed både på hur väl en modell löser uppgifter och på hur snabbt och effektivt den körs i en viss installation. 33
Pipette har inbyggda klienter för iOS och Android, så att modeller kan köras lokalt på en smartphone. Den bredare benchmarken omfattar även macOS och Windows genom stödda runtime-byggen. Bland de referensenheter som nämns i lanseringsmaterialet finns iPhone 17 Pro, Galaxy S26 Ultra och MacBook Pro med M5 Max-chip. 3
38
Modellen måste laddas ner till enheten innan testet startar. Pipette mäter alltså lokal inferens – inte svarstiden hos ett moln-API. 41
50
Topplistan innehåller Liquid AI:s egen LFM2.5-familj tillsammans med modeller från andra utvecklare. Exempel är Gemma, Nanbeige, Granite, Qwen och andra små eller komprimerade modeller. 9
41
Benchmarken stöder flera kvantiseringsformat. I mobiljämförelsen prioriterades modeller som ryms inom 8 GB när de kvantiserats till 4 bitar, vilket gör testet relevant för telefoner med begränsat minne. 3
41
För lokal körning skiljer Liquid AI mellan GGUF, som ofta används med llama.cpp på CPU- och GPU-plattformar, och MLX, som är utformat för distributioner på Apples kretsar. 47 Filstorleken hos en kvantiserad modell berättar dock inte hela historien. Det är samspelet mellan runtime, hårdvara och backend som avgör hur modellen faktiskt bearbetas.
Lanseringsdatasetet innehåller standardiserade inferenskonfigurationer med kontextlängder från 256 till 8 192 token. 3 Artificial Analysis separata intelligensjämförelse för mobiler använder en gräns på 16K token.
33
Det ska inte blandas ihop med modellens maximala angivna kontextfönster. Liquid AI:s dokumentation anger 32K token för många LFM-modeller och 128K för LFM2.5-8B-A1B. Men att en modell klarar en viss längd betyder inte att varje mobiltest körs med hela den kapaciteten. 47
Pipette reducerar inte resultatet till genererade token per sekund, utan kombinerar fem prestandamått: prompt- eller prefill-bearbetning, genererings- eller decode-hastighet, tid till första token, tiden från prompt till komplett svar samt minnesanvändning. 1
3
14
Det är viktigt eftersom en installation kan generera token snabbt men ändå vara långsam innan det första svaret kommer, använda för mycket minne eller tappa fart när kontexten växer. Den totala svarstiden ligger närmare den upplevelse en användare faktiskt får från en lokal assistent.
Artificial Analysis står för kvalitetssidan i mobiljämförelsen, med tester av bland annat instruktionsföljning, verktygsanvändning och resonemang. 33
Varje Pipette-resultat kopplas till en tydligt angiven konfiguration. Liquid AI publicerar också protokollen som används för de verifierade mätningarna. I den offentliga instrumentpanelen skiljs topplistan från detaljerade resultat och inskickade mätningar, så att det går att granska de underliggande benchmarkraderna i stället för att bara lita på en topplacering. 1
Metoden dokumenterar dessutom beroenden till runtime-miljön. Liquid AI uppger exempelvis att aktuella offentliga prestandamätningar kräver särskilda llama.cpp-byggen, däribland b10216 och b10516. 2 Genom att låsa programvaruversionen minskar risken att en förändring i runtime felaktigt tolkas som en förbättring hos modellen eller telefonen.
Det eliminerar inte all variation. Temperatur, strypning vid långvarig belastning, operativsystemets tillstånd, enhetens minne, firmware, vald backend och långvariga effektgränser kan fortfarande påverka resultatet. Två mätningar är mest rättvisa när dessa faktorer är så lika som möjligt.
De första siffrorna visar varför Pipette rapporterar kompletta konfigurationer i stället för att utse en universell vinnare bland modeller och telefoner.
Lärdomen är att kvalitet, hastighet, fördröjning och minnesåtgång kan dra åt olika håll. Den snabbaste modellen är inte automatiskt den mest kapabla, och modellen med högst kvalitetspoäng är inte nödvändigtvis den bästa för en viss telefon.
Den viktigaste begränsningen i den första mobilversionen är skillnaden mellan klienterna. iOS-versionen kan använda GPU-beräkningar genom Apples Metal-ekosystem, inklusive MLX. Android-versionen var däremot inledningsvis begränsad till CPU-inferens. 41
50
Ett iPhone-resultat som använder MLX och Metal och ett Android-resultat från enbart CPU mäter därför inte telefonernas totala AI-hårdvara på ett jämförbart sätt. iPhone-resultatet kan dra nytta av GPU-acceleration, medan Android-resultatet beskriver den CPU-väg som den aktuella klienten exponerar.
Android-resultat är fortfarande användbara för att förstå CPU-baserad lokal inferens och den användarupplevelse som den implementationen ger. De bör däremot inte användas för att slå fast att en telefons totala AI-kisel är snabbare än en annans innan motsvarande GPU- eller NPU-backend testas med samma arbetsbelastning.
Pipette lanseras samtidigt som chiptillverkare lyfter fram snabbare lokal och agentisk AI. Qualcomm uppger att Snapdragon 8 Elite Gen 5 använder en tredje generationens Oryon-processor med klockfrekvenser på upp till 4,74 GHz. Företaget hävdar också 20 procent högre CPU-prestanda och 35 procent bättre energieffektivitet för processorn. 24
Qualcomm har dessutom förhandsvisat en kommande flaggskeppsplattform med en Oryon-processor som siktar på 5 GHz och arkitekturen FlexCache. Den ska låta heterogena CPU-kärnor dela en dynamiskt tilldelad cachepool. 23
Specifikationerna visar varför lokal AI håller på att bli en hårdvarukapplöpning. Men klockfrekvensen ensam förutsäger inte hur snabbt en språkmodell körs. Kvantisering, minnesbandbredd, cachebeteende, runtime, GPU- eller NPU-användning, temperaturer och långvariga effektgränser kan vara minst lika viktiga.
Det är här Pipettes konfigurationsbaserade metod blir intressant. Benchmarkens värde ligger inte i att leverera en slutgiltig ranking mellan iPhone och Android, utan i att visa om ett påstått chiplyft faktiskt ger snabbare, mer responsiv och mer minneseffektiv lokal AI under en reproducerbar arbetsbelastning.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter.
Pipette lanserades den 24 augusti och utvärderar hela AI installationen – inte bara modellens vikter. Benchmarken omfattar över 1 000 verifierade konfigurationer, fler än 30 modeller, flera kvantiseringsformat och llama.cpp på macOS, iOS, Windows och Android.
De fem huvudmåtten är promptbearbetning, genereringshastighet, tid till första token, total svarstid och minnesanvändning.