Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten. De benchmark ondersteunt lokale modellen op iOS, Android, macOS en Windows, met meerdere quantisatieformaten en contextlengtes van 256 tot 8.192 tokens.
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette is een open-source benchmark van Liquid AI voor AI-modellen op apparaten waarop ze daadwerkelijk draaien: smartphones, laptops, pc’s en andere edge-hardware. De dienst werd op 24 augustus gelanceerd in samenwerking met Artificial Analysis. In plaats van alleen het model te beoordelen, behandelt Pipette de volledige implementatie als meeteenheid: model, quantisatie, runtime, apparaat en workload samen. 3
1
Veel AI-leaderboards draaien vooral om capaciteits- of kwaliteitsscores, of noemen één getal voor de inferentiesnelheid. Pipette probeert een realistischer beeld te geven van wat iemand in een echte lokale implementatie ervaart.
Dat onderscheid is belangrijk. Hetzelfde model kan anders presteren na een wijziging in quantisatie, runtime, backend, geheugendruk of hardware. De modelgewichten zijn dan misschien identiek, maar de praktische uitkomst niet.
Bij de lancering publiceerde Liquid AI een dataset met door een laboratorium gecontroleerde resultaten voor meer dan 1.000 combinaties van modellen, quantisaties, runtimes, apparaten en contextinstellingen. De eerste versie omvat meer dan 30 modellen, verschillende quantisatieformaten en llama.cpp-builds voor macOS, iOS, Windows en Android. De gestandaardiseerde contextlengtes lopen van 256 tot 8.192 tokens. 3
Artificial Analysis voegt daar een beoordeling van de modelintelligentie op mobiele apparaten aan toe. Daardoor kijkt de samenwerking zowel naar de kwaliteit van de antwoorden als naar de snelheid en efficiëntie van een specifieke implementatie. 33
Pipette heeft native apps voor iOS en Android waarmee modellen lokaal op een smartphone kunnen worden uitgevoerd. De bredere benchmark omvat daarnaast macOS en Windows via ondersteunde runtime-builds. Als referentiehardware noemt de publieke informatie onder meer de iPhone 17 Pro, Galaxy S26 Ultra en MacBook Pro met een M5 Max-chip. 3
38
Voor een test moet het model eerst naar het apparaat worden gedownload. Pipette meet dus lokale inferentie en niet de netwerkvertraging van een cloud-API. 41
50
Op het leaderboard staan Liquid AI’s eigen LFM2.5-modellen naast modellen van andere ontwikkelaars. Voorbeelden zijn varianten van Gemma, Nanbeige, Granite en Qwen, naast andere kleine of gecomprimeerde modellen. 9
41
De benchmark ondersteunt meerdere quantisatieformaten. Voor de vergelijking van mobiele modelintelligentie werden modellen geselecteerd die na quantisatie naar 4 bit binnen 8 GB passen. Dat maakt de test relevant voor smartphones met beperkte geheugencapaciteit. 3
41
Voor lokale implementaties maakt Liquid AI onderscheid tussen GGUF en MLX. GGUF wordt vaak gebruikt met llama.cpp voor CPU- en GPU-inferentie op verschillende platformen. MLX is gericht op implementaties op Apple Silicon. 47 De bestandsgrootte van een gequantiseerd model vertelt daarom maar een deel van het verhaal: de runtime en hardwarebackend bepalen hoe het model in de praktijk wordt verwerkt.
De dataset van de lancering gebruikt gestandaardiseerde contextlengtes van 256 tot 8.192 tokens. 3 De afzonderlijke beoordeling van mobiele modelintelligentie door Artificial Analysis hanteert een limiet van 16K tokens.
33
Die waarden moet je niet verwarren met het maximale contextvenster dat een model volgens de documentatie aankan. Voor veel LFM-modellen noemt Liquid AI 32K tokens en voor LFM2.5-8B-A1B 128K tokens. Dat betekent echter niet dat elke smartphonebenchmark met die maximale lengte wordt uitgevoerd. 47
Pipette reduceert on-device AI niet tot één decodecijfer. De vijf prestatiemaatstaven omvatten:
Die combinatie geeft een beter beeld van de gebruikerservaring. Een model kan bijvoorbeeld snel tokens genereren, maar toch traag op gang komen, veel geheugen gebruiken of sterk vertragen zodra de context langer wordt. Vooral de totale responstijd is relevant voor wie een lokale assistent gebruikt.
Artificial Analysis verzorgt het kwaliteitsdeel van de mobiele vergelijking met tests voor onder meer instructievolging, toolgebruik en redeneervermogen. 33
Elk resultaat wordt gekoppeld aan een expliciete configuratie. Liquid AI publiceert bovendien de protocollen waarmee de gecontroleerde gegevens zijn verzameld. Op het dashboard zijn leaderboardvergelijkingen gescheiden van gedetailleerde resultaten en inzendingen. Daardoor kunnen gebruikers de onderliggende benchmarkregels bekijken in plaats van alleen een eindrangschikking te volgen. 1
Ook runtime-afhankelijkheden worden vastgelegd. Liquid AI meldt bijvoorbeeld dat de huidige openbare prestatieresultaten specifieke llama.cpp-builds vereisen, waaronder b10216 en b10516. 2 Door de runtimeversie vast te zetten, wordt voorkomen dat een software-update ten onrechte wordt geïnterpreteerd als een verbetering van het model of de hardware.
Dat maakt de vergelijking sterker, maar neemt niet elke variabele weg. Thermische throttling, de toestand van het besturingssysteem, beschikbaar werkgeheugen, firmware, backendkeuze en aanhoudende vermogenslimieten kunnen de uitkomst van een smartphone beïnvloeden. Een score is daarom vooral betekenisvol wanneer die omstandigheden overeenkomen.
De eerste resultaten illustreren waarom Pipette configuraties rapporteert en geen universele modelranglijst presenteert.
De belangrijkste conclusie: kwaliteit, snelheid, latentie en geheugengebruik wijzen niet altijd dezelfde kant op. Het snelste model is niet automatisch het meest capabele model, en het model met de hoogste kwaliteitsscore is niet vanzelf de beste keuze voor een smartphone.
De grootste beperking van de eerste mobiele release zit in het verschil tussen de twee apps. De iOS-versie kan GPU-berekeningen uitvoeren binnen Apple’s Metal-ecosysteem, waaronder MLX. De Android-versie was aanvankelijk beperkt tot inferentie via de CPU. 41
50
Een iPhone-resultaat met MLX/Metal en een Android-resultaat uit een CPU-only implementatie zijn daardoor geen zuivere vergelijking van de totale AI-hardware in beide telefoons. De iOS-meting kan profiteren van GPU-versnelling, terwijl de Android-meting de prestaties van het CPU-pad van de huidige app weerspiegelt.
Android-resultaten blijven nuttig om lokale inferentie op de CPU en de gebruikerservaring van die implementatie te beoordelen. Ze zijn echter geen basis om te concluderen dat de totale AI-hardware van de ene telefoon sneller is dan die van de andere. Daarvoor zijn gelijkwaardige GPU- of NPU-backends en dezelfde workload nodig.
De lancering komt op een moment waarop chipfabrikanten steeds hogere prestaties voor lokale en agentische AI beloven. Qualcomms Snapdragon 8 Elite Gen 5 gebruikt een derde generatie Oryon-CPU met kloksnelheden tot 4,74 GHz. Qualcomm claimt daarnaast 20 procent meer CPU-prestaties en 35 procent betere CPU-energie-efficiëntie. 24
Qualcomm heeft ook een volgende Snapdragon-vlaggenschipchip aangekondigd met een Oryon-CPU die mikt op 5 GHz. De nieuwe FlexCache-architectuur moet heterogene CPU-kernen toegang geven tot een gedeelde cachepool die dynamisch wordt toegewezen op basis van de workload. 23
Die ontwikkelingen laten zien waarom on-device AI steeds meer een hardwarewedstrijd wordt. Toch voorspelt een hogere kloksnelheid op zichzelf niet hoe goed een taalmodel presteert. Quantisatie, geheugenbandbreedte, cachegedrag, runtime-implementatie, GPU- of NPU-gebruik, warmteontwikkeling en langdurige vermogenslimieten kunnen minstens zo belangrijk zijn.
Daar ligt de waarde van Pipette. De benchmark kan op termijn zichtbaar maken of een geclaimde chipverbetering zich onder een reproduceerbare workload vertaalt in snellere antwoorden, minder wachttijd en efficiënter geheugengebruik. Voorlopig is Pipette vooral een transparante benchmark voor concrete implementaties — geen definitieve ranglijst van iPhone- versus Android-hardware.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten.
Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten. De benchmark ondersteunt lokale modellen op iOS, Android, macOS en Windows, met meerdere quantisatieformaten en contextlengtes van 256 tot 8.192 tokens.
De vijf prestatiemaatstaven omvatten onder meer prefill, decode snelheid, time to first token, totale responstijd en geheugengebruik.
Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten. De benchmark ondersteunt lokale modellen op iOS, Android, macOS en Windows, met meerdere quantisatieformaten en contextlengtes van 256 tot 8.192 tokens.
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette is een open-source benchmark van Liquid AI voor AI-modellen op apparaten waarop ze daadwerkelijk draaien: smartphones, laptops, pc’s en andere edge-hardware. De dienst werd op 24 augustus gelanceerd in samenwerking met Artificial Analysis. In plaats van alleen het model te beoordelen, behandelt Pipette de volledige implementatie als meeteenheid: model, quantisatie, runtime, apparaat en workload samen. 3
1
Veel AI-leaderboards draaien vooral om capaciteits- of kwaliteitsscores, of noemen één getal voor de inferentiesnelheid. Pipette probeert een realistischer beeld te geven van wat iemand in een echte lokale implementatie ervaart.
Dat onderscheid is belangrijk. Hetzelfde model kan anders presteren na een wijziging in quantisatie, runtime, backend, geheugendruk of hardware. De modelgewichten zijn dan misschien identiek, maar de praktische uitkomst niet.
Bij de lancering publiceerde Liquid AI een dataset met door een laboratorium gecontroleerde resultaten voor meer dan 1.000 combinaties van modellen, quantisaties, runtimes, apparaten en contextinstellingen. De eerste versie omvat meer dan 30 modellen, verschillende quantisatieformaten en llama.cpp-builds voor macOS, iOS, Windows en Android. De gestandaardiseerde contextlengtes lopen van 256 tot 8.192 tokens. 3
Artificial Analysis voegt daar een beoordeling van de modelintelligentie op mobiele apparaten aan toe. Daardoor kijkt de samenwerking zowel naar de kwaliteit van de antwoorden als naar de snelheid en efficiëntie van een specifieke implementatie. 33
Pipette heeft native apps voor iOS en Android waarmee modellen lokaal op een smartphone kunnen worden uitgevoerd. De bredere benchmark omvat daarnaast macOS en Windows via ondersteunde runtime-builds. Als referentiehardware noemt de publieke informatie onder meer de iPhone 17 Pro, Galaxy S26 Ultra en MacBook Pro met een M5 Max-chip. 3
38
Voor een test moet het model eerst naar het apparaat worden gedownload. Pipette meet dus lokale inferentie en niet de netwerkvertraging van een cloud-API. 41
50
Op het leaderboard staan Liquid AI’s eigen LFM2.5-modellen naast modellen van andere ontwikkelaars. Voorbeelden zijn varianten van Gemma, Nanbeige, Granite en Qwen, naast andere kleine of gecomprimeerde modellen. 9
41
De benchmark ondersteunt meerdere quantisatieformaten. Voor de vergelijking van mobiele modelintelligentie werden modellen geselecteerd die na quantisatie naar 4 bit binnen 8 GB passen. Dat maakt de test relevant voor smartphones met beperkte geheugencapaciteit. 3
41
Voor lokale implementaties maakt Liquid AI onderscheid tussen GGUF en MLX. GGUF wordt vaak gebruikt met llama.cpp voor CPU- en GPU-inferentie op verschillende platformen. MLX is gericht op implementaties op Apple Silicon. 47 De bestandsgrootte van een gequantiseerd model vertelt daarom maar een deel van het verhaal: de runtime en hardwarebackend bepalen hoe het model in de praktijk wordt verwerkt.
De dataset van de lancering gebruikt gestandaardiseerde contextlengtes van 256 tot 8.192 tokens. 3 De afzonderlijke beoordeling van mobiele modelintelligentie door Artificial Analysis hanteert een limiet van 16K tokens.
33
Die waarden moet je niet verwarren met het maximale contextvenster dat een model volgens de documentatie aankan. Voor veel LFM-modellen noemt Liquid AI 32K tokens en voor LFM2.5-8B-A1B 128K tokens. Dat betekent echter niet dat elke smartphonebenchmark met die maximale lengte wordt uitgevoerd. 47
Pipette reduceert on-device AI niet tot één decodecijfer. De vijf prestatiemaatstaven omvatten:
Die combinatie geeft een beter beeld van de gebruikerservaring. Een model kan bijvoorbeeld snel tokens genereren, maar toch traag op gang komen, veel geheugen gebruiken of sterk vertragen zodra de context langer wordt. Vooral de totale responstijd is relevant voor wie een lokale assistent gebruikt.
Artificial Analysis verzorgt het kwaliteitsdeel van de mobiele vergelijking met tests voor onder meer instructievolging, toolgebruik en redeneervermogen. 33
Elk resultaat wordt gekoppeld aan een expliciete configuratie. Liquid AI publiceert bovendien de protocollen waarmee de gecontroleerde gegevens zijn verzameld. Op het dashboard zijn leaderboardvergelijkingen gescheiden van gedetailleerde resultaten en inzendingen. Daardoor kunnen gebruikers de onderliggende benchmarkregels bekijken in plaats van alleen een eindrangschikking te volgen. 1
Ook runtime-afhankelijkheden worden vastgelegd. Liquid AI meldt bijvoorbeeld dat de huidige openbare prestatieresultaten specifieke llama.cpp-builds vereisen, waaronder b10216 en b10516. 2 Door de runtimeversie vast te zetten, wordt voorkomen dat een software-update ten onrechte wordt geïnterpreteerd als een verbetering van het model of de hardware.
Dat maakt de vergelijking sterker, maar neemt niet elke variabele weg. Thermische throttling, de toestand van het besturingssysteem, beschikbaar werkgeheugen, firmware, backendkeuze en aanhoudende vermogenslimieten kunnen de uitkomst van een smartphone beïnvloeden. Een score is daarom vooral betekenisvol wanneer die omstandigheden overeenkomen.
De eerste resultaten illustreren waarom Pipette configuraties rapporteert en geen universele modelranglijst presenteert.
De belangrijkste conclusie: kwaliteit, snelheid, latentie en geheugengebruik wijzen niet altijd dezelfde kant op. Het snelste model is niet automatisch het meest capabele model, en het model met de hoogste kwaliteitsscore is niet vanzelf de beste keuze voor een smartphone.
De grootste beperking van de eerste mobiele release zit in het verschil tussen de twee apps. De iOS-versie kan GPU-berekeningen uitvoeren binnen Apple’s Metal-ecosysteem, waaronder MLX. De Android-versie was aanvankelijk beperkt tot inferentie via de CPU. 41
50
Een iPhone-resultaat met MLX/Metal en een Android-resultaat uit een CPU-only implementatie zijn daardoor geen zuivere vergelijking van de totale AI-hardware in beide telefoons. De iOS-meting kan profiteren van GPU-versnelling, terwijl de Android-meting de prestaties van het CPU-pad van de huidige app weerspiegelt.
Android-resultaten blijven nuttig om lokale inferentie op de CPU en de gebruikerservaring van die implementatie te beoordelen. Ze zijn echter geen basis om te concluderen dat de totale AI-hardware van de ene telefoon sneller is dan die van de andere. Daarvoor zijn gelijkwaardige GPU- of NPU-backends en dezelfde workload nodig.
De lancering komt op een moment waarop chipfabrikanten steeds hogere prestaties voor lokale en agentische AI beloven. Qualcomms Snapdragon 8 Elite Gen 5 gebruikt een derde generatie Oryon-CPU met kloksnelheden tot 4,74 GHz. Qualcomm claimt daarnaast 20 procent meer CPU-prestaties en 35 procent betere CPU-energie-efficiëntie. 24
Qualcomm heeft ook een volgende Snapdragon-vlaggenschipchip aangekondigd met een Oryon-CPU die mikt op 5 GHz. De nieuwe FlexCache-architectuur moet heterogene CPU-kernen toegang geven tot een gedeelde cachepool die dynamisch wordt toegewezen op basis van de workload. 23
Die ontwikkelingen laten zien waarom on-device AI steeds meer een hardwarewedstrijd wordt. Toch voorspelt een hogere kloksnelheid op zichzelf niet hoe goed een taalmodel presteert. Quantisatie, geheugenbandbreedte, cachegedrag, runtime-implementatie, GPU- of NPU-gebruik, warmteontwikkeling en langdurige vermogenslimieten kunnen minstens zo belangrijk zijn.
Daar ligt de waarde van Pipette. De benchmark kan op termijn zichtbaar maken of een geclaimde chipverbetering zich onder een reproduceerbare workload vertaalt in snellere antwoorden, minder wachttijd en efficiënter geheugengebruik. Voorlopig is Pipette vooral een transparante benchmark voor concrete implementaties — geen definitieve ranglijst van iPhone- versus Android-hardware.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten.
Pipette, gelanceerd op 24 augustus, beoordeelt complete on device AI configuraties in plaats van alleen modelgewichten. De benchmark ondersteunt lokale modellen op iOS, Android, macOS en Windows, met meerdere quantisatieformaten en contextlengtes van 256 tot 8.192 tokens.
De vijf prestatiemaatstaven omvatten onder meer prefill, decode snelheid, time to first token, totale responstijd en geheugengebruik.