Pipette is een gratis opensourcebenchmark voor AI die lokaal op telefoons, computers en andere apparaten draait. De tool beoordeelt de volledige configuratie: model, quantisatie, runtime, apparaat en workload, niet alleen het model zelf.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette is de gratis, opensourcebenchmark van Liquid AI voor het meten van AI-modellen die daadwerkelijk op een apparaat draaien. De tool kijkt dus niet alleen naar de kwaliteit of snelheid van een model, maar naar de volledige combinatie van model, quantisatie, runtime, apparaat en workload. Liquid AI bracht Pipette op 24 augustus 2026 uit in samenwerking met Artificial Analysis. Liquid AI meet daarbij de inferentieprestaties; Artificial Analysis verzorgt de evaluatie van de modelintelligentie op mobiele apparaten. 119
De publieke release bevat een dataset met meer dan 1.000 in het lab gecontroleerde configuraties en vijf on-device-prestatiemaatstaven. De leaderboard omvat ruim 30 modellen, zeven quantisatieopties en vier eerste apparaten. 114
De metingen richten zich onder meer op:
Daardoor wordt een hoge decodesnelheid niet automatisch als voldoende beschouwd. Een model kan veel tokens per seconde genereren, maar alsnog traag aanvoelen als het eerste antwoord lang op zich laat wachten of als het veel geheugen verbruikt. 411
Pipette heeft clients voor iOS en Android. De app downloadt AI-modellen naar het apparaat en voert de benchmark lokaal uit; er wordt dus niet simpelweg een cloudservice getest. 108
De eerste modelselectie bevat de LFM-modellen van Liquid AI en kleinere modellen van andere ontwikkelaars, waaronder Gemma en Nanbeige. Voor de vergelijking van mobiele modelintelligentie werden modellen geselecteerd die bij 4-bit-quantisatie binnen 8 GB passen. 108
De openbare prestatiedataset gebruikt verschillende llama.cpp-builds voor onder meer macOS, iOS, Windows en Android. De gepubliceerde configuraties omvatten contextlengtes van 256 tot 8.192 tokens. 11
De afzonderlijke mobiele intelligentietest van Artificial Analysis hanteert daarentegen een contextlimiet van 16K tokens. Dat is iets anders dan de maximale contextlengte die een model volgens de catalogus aankan. Veel LFM-modellen ondersteunen 32K tokens en LFM2.5-8B-A1B zelfs 128K, maar dat betekent niet dat die lengtes ook onderdeel zijn van de gestandaardiseerde eerste Pipette-test. 82
Quantisatie verlaagt de numerieke precisie van een model, waardoor het minder geheugen nodig heeft en vaak sneller lokaal kan draaien. Pipette vergelijkt meerdere quantisatieopties; de eerste leaderboard bevat er zeven. 114
Welke optie het beste is, hangt af van het apparaat en de gebruikte runtime. Zo is GGUF bedoeld voor lokale CPU- en GPU-inferentie via bijvoorbeeld llama.cpp, terwijl MLX vooral is geoptimaliseerd voor Apple Silicon. 2
De belangrijkste bijdrage van Pipette is niet één spectaculaire snelheidsscore, maar de methode. Elke meting is gekoppeld aan een volledige configuratie en aan gepubliceerde protocollen. De resultaten komen uit gecontroleerde laboratoriumtests en de softwareafhankelijkheden worden vastgelegd. Zo vereisen de huidige openbare prestatieresultaten specifieke llama.cpp-builds, waaronder b10216 en b10516. 4116
Dat is een stuk informatiever dan een losse claim als “dit model haalt 50 tokens per seconde”. Toch verdwijnen alle verschillen tussen apparaten daarmee niet. Temperatuur, de toestand van het besturingssysteem, het precieze apparaatmodel, de hoeveelheid RAM en de gekozen backend kunnen de uitkomst beïnvloeden. Alleen metingen waarbij die omstandigheden overeenkomen, zijn echt goed vergelijkbaar.
Een van de opvallende cijfers is 48,37 decode-tokens per seconde voor Gemma 4 E2B in 4-bit via Apple MLX op een iPhone 17 Pro. Dat is een sterk resultaat voor die specifieke combinatie: Gemma 4 E2B, 4-bit-quantisatie, MLX/Metal en een iPhone 17 Pro. Het is geen universele score voor iedere Gemma-versie of iedere smartphone. 45
In de mobiele intelligentietest met een contextlimiet van 16K eindigden Nanbeige4.2-3B en LFM2.5-2.6B gezamenlijk bovenaan, met een gemiddelde score van 63. 98
Daarbij is de vergelijking tussen iOS en Android voorlopig beperkt. iOS kan GPU-berekeningen uitvoeren via Metal en MLX, terwijl de eerste Android-client alleen de CPU gebruikt. 10
Dat betekent dat huidige doorvoerscores van een iPhone en een Androidtelefoon geen zuivere vergelijking van de chips zijn. Een Apple-score kan GPU-versnelling bevatten, terwijl een Android-score op CPU-inferentie is gebaseerd. De Android-resultaten zijn wel nuttig om CPU-prestaties en de gebruikerservaring met die specifieke backend te beoordelen, maar bewijzen niet dat de totale hardware voor lokale AI van de ene telefoon sneller is dan die van de andere. 104
Voor een eerlijkere platformvergelijking zijn Android-backends nodig die ook de NPU of GPU goed benutten.
De release komt op een moment waarop chipfabrikanten steeds nadrukkelijker snellere lokale en agentische AI-toepassingen beloven. Qualcomm stelt bijvoorbeeld dat de derde generatie Oryon-CPU in de Snapdragon 8 Elite Gen 5 een kloksnelheid van 4,74 GHz haalt. Het bedrijf claimt daarnaast 20 procent meer CPU-prestaties en 35 procent betere CPU-energie-efficiëntie voor dat platform. 14
Qualcomm heeft ook een volgende Snapdragon-vlaggenschip aangekondigd met een Oryon-CPU die op 5 GHz mikt en een FlexCache-architectuur gebruikt. Daarbij kan de cache dynamisch tussen kernen worden gedeeld. 12
Een hogere kloksnelheid zegt op zichzelf echter weinig over de snelheid van lokale taalmodellen. Ook runtime, geheugenbandbreedte, cachegedrag, quantisatie, de gebruikte CPU-, GPU- of NPU-backend, temperatuur en langdurige vermogenslimieten spelen een rol.
Daarom zou Pipette vooral waardevoller worden als het meer apparaten en NPU-versnelde tests toevoegt. Dan kan de benchmark beter onderscheiden welke winst uit de CPU komt en welke uit GPU- of NPU-versnelling. Tot die tijd is de meest verdedigbare conclusie dat Pipette een transparante benchmark voor volledige AI-deployments is — geen definitieve ranglijst van smartphonehardware. 64
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette is een gratis opensourcebenchmark voor AI die lokaal op telefoons, computers en andere apparaten draait.
Pipette is een gratis opensourcebenchmark voor AI die lokaal op telefoons, computers en andere apparaten draait. De tool beoordeelt de volledige configuratie: model, quantisatie, runtime, apparaat en workload, niet alleen het model zelf.
De eerste dataset bevat meer dan 1.000 in het lab gecontroleerde configuraties, met vijf prestatiemaatstaven, ruim 30 modellen en zeven quantisatieopties.