Pipette blev lanceret 24. august og måler komplette on device AI konfigurationer – model, kvantisering, runtime, enhed og kontekst samlet.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette er Liquid AI’s open source-benchmark til at evaluere AI-modeller dér, hvor de rent faktisk skal køre: på telefoner, bærbare computere, pc’er og andet edge-hardware. Tjenesten blev lanceret i samarbejde med Artificial Analysis den 24. august og gør selve udrulningen – ikke kun modellen – til måleenheden. Resultatet knyttes derfor til modellen, kvantiseringen, runtime-miljøet, enheden og arbejdsbelastningen samlet. 31
Mange AI-lister fokuserer på evner eller viser ét enkelt tal for inferenshastighed. Pipette er i stedet udviklet til at vise, hvordan hele stakken opfører sig i en konkret installation. En ændring i kvantisering, runtime, backend, hukommelsesbelastning eller hardware kan ændre resultatet, selv om modellens vægte er identiske.
Ved lanceringen fulgte et offentligt datasæt med laboratorieverificerede resultater fra mere end 1.000 kombinationer af modeller, kvantiseringsformer, runtime-miljøer, enheder og kontekster. Den første version omfatter over 30 modeller, flere kvantiseringsformater samt llama.cpp-builds til macOS, iOS, Windows og Android. De standardiserede målinger dækker kontekstlængder fra 256 til 8.192 tokens. 3
Pipettes inferensmålinger kombineres med Artificial Analysis’ vurdering af intelligensen i mobilmodeller. Samarbejdet ser dermed både på, hvor godt en model klarer sig, og hvor hurtigt og effektivt den konkrete installation kører. 33
Pipette har native klienter til iOS og Android, så modeller kan køres lokalt på en smartphone. Den bredere benchmarkdækning omfatter også macOS og Windows via understøttede runtime-builds. Materialet ved lanceringen nævner blandt andet iPhone 17 Pro, Galaxy S26 Ultra og MacBook Pro med M5 Max som referencehardware. 338
Modellerne skal downloades til enheden, før testen kan begynde. Benchmarken måler derfor lokal inferens – ikke svartiden fra en cloudbaseret API. 4150
Leaderboardet indeholder Liquid AI’s LFM2.5-familie sammen med modeller fra andre udviklere. Eksemplerne omfatter Gemma, Nanbeige, Granite, Qwen og andre små eller komprimerede modelvarianter. 941
Benchmarken understøtter flere kvantiseringsformater. Sammenligningen af mobilintelligens fokuserede på modeller, der kan holdes inden for 8 GB, når de kvantiseres til 4 bit – et scenarie, der er relevant for telefoner med begrænset hukommelse. 341
Til lokal kørsel skelner Liquid mellem GGUF, der ofte bruges sammen med llama.cpp på CPU- og GPU-platforme, og MLX-formater, der er udviklet til installationer på Apple Silicon. 47 Filstørrelsen på en kvantiseret model er dog kun én del af regnestykket. Det er runtime-miljøet og hardware-backenden, der afgør, hvordan modellen faktisk behandles.
Lanceringens datasæt rapporterer standardiserede inferenskonfigurationer med kontekstlængder fra 256 til 8.192 tokens. 3 Den separate Artificial Analysis-test af mobilintelligens anvender en grænse på 16K tokens. 33
Tallene må ikke forveksles med modellens maksimale annoncerede kontekstvindue. Liquids modeldokumentation angiver 32K tokens for mange LFM-modeller og 128K for LFM2.5-8B-A1B, men en models tekniske maksimum betyder ikke, at enhver mobiltest kører med den fulde længde. 47
Pipette samler flere sider af on-device-ydeevnen i stedet for kun at fokusere på dekoderingshastighed. De fem performance-mål dækker behandling af prompten eller prefill, gennemløb under generering eller dekodering, tid til første token, samlet svartid og hukommelsesforbrug. 1314
Det er vigtigt, fordi en installation godt kan generere tokens hurtigt, men stadig bruge lang tid på at komme i gang, kræve for meget hukommelse eller blive langsommere, efterhånden som konteksten vokser. Den samlede svartid siger især noget om den oplevelse, brugeren faktisk får fra en lokal assistent.
Artificial Analysis leverer kvalitetsdelen af mobiltesten gennem vurderinger af blandt andet instruktionsfølgning, værktøjsbrug og ræsonnering. 33
Pipette knytter hvert resultat til en eksplicit konfiguration og offentliggør de protokoller, der er brugt til de verificerede data. Dashboardet adskiller leaderboard-sammenligninger fra detaljerede resultater og indsendelser. Det gør det muligt at undersøge de underliggende benchmarkrækker i stedet for kun at stole på en samlet placering. 1
Metoden registrerer også runtime-afhængigheder. Liquid oplyser eksempelvis, at de nuværende offentlige performance-resultater kræver bestemte llama.cpp-builds, herunder buildene b10216 og b10516. 2 Ved at fastlåse runtime-versionen bliver det sværere at forveksle softwareændringer med forbedringer i hardware eller model.
Det gør resultaterne lettere at sammenligne, men fjerner ikke alle variationer. Temperaturbegrænsning, styresystemets tilstand, enhedens hukommelse, firmware, valg af backend og vedvarende strømgrænser kan alle påvirke en telefons resultat. En score er mest meningsfuld, når disse forhold er ens.
De første resultater viser, hvorfor Pipette rapporterer komplette konfigurationer frem for at uddele universelle modelplaceringer.
Den centrale pointe er, at kvalitet, hastighed, latenstid og hukommelsesforbrug kan pege i forskellige retninger. Den hurtigste model er ikke nødvendigvis den mest kapable, og den model med den højeste kvalitetsscore er ikke automatisk den bedste løsning på en telefon.
Den vigtigste begrænsning i den første mobiludgave er forskellen mellem de to klienter. iOS-versionen kan bruge GPU-beregning gennem Apples Metal-økosystem, herunder MLX. Android-versionen var ved lanceringen begrænset til inferens på CPU’en. 4150
Derfor er et iPhone-resultat med MLX/Metal og et Android-resultat fra CPU-only-inferens ikke en ren sammenligning af telefonernes samlede AI-hardware. iOS-målingen kan drage fordel af GPU-acceleration, mens Android-målingen afspejler den CPU-vej, som den nuværende klient stiller til rådighed.
Android-resultaterne er stadig nyttige til at forstå CPU-baseret lokal inferens og den oplevelse, som den aktuelle implementering leverer. De bør dog ikke bruges til at konkludere, at den samlede AI-hardware i én telefon er hurtigere end i en anden, før tilsvarende GPU- eller NPU-backends testes under samme arbejdsbelastning.
Pipette kommer på et tidspunkt, hvor chipproducenterne markedsfører hurtigere lokal og agentisk AI. Qualcomms Snapdragon 8 Elite Gen 5-platform bruger en tredje generation af Oryon-CPU’en med en clockfrekvens på op til 4,74 GHz og lover 20 procent højere CPU-ydeevne samt 35 procent bedre CPU-strømeffektivitet. 24
Qualcomm har desuden forhåndsvist en efterfølgende Snapdragon-topplatform med en Oryon-CPU, der sigter mod 5 GHz, samt FlexCache-arkitekturen, hvor heterogene CPU-kerner kan dele en dynamisk tildelt cache-pulje. 23
Specifikationerne viser, hvorfor on-device-AI er ved at udvikle sig til en hardwarekonkurrence. Clockfrekvens alene forudsiger dog ikke, hvor godt en sprogmodel kører. Kvantisering, hukommelsesbåndbredde, cache-adfærd, runtime-implementering, brug af GPU eller NPU, temperaturer og vedvarende strømforbrug kan være mindst lige så afgørende.
Det er her, Pipettes konfigurationsbaserede tilgang bliver interessant. På længere sigt kan benchmarken vise, om en lovet chipforbedring faktisk giver hurtigere, mere responsiv og mere hukommelseseffektiv lokal AI under en reproducerbar arbejdsbelastning. Indtil videre bør Pipette først og fremmest forstås som et gennemsigtigt benchmark af konkrete installationer – ikke som den endelige rangliste over iPhone- og Android-hardware.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette blev lanceret 24. august og måler komplette on device AI konfigurationer – model, kvantisering, runtime, enhed og kontekst samlet.
Pipette blev lanceret 24. august og måler komplette on device AI konfigurationer – model, kvantisering, runtime, enhed og kontekst samlet. Benchmarken understøtter lokale modeller på iOS og Android samt llama.cpp builds til macOS, iOS, Windows og Android.
I den første mobiltest delte Nanbeige4.2 3B og LFM2.5 2.6B førstepladsen med en gennemsnitsscore på 63 ved en kontekstgrænse på 16K tokens.