Pipette on Liquid AI:n ilmainen avoimen lähdekoodin vertailutyökalu, joka mittaa tekoälyn todellista käyttöä laitteella mallin, kvantisoinnin, ajonaikaympäristön, laitteen ja työkuorman yhdistelmänä. Palvelu julkaistiin 24.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette on Liquid AI:n ilmainen avoimen lähdekoodin vertailukokonaisuus, jolla mitataan tekoälymallien toimintaa suoraan laitteella. Se ei arvioi vain yhtä mallia, vaan koko käyttöönottoa: mallia, kvantisointia, ajonaikaympäristöä, laitetta ja työkuormaa. Palvelu julkaistiin 24. elokuuta yhteistyössä Artificial Analysisin kanssa. Liquid AI vastaa pääasiassa päättelyn suorituskykymittauksista, kun taas Artificial Analysis arvioi mobiililaitteille sopivien mallien kyvykkyyttä. 119
Julkistukseen kuuluu laboratoriossa varmennettu aineisto, jossa on yli 1 000 erilaista kokoonpanoa. Tulokset kattavat viisi laitteella tapahtuvan tekoälyn suorituskykymittaria, ja tulostaulukossa on yli 30 mallia, seitsemän kvantisointivaihtoehtoa sekä neljä alkuvaiheen laitetta. 114
Pipette tukee iOS- ja Android-sovelluksia. Malli ladataan ensin laitteelle, minkä jälkeen testi suoritetaan paikallisesti – kyse ei siis ole pilvipalvelulle lähetettävän pyynnön mittaamisesta. Alkuvaiheen mallivalikoimaan kuuluu Liquid AI:n LFM-malleja sekä muiden kehittäjien pieniä malleja, kuten Gemma ja Nanbeige. Mobiilien älykkyysvertailussa tarkasteltiin malleja, jotka mahtuvat 8 gigatavuun 4-bittisesti kvantisoituina. 108
Pipetten julkisissa suorituskykytuloksissa työkuormien kontekstipituudet vaihtelevat 256:sta 8 192 tokeniin. 11 Artificial Analysisin erillisessä mobiilien älykkyysvertailussa käytettiin puolestaan 16 000 tokenin kontekstirajaa. 98 Tämä ero on tärkeä: Liquid AI:n LFM-mallien ilmoitetut 32 000 tokenin tai LFM2.5-8B-A1B-mallin 128 000 tokenin kontekstit ovat mallien ominaisuuksia, eivät välttämättä Pipetten ensimmäisen vakiomuotoisen testin asetuksia. 2
Mitattaviin asioihin kuuluvat muun muassa:
Näin Pipette ei anna yhden tokens-per-second-luvun hallita koko vertailua. Nopeakin tuottaminen voi olla käytännössä hankalaa, jos ensimmäistä vastausta joutuu odottamaan pitkään tai malli kuluttaa liikaa muistia.
Pipetten merkittävin anti on vertailutapa. Tulos sidotaan aina tiettyyn yhdistelmään: malliin, kvantisointiin, runtimeen eli ajonaikaiseen toteutukseen, laitteeseen ja työkuormaan. Mittaukset tehdään varmennetuissa laboratorio-olosuhteissa, ja niiden yhteydessä julkaistaan testiprotokollat. 411
Myös ohjelmistoriippuvuudet pyritään kiinnittämään. Tällä hetkellä julkiset suorituskykytulokset edellyttävät esimerkiksi tiettyjä llama.cpp-versioita, kuten koontiversioita b10216 ja b10516. 6
Tämä on huomattavasti informatiivisempaa kuin valmistajan yksittäinen ”tokens per second” -luku. Se ei silti poista kaikkia vaihtelun lähteitä. Laitteen lämpötila, käyttöjärjestelmän tila, muistimäärä, tarkka laitemalli, valittu taustajärjestelmä ja pitkäkestoinen tehonkulutus voivat vaikuttaa tulokseen. Tuloksia kannattaa pitää vertailukelpoisina vasta, kun nämä asetukset täsmäävät.
Liquid AI:n ja Artificial Analysisin julkaisemissa tuloksissa iPhone 17 Pro saavutti 4-bittisellä Gemma 4 E2B -mallilla 48,37 generointitokenia sekunnissa Apple MLX -taustajärjestelmällä. Se on vahva tulos juuri tälle kokoonpanolle: Gemma 4 E2B, 4-bittinen kvantisointi, MLX/Metal ja iPhone 17 Pro. Lukua ei pidä tulkita yleiseksi Gemma- tai puhelinpistemääräksi. 45
Artificial Analysisin 16 000 tokenin mobiiliälykkyysvertailussa Nanbeige4.2-3B ja LFM2.5-2.6B jakoivat kärkipaikan keskiarvolla 63. Ornith-1.0-9B sai 62 pistettä ja Qwen3.5 9B Reasoning 61 pistettä. 98
Alustojen välillä on kuitenkin merkittävä tekninen ero:
Siksi tämänhetkisiä iPhone- ja Android-lukuja ei voi pitää puhtaana laitteistojen välisenä nopeusvertailuna. Applen tuloksissa voi olla mukana GPU-kiihdytys, kun taas Androidin tulokset kuvaavat CPU-päättelyä. Android-tulos voi kertoa hyödyllisesti suorittimen suorituskyvystä ja käyttökokemuksesta kyseisellä toteutuksella, mutta se ei osoita, että jonkin puhelimen koko tekoälylaitteisto olisi luonnostaan nopeampi kuin toisen. 104
Reilumpi alustojen välinen vertailu edellyttäisi Androidin GPU- ja NPU-taustajärjestelmiä vastaavalla kiihdytyksellä.
Pipette ilmestyy aikaan, jolloin piirivalmistajat korostavat paikallisen ja niin sanotun agenttisen tekoälyn suorituskykyä. Qualcomm on kertonut Snapdragon 8 Elite Gen 5 -alustan kolmannen sukupolven Oryon-suorittimen yltävän 4,74 gigahertsin kellotaajuuteen. Yhtiön mukaan alusta tarjoaa lisäksi 20 prosenttia paremman CPU-suorituskyvyn ja 35 prosenttia paremman CPU-energiatehokkuuden. 14
Qualcomm on myöhemmin esitellyt seuraavaa lippulaivapiiriään, jonka Oryon-suorittimen tavoitekellotaajuus on 5 gigahertsiä. Alustaan kuuluu myös FlexCache-rakenne, jossa välimuistia voidaan jakaa dynaamisesti suoritinytimien kesken. Tällaiset julkistukset kertovat mobiililaitteiden paikallisen laskennan kiristyvästä kilpailusta, mutta kellotaajuus yksin ei ennusta suurten kielimallien suorituskykyä. Myös ajonaikaympäristö, muistiväylän nopeus, välimuistin toiminta, kvantisointi, GPU- tai NPU-taustajärjestelmä, lämpötila ja jatkuvan tehon rajat vaikuttavat. 913
Liquid AI:n mukaan seuraavia kehitysaskelia ovat laajempi laitetuki ja NPU-kiihdytetyt testit. Ne tekisivät Pipettestä hyödyllisemmän, koska niiden avulla voisi erottaa CPU:n, GPU:n ja NPU:n tuomat hyödyt samoissa työkuormissa. 64
Pipettea kannattaa tällä hetkellä ajatella läpinäkyvänä käyttöönoton vertailutyökaluna, ei lopullisena eri puhelinten tai mobiilipiirien paremmuusjärjestyksenä. Sen vahvuus on siinä, että se kertoo, miten tietty malli toimii tietyllä laitteella, tietyllä kvantisoinnilla ja tietyllä ohjelmistototeutuksella. Kun NPU- ja Android-GPU-tuki laajenee, vertailuista voi tulla myös alustojen välillä huomattavasti reilumpia. 64
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette on Liquid AI:n ilmainen avoimen lähdekoodin vertailutyökalu, joka mittaa tekoälyn todellista käyttöä laitteella mallin, kvantisoinnin, ajonaikaympäristön, laitteen ja työkuorman yhdistelmänä.
Pipette on Liquid AI:n ilmainen avoimen lähdekoodin vertailutyökalu, joka mittaa tekoälyn todellista käyttöä laitteella mallin, kvantisoinnin, ajonaikaympäristön, laitteen ja työkuorman yhdistelmänä. Palvelu julkaistiin 24. elokuuta yhteistyössä Artificial Analysisin kanssa.
Julkinen aineisto sisältää yli 1 000 laboratoriossa varmennettua kokoonpanoa, viisi suorituskykymittaria, yli 30 mallia, seitsemän kvantisointivaihtoehtoa ja neljä alkuvaiheen laitetta.