24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja. Testit tukevat iOS ja Android sovelluksia, paikallisesti ladattavia malleja, useita kvantisointimuotoja sekä llama.cpp ajoalustoja macOS:llä, iOS:llä, Windowsilla ja Androidilla.
JulkaisijaMuokattu mallilla GPT-5.6 LunaKuvat luotu mallilla GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI:n Pipette on avoimen lähdekoodin vertailutyökalu, jolla mitataan tekoälymallien toimintaa siellä, missä niitä oikeasti käytetään: puhelimissa, kannettavissa tietokoneissa, pöytäkoneissa ja muissa reunalaitteissa. Liquid AI julkaisi sen yhteistyössä Artificial Analysisin kanssa 24. elokuuta. 3
1
Pipetten keskeinen idea on yksinkertainen mutta tärkeä: vertailun kohteena ei ole vain malli, vaan koko käyttöönotto. Tulos riippuu samanaikaisesti mallista, kvantisoinnista, ajoalustasta, laitteesta ja työkuormasta. 3
1
Monet tekoälylistaukset keskittyvät mallin kyvykkyyspisteisiin tai ilmoittavat yhden luvun tokenien käsittelynopeudesta. Pipette pyrkii kuvaamaan sitä, miten kokonainen järjestelmä toimii oikeassa laitteessa.
Sama malli voi käyttäytyä eri tavalla, jos käytössä on toinen kvantisointitaso, ajoalusta, taustajärjestelmä tai laite. Myös muistin kuormitus ja kontekstin pituus voivat muuttaa tulosta, vaikka mallin painot pysyisivät ennallaan.
Julkaisun yhteydessä esitelty julkinen aineisto sisältää yli 1 000 laboratoriossa varmennettua yhdistelmää, joissa vaihtelevat malli, kvantisointi, runtime eli suoritusympäristö, laite ja konteksti. Ensimmäinen julkaisu kattaa yli 30 mallia, useita kvantisointimuotoja sekä llama.cpp-koontiversioita macOS:lle, iOS:lle, Windowsille ja Androidille. Standardoidut testit käyttävät 256–8 192 tokenin kontekstipituuksia. 3
Liquid AI:n mittaukset yhdistyvät Artificial Analysisin arvioihin mobiililaitteille sopivien mallien älykkyydestä. Näin yhteistyö tarkastelee sekä mallin laatua että tietyn käyttöönoton nopeutta ja tehokkuutta. 33
Pipettestä on natiivisovellukset iOS:lle ja Androidille, joten mallin voi ajaa suoraan älypuhelimessa. Laajempi vertailuaineisto ulottuu myös macOS:ään ja Windowsiin tuettujen suoritusympäristöjen kautta. Julkaisun yhteydessä mainitut vertailulaitteet ovat iPhone 17 Pro, Galaxy S26 Ultra ja M5 Max -sirulla varustettu MacBook Pro. 3
38
Testattava malli täytyy ladata laitteelle ennen mittausta. Pipette mittaa siis paikallista päättelyä eli inferenssiä, ei pilvipalvelun rajapinnan verkkoviivettä. 41
50
Pipetten listalla on Liquid AI:n oma LFM2.5-malliperhe sekä muiden valmistajien malleja. Esimerkkeihin kuuluvat muun muassa Gemma, Nanbeige, Granite ja Qwen sekä erilaiset pienet ja pakatut malliversiot. 9
41
Työkalu tukee useita kvantisointimuotoja. Mobiiliälykkyyden vertailussa keskityttiin malleihin, jotka mahtuvat 4-bittisesti kvantisoituina 8 gigatavuun. Tämä tekee asetelmasta relevantin puhelimille, joissa käyttömuistia on rajallisesti. 3
41
Paikallista käyttöä varten Liquid AI erottaa toisistaan kaksi keskeistä formaattia. GGUF-muotoa käytetään yleisesti llama.cpp:n kanssa CPU- ja GPU-ajossa eri alustoilla, kun taas MLX on suunnattu erityisesti Apple Silicon -laitteille. 47
Mallin tiedostokoko ei kuitenkaan yksin kerro, kuinka nopeasti se toimii. Suoritusympäristö ja laitteen laitteistokiihdytin ratkaisevat, miten malli käytännössä käsitellään.
Julkaisun aineistossa standardoidut inferenssiasetukset kattavat 256–8 192 tokenin kontekstit. Artificial Analysisin erillisessä mobiiliälykkyyden arvioinnissa konteksti rajattiin 16 000 tokeniin. 3
33
Näitä lukuja ei pidä sekoittaa mallin ilmoitettuun enimmäiskontekstiin. Liquid AI ilmoittaa monille LFM-malleille 32 000 tokenin kontekstin ja LFM2.5-8B-A1B:lle 128 000 tokenin kontekstin. Mallin teoreettinen kapasiteetti ei kuitenkaan tarkoita, että jokainen puhelintesti ajetaan täydellä pituudella. 47
Pipette ei typistä suorituskykyä yhteen generointinopeuslukuun. Sen viisi suorituskykymittaria kattavat:
Yhdistelmä on olennainen, sillä malli voi tuottaa tokeneita nopeasti mutta käynnistyä hitaasti, kuluttaa liikaa muistia tai hidastua kontekstin kasvaessa. Koko vastauksen valmistumiseen kuluva aika kuvaa erityisen hyvin sitä kokemusta, jonka käyttäjä saa paikalliselta avustajalta.
Artificial Analysis tuo vertailuun laadullisen puolen testeillä, joissa arvioidaan muun muassa ohjeiden noudattamista, työkalujen käyttöä ja päättelykykyä. 33
Pipette liittää jokaisen tuloksen tarkasti määriteltyyn kokoonpanoon ja julkaisee varmennettujen tulosten tuottamiseen käytetyt testiprotokollat. Julkisessa hallintapaneelissa tulokset on jaettu listaukseen, yksityiskohtaisiin mittaustuloksiin ja lähetettyihin vertailuriveihin. Näin käyttäjä voi tarkastella myös sijoituksen taustalla olevaa aineistoa. 1
Menetelmässä huomioidaan lisäksi suoritusympäristön ohjelmistoriippuvuudet. Liquid AI:n mukaan nykyiset julkiset suorituskykytulokset edellyttävät tiettyjä llama.cpp-koontiversioita, kuten versioita b10216 ja b10516. Runtime-version lukitseminen vähentää riskiä, että ohjelmistomuutos tulkitaan laitteiston tai mallin parannukseksi. 2
Täydellistä vaihtelun poistamista tämä ei silti takaa. Puhelimen lämpötila ja lämpökuristus, käyttöjärjestelmän tila, vapaan muistin määrä, laiteohjelmisto, valittu taustajärjestelmä ja pitkäkestoinen tehoraja voivat kaikki vaikuttaa tulokseen. Pisteitä voi verrata luotettavasti vain, jos nämä muuttujat ovat mahdollisimman samanlaiset.
Ensimmäiset tulokset osoittavat, miksi Pipette raportoi kokonaisia kokoonpanoja yleispätevien mallisijoitusten sijaan.
Johtopäätös on, että laatu, nopeus, viive ja muistinkulutus eivät aina kulje samaan suuntaan. Nopein malli ei automaattisesti ole kyvykkäin, eikä korkein laatupistemäärä tee mallista automaattisesti parasta vaihtoehtoa puhelimeen.
Ensimmäisen mobiilijulkaisun merkittävin rajoitus liittyy sovellusten erilaisiin suorituspolkuihin. iOS-versio voi käyttää GPU-laskentaa Applen Metal-ekosysteemin kautta, mukaan lukien MLX. Julkaisuhetkellä Android-versio rajoittui CPU-inferenssiin. 41
50
Tästä seuraa, että MLX:ää ja Metalia käyttävää iPhone-tulosta ei voi verrata suoraan Androidin CPU-tulokseen ja tehdä päätelmää puhelinten koko tekoälylaitteiston nopeudesta. iPhonen tulos voi hyötyä GPU-kiihdytyksestä, kun taas Android-tulos kuvaa nykyisen sovelluksen tarjoamaa CPU-suorituspolkua.
Android-tulokset ovat silti hyödyllisiä, kun halutaan arvioida paikallista CPU-inferenssiä tai kyseisen toteutuksen käyttäjäkokemusta. Niiden perusteella ei kuitenkaan pidä julistaa yhden puhelimen koko AI-piiriä toista nopeammaksi ennen kuin vastaavia GPU- tai NPU-taustajärjestelmiä testataan samalla työkuormalla.
Pipette julkaistiin samaan aikaan, kun piirivalmistajat markkinoivat entistä nopeampaa paikallista ja agenttimaista tekoälyä. Qualcomm kertoo Snapdragon 8 Elite Gen 5 -alustan käyttävän kolmannen sukupolven Oryon-suoritinta, jonka kellotaajuus yltää 4,74 gigahertsiin. Yhtiön mukaan suorituskyky paranee 20 prosenttia ja CPU:n energiatehokkuus 35 prosenttia. 24
Qualcomm on lisäksi esitellyt tulevaa lippulaiva-Snapdragon-alustaa, jonka Oryon-suorittimelle tavoitellaan 5 gigahertsin kellotaajuutta. Sen FlexCache-rakenne antaa erilaisten CPU-ytimien jakaa dynaamisesti allokoitua välimuistia. 23
Kellotaajuudet kertovat, miksi paikallisesta tekoälystä on tulossa yhä selvemmin laitteistokilpailu. Ne eivät kuitenkaan yksin ennusta kielimallin suorituskykyä. Kvantisointi, muistiväylän nopeus, välimuistin toiminta, runtime, GPU- tai NPU-kiihdytys, lämpötila ja pitkäkestoiset tehorajat voivat olla yhtä ratkaisevia.
Siksi Pipetten kokoonpanokohtainen lähestymistapa on hyödyllinen. Sen pitkäaikainen arvo riippuu siitä, pystyykö se osoittamaan, muuttuuko ilmoitettu piiriparannus oikeasti nopeammaksi, viiveettömämmäksi ja muistitehokkaammaksi paikalliseksi tekoälyksi toistettavassa testissä.
Toistaiseksi Pipetteä kannattaa pitää ennen kaikkea läpinäkyvänä käyttöönoton vertailutyökaluna – ei lopullisena iPhone- ja Android-laitteistojen paremmuusjärjestyksenä.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja.
24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja. Testit tukevat iOS ja Android sovelluksia, paikallisesti ladattavia malleja, useita kvantisointimuotoja sekä llama.cpp ajoalustoja macOS:llä, iOS:llä, Windowsilla ja Androidilla.
Ensimmäisissä mobiilituloksissa Nanbeige4.2 3B ja LFM2.5 2.6B jakoivat kärkisijan pistein 63, kun taas 4 bittinen Gemma 4 E2B saavutti iPhone 17 Prolla 48,37 generointitokenia sekunnissa MLX:n avulla.
24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja. Testit tukevat iOS ja Android sovelluksia, paikallisesti ladattavia malleja, useita kvantisointimuotoja sekä llama.cpp ajoalustoja macOS:llä, iOS:llä, Windowsilla ja Androidilla.
JulkaisijaMuokattu mallilla GPT-5.6 LunaKuvat luotu mallilla GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI:n Pipette on avoimen lähdekoodin vertailutyökalu, jolla mitataan tekoälymallien toimintaa siellä, missä niitä oikeasti käytetään: puhelimissa, kannettavissa tietokoneissa, pöytäkoneissa ja muissa reunalaitteissa. Liquid AI julkaisi sen yhteistyössä Artificial Analysisin kanssa 24. elokuuta. 3
1
Pipetten keskeinen idea on yksinkertainen mutta tärkeä: vertailun kohteena ei ole vain malli, vaan koko käyttöönotto. Tulos riippuu samanaikaisesti mallista, kvantisoinnista, ajoalustasta, laitteesta ja työkuormasta. 3
1
Monet tekoälylistaukset keskittyvät mallin kyvykkyyspisteisiin tai ilmoittavat yhden luvun tokenien käsittelynopeudesta. Pipette pyrkii kuvaamaan sitä, miten kokonainen järjestelmä toimii oikeassa laitteessa.
Sama malli voi käyttäytyä eri tavalla, jos käytössä on toinen kvantisointitaso, ajoalusta, taustajärjestelmä tai laite. Myös muistin kuormitus ja kontekstin pituus voivat muuttaa tulosta, vaikka mallin painot pysyisivät ennallaan.
Julkaisun yhteydessä esitelty julkinen aineisto sisältää yli 1 000 laboratoriossa varmennettua yhdistelmää, joissa vaihtelevat malli, kvantisointi, runtime eli suoritusympäristö, laite ja konteksti. Ensimmäinen julkaisu kattaa yli 30 mallia, useita kvantisointimuotoja sekä llama.cpp-koontiversioita macOS:lle, iOS:lle, Windowsille ja Androidille. Standardoidut testit käyttävät 256–8 192 tokenin kontekstipituuksia. 3
Liquid AI:n mittaukset yhdistyvät Artificial Analysisin arvioihin mobiililaitteille sopivien mallien älykkyydestä. Näin yhteistyö tarkastelee sekä mallin laatua että tietyn käyttöönoton nopeutta ja tehokkuutta. 33
Pipettestä on natiivisovellukset iOS:lle ja Androidille, joten mallin voi ajaa suoraan älypuhelimessa. Laajempi vertailuaineisto ulottuu myös macOS:ään ja Windowsiin tuettujen suoritusympäristöjen kautta. Julkaisun yhteydessä mainitut vertailulaitteet ovat iPhone 17 Pro, Galaxy S26 Ultra ja M5 Max -sirulla varustettu MacBook Pro. 3
38
Testattava malli täytyy ladata laitteelle ennen mittausta. Pipette mittaa siis paikallista päättelyä eli inferenssiä, ei pilvipalvelun rajapinnan verkkoviivettä. 41
50
Pipetten listalla on Liquid AI:n oma LFM2.5-malliperhe sekä muiden valmistajien malleja. Esimerkkeihin kuuluvat muun muassa Gemma, Nanbeige, Granite ja Qwen sekä erilaiset pienet ja pakatut malliversiot. 9
41
Työkalu tukee useita kvantisointimuotoja. Mobiiliälykkyyden vertailussa keskityttiin malleihin, jotka mahtuvat 4-bittisesti kvantisoituina 8 gigatavuun. Tämä tekee asetelmasta relevantin puhelimille, joissa käyttömuistia on rajallisesti. 3
41
Paikallista käyttöä varten Liquid AI erottaa toisistaan kaksi keskeistä formaattia. GGUF-muotoa käytetään yleisesti llama.cpp:n kanssa CPU- ja GPU-ajossa eri alustoilla, kun taas MLX on suunnattu erityisesti Apple Silicon -laitteille. 47
Mallin tiedostokoko ei kuitenkaan yksin kerro, kuinka nopeasti se toimii. Suoritusympäristö ja laitteen laitteistokiihdytin ratkaisevat, miten malli käytännössä käsitellään.
Julkaisun aineistossa standardoidut inferenssiasetukset kattavat 256–8 192 tokenin kontekstit. Artificial Analysisin erillisessä mobiiliälykkyyden arvioinnissa konteksti rajattiin 16 000 tokeniin. 3
33
Näitä lukuja ei pidä sekoittaa mallin ilmoitettuun enimmäiskontekstiin. Liquid AI ilmoittaa monille LFM-malleille 32 000 tokenin kontekstin ja LFM2.5-8B-A1B:lle 128 000 tokenin kontekstin. Mallin teoreettinen kapasiteetti ei kuitenkaan tarkoita, että jokainen puhelintesti ajetaan täydellä pituudella. 47
Pipette ei typistä suorituskykyä yhteen generointinopeuslukuun. Sen viisi suorituskykymittaria kattavat:
Yhdistelmä on olennainen, sillä malli voi tuottaa tokeneita nopeasti mutta käynnistyä hitaasti, kuluttaa liikaa muistia tai hidastua kontekstin kasvaessa. Koko vastauksen valmistumiseen kuluva aika kuvaa erityisen hyvin sitä kokemusta, jonka käyttäjä saa paikalliselta avustajalta.
Artificial Analysis tuo vertailuun laadullisen puolen testeillä, joissa arvioidaan muun muassa ohjeiden noudattamista, työkalujen käyttöä ja päättelykykyä. 33
Pipette liittää jokaisen tuloksen tarkasti määriteltyyn kokoonpanoon ja julkaisee varmennettujen tulosten tuottamiseen käytetyt testiprotokollat. Julkisessa hallintapaneelissa tulokset on jaettu listaukseen, yksityiskohtaisiin mittaustuloksiin ja lähetettyihin vertailuriveihin. Näin käyttäjä voi tarkastella myös sijoituksen taustalla olevaa aineistoa. 1
Menetelmässä huomioidaan lisäksi suoritusympäristön ohjelmistoriippuvuudet. Liquid AI:n mukaan nykyiset julkiset suorituskykytulokset edellyttävät tiettyjä llama.cpp-koontiversioita, kuten versioita b10216 ja b10516. Runtime-version lukitseminen vähentää riskiä, että ohjelmistomuutos tulkitaan laitteiston tai mallin parannukseksi. 2
Täydellistä vaihtelun poistamista tämä ei silti takaa. Puhelimen lämpötila ja lämpökuristus, käyttöjärjestelmän tila, vapaan muistin määrä, laiteohjelmisto, valittu taustajärjestelmä ja pitkäkestoinen tehoraja voivat kaikki vaikuttaa tulokseen. Pisteitä voi verrata luotettavasti vain, jos nämä muuttujat ovat mahdollisimman samanlaiset.
Ensimmäiset tulokset osoittavat, miksi Pipette raportoi kokonaisia kokoonpanoja yleispätevien mallisijoitusten sijaan.
Johtopäätös on, että laatu, nopeus, viive ja muistinkulutus eivät aina kulje samaan suuntaan. Nopein malli ei automaattisesti ole kyvykkäin, eikä korkein laatupistemäärä tee mallista automaattisesti parasta vaihtoehtoa puhelimeen.
Ensimmäisen mobiilijulkaisun merkittävin rajoitus liittyy sovellusten erilaisiin suorituspolkuihin. iOS-versio voi käyttää GPU-laskentaa Applen Metal-ekosysteemin kautta, mukaan lukien MLX. Julkaisuhetkellä Android-versio rajoittui CPU-inferenssiin. 41
50
Tästä seuraa, että MLX:ää ja Metalia käyttävää iPhone-tulosta ei voi verrata suoraan Androidin CPU-tulokseen ja tehdä päätelmää puhelinten koko tekoälylaitteiston nopeudesta. iPhonen tulos voi hyötyä GPU-kiihdytyksestä, kun taas Android-tulos kuvaa nykyisen sovelluksen tarjoamaa CPU-suorituspolkua.
Android-tulokset ovat silti hyödyllisiä, kun halutaan arvioida paikallista CPU-inferenssiä tai kyseisen toteutuksen käyttäjäkokemusta. Niiden perusteella ei kuitenkaan pidä julistaa yhden puhelimen koko AI-piiriä toista nopeammaksi ennen kuin vastaavia GPU- tai NPU-taustajärjestelmiä testataan samalla työkuormalla.
Pipette julkaistiin samaan aikaan, kun piirivalmistajat markkinoivat entistä nopeampaa paikallista ja agenttimaista tekoälyä. Qualcomm kertoo Snapdragon 8 Elite Gen 5 -alustan käyttävän kolmannen sukupolven Oryon-suoritinta, jonka kellotaajuus yltää 4,74 gigahertsiin. Yhtiön mukaan suorituskyky paranee 20 prosenttia ja CPU:n energiatehokkuus 35 prosenttia. 24
Qualcomm on lisäksi esitellyt tulevaa lippulaiva-Snapdragon-alustaa, jonka Oryon-suorittimelle tavoitellaan 5 gigahertsin kellotaajuutta. Sen FlexCache-rakenne antaa erilaisten CPU-ytimien jakaa dynaamisesti allokoitua välimuistia. 23
Kellotaajuudet kertovat, miksi paikallisesta tekoälystä on tulossa yhä selvemmin laitteistokilpailu. Ne eivät kuitenkaan yksin ennusta kielimallin suorituskykyä. Kvantisointi, muistiväylän nopeus, välimuistin toiminta, runtime, GPU- tai NPU-kiihdytys, lämpötila ja pitkäkestoiset tehorajat voivat olla yhtä ratkaisevia.
Siksi Pipetten kokoonpanokohtainen lähestymistapa on hyödyllinen. Sen pitkäaikainen arvo riippuu siitä, pystyykö se osoittamaan, muuttuuko ilmoitettu piiriparannus oikeasti nopeammaksi, viiveettömämmäksi ja muistitehokkaammaksi paikalliseksi tekoälyksi toistettavassa testissä.
Toistaiseksi Pipetteä kannattaa pitää ennen kaikkea läpinäkyvänä käyttöönoton vertailutyökaluna – ei lopullisena iPhone- ja Android-laitteistojen paremmuusjärjestyksenä.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja.
24. elokuuta julkaistu Pipette mittaa kokonaisia laitekohtaisia tekoälykäyttöönottoja, ei pelkkiä mallipainoja. Testit tukevat iOS ja Android sovelluksia, paikallisesti ladattavia malleja, useita kvantisointimuotoja sekä llama.cpp ajoalustoja macOS:llä, iOS:llä, Windowsilla ja Androidilla.
Ensimmäisissä mobiilituloksissa Nanbeige4.2 3B ja LFM2.5 2.6B jakoivat kärkisijan pistein 63, kun taas 4 bittinen Gemma 4 E2B saavutti iPhone 17 Prolla 48,37 generointitokenia sekunnissa MLX:n avulla.