Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja. Suite ini menyokong klien iOS dan Android, pelaksanaan model secara setempat, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android.
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette ialah suite penanda aras sumber terbuka Liquid AI untuk menilai model AI di tempat ia benar-benar digunakan—telefon, komputer riba, PC dan perkakasan edge yang lain. Dilancarkan bersama Artificial Analysis pada 24 Ogos, ia menjadikan pelaksanaan lengkap sebagai unit ukuran, bukannya model semata-mata. Ini bermakna keputusan dikaitkan dengan model, kuantisasi, runtime, peranti dan beban kerja secara serentak. 3
1
Banyak papan pendahulu AI menumpukan skor keupayaan atau melaporkan satu angka kelajuan inferens. Pipette pula cuba menunjukkan bagaimana keseluruhan sistem berfungsi dalam penggunaan sebenar. Perubahan pada kuantisasi, runtime, backend, tekanan memori atau perkakasan boleh mengubah keputusan walaupun berat model kekal sama.
Pelancaran ini merangkumi set data awam yang mengandungi keputusan disahkan makmal bagi lebih 1,000 konfigurasi model, kuantisasi, runtime, peranti dan konteks. Data awal meliputi lebih 30 model, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android. Konfigurasi prestasi yang diseragamkan menggunakan panjang konteks antara 256 hingga 8,192 token. 3
Pengukuran inferens Pipette digabungkan dengan penilaian kecerdasan model mudah alih oleh Artificial Analysis. Kerjasama ini melihat dua perkara sekali gus: sejauh mana model berfungsi dan seberapa pantas serta cekap pelaksanaan tertentu berjalan pada peranti. 33
Pipette menyediakan klien natif untuk iOS dan Android bagi menjalankan model terus pada telefon. Liputan penanda aras yang lebih luas turut merangkumi macOS dan Windows melalui binaan runtime yang disokong. Peranti rujukan yang dikenal pasti dalam bahan pelancaran termasuk iPhone 17 Pro, Galaxy S26 Ultra dan MacBook Pro dengan cip M5 Max. 3
38
Pengguna perlu memuat turun model ke peranti sebelum ujian bermula. Oleh itu, Pipette mengukur inferens setempat—bukan kependaman ketika berhubung dengan API awan. 41
50
Papan pendahulu Pipette merangkumi keluarga LFM2.5 Liquid AI bersama model pihak ketiga. Antara contoh yang disenaraikan ialah Gemma, Nanbeige, Granite, Qwen serta pelbagai model kecil atau termampat yang lain. 9
41
Penanda aras ini menyokong beberapa format kuantisasi. Perbandingan kecerdasan mudah alih memberi tumpuan kepada model yang kekal dalam saiz 8 GB apabila dikuantisasi kepada 4 bit, menjadikannya lebih relevan untuk telefon yang mempunyai memori terhad. 3
41
Bagi pelaksanaan setempat, dokumentasi Liquid membezakan antara GGUF, yang lazim digunakan bersama llama.cpp pada sasaran CPU dan GPU, dengan MLX, format yang direka untuk pelaksanaan pada Apple Silicon. 47 Saiz fail model terkuantisasi hanyalah sebahagian daripada gambaran; runtime dan backend perkakasan menentukan cara model itu diproses dalam amalan.
Set data pelancaran melaporkan konfigurasi inferens yang diseragamkan bagi panjang konteks antara 256 hingga 8,192 token. 3 Penilaian kecerdasan mudah alih berasingan oleh Artificial Analysis pula menggunakan had konteks 16K token.
33
Angka ini tidak boleh disamakan dengan tetingkap konteks maksimum yang diiklankan bagi sesebuah model. Dokumentasi model Liquid menyenaraikan konteks 32K token untuk banyak model LFM dan 128K untuk LFM2.5-8B-A1B. Namun, keupayaan model tidak bermaksud setiap ujian telefon akan menggunakan panjang konteks penuh itu. 47
Pipette menggabungkan beberapa dimensi prestasi pada peranti, bukannya mengehadkan keputusan kepada kelajuan menjana token. Lima metrik prestasinya meliputi:
Gabungan ini penting kerana sesuatu pelaksanaan mungkin menjana token dengan pantas tetapi mengambil masa lama untuk bermula, menggunakan terlalu banyak memori atau menjadi semakin perlahan apabila konteks bertambah. Masa respons hujung ke hujung amat berguna untuk menilai pengalaman sebenar pengguna ketika menggunakan pembantu AI setempat.
Bagi aspek kualiti, Artificial Analysis menjalankan penilaian seperti pematuhan arahan, penggunaan alat, penaakulan dan keupayaan berkaitan yang lain. 33
Setiap keputusan Pipette dipautkan kepada konfigurasi yang jelas, manakala protokol untuk menghasilkan data yang disahkan turut diterbitkan. Papan pemuka awamnya memisahkan perbandingan papan pendahulu daripada keputusan terperinci dan penghantaran data. Pengguna boleh menyemak baris data asas, bukan sekadar bergantung pada kedudukan keseluruhan. 1
Metodologi ini turut merekodkan kebergantungan runtime. Sebagai contoh, Liquid menyatakan bahawa keputusan prestasi awam semasa memerlukan binaan llama.cpp tertentu, termasuk b10216 dan b10516. 2 Menetapkan versi runtime membantu mengelakkan perubahan perisian daripada disalah anggap sebagai peningkatan pada model atau perkakasan.
Walaupun langkah ini meningkatkan kebolehbandingan, ia tidak menghapuskan semua variasi. Pendikitan terma, keadaan sistem operasi, memori peranti, firmware, pemilihan backend dan had kuasa berterusan boleh mempengaruhi keputusan telefon. Sesuatu skor paling bermakna apabila pemboleh ubah tersebut adalah sepadan.
Keputusan awal menjelaskan mengapa Pipette melaporkan konfigurasi lengkap, bukannya menghasilkan satu ranking universal untuk semua model.
Kesimpulannya, kualiti, kelajuan, kependaman dan penggunaan memori boleh menunjukkan arah yang berbeza. Model paling pantas tidak semestinya paling berkebolehan, manakala model dengan skor keupayaan tertinggi tidak semestinya memberikan pelaksanaan terbaik pada telefon.
Had paling penting dalam keluaran mudah alih awal Pipette ialah perbezaan antara kedua-dua klien. Versi iOS boleh menggunakan pengiraan GPU melalui ekosistem Metal Apple, termasuk MLX. Versi Android pada peringkat awal pula terhad kepada inferens CPU. 41
50
Justeru, keputusan iPhone yang menggunakan MLX/Metal dan keputusan Android yang dijana melalui CPU sahaja bukan perbandingan bersih antara keseluruhan perkakasan AI kedua-dua telefon. Pengukuran iOS mungkin mendapat manfaat daripada pecutan GPU, manakala pengukuran Android menggambarkan prestasi laluan CPU yang tersedia dalam klien semasa.
Keputusan Android masih berguna untuk memahami inferens setempat berasaskan CPU dan pengalaman yang diberikan oleh pelaksanaan tersebut. Namun, keputusan itu belum boleh digunakan untuk mengisytiharkan cip AI keseluruhan satu telefon lebih pantas daripada telefon lain sehingga backend GPU atau NPU yang setara diuji dengan beban kerja sama.
Pipette muncul ketika pengeluar cip semakin menonjolkan pemprosesan AI setempat dan AI berasaskan ejen. Platform Snapdragon 8 Elite Gen 5 Qualcomm menggunakan CPU Oryon generasi ketiga dengan kelajuan sehingga 4.74 GHz, selain mendakwa peningkatan prestasi CPU 20% dan kecekapan kuasa CPU 35%. 24
Qualcomm juga telah memperkenalkan gambaran awal platform Snapdragon perdana seterusnya dengan CPU Oryon yang menyasarkan 5 GHz serta seni bina FlexCache. Reka bentuk ini membolehkan teras CPU heterogen berkongsi kumpulan cache yang diperuntukkan secara dinamik. 23
Spesifikasi ini menunjukkan mengapa AI pada peranti semakin menjadi medan persaingan perkakasan. Namun, kelajuan jam semata-mata tidak dapat meramalkan prestasi model bahasa. Kuantisasi, lebar jalur memori, tingkah laku cache, pelaksanaan runtime, penggunaan GPU atau NPU, suhu dan had kuasa berterusan juga boleh memainkan peranan besar.
Di sinilah pendekatan berasaskan konfigurasi Pipette menjadi berguna. Peranan jangka panjangnya adalah untuk menunjukkan sama ada dakwaan peningkatan cip benar-benar menghasilkan AI setempat yang lebih pantas, lebih responsif dan lebih cekap memori di bawah beban kerja yang boleh diulang.
Buat masa ini, cara paling tepat memahami Pipette ialah sebagai penanda aras pelaksanaan yang telus—bukan ranking muktamad antara perkakasan iPhone dan Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja.
Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja. Suite ini menyokong klien iOS dan Android, pelaksanaan model secara setempat, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android.
Dalam ujian kecerdasan mudah alih dengan had konteks 16K token, Nanbeige4.2 3B dan LFM2.5 2.6B berkongsi tempat teratas dengan skor purata 63; satu konfigurasi Gemma 4 E2B 4 bit pada iPhone 17 Pro pula mencatat 48.37...
Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja. Suite ini menyokong klien iOS dan Android, pelaksanaan model secara setempat, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android.
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette ialah suite penanda aras sumber terbuka Liquid AI untuk menilai model AI di tempat ia benar-benar digunakan—telefon, komputer riba, PC dan perkakasan edge yang lain. Dilancarkan bersama Artificial Analysis pada 24 Ogos, ia menjadikan pelaksanaan lengkap sebagai unit ukuran, bukannya model semata-mata. Ini bermakna keputusan dikaitkan dengan model, kuantisasi, runtime, peranti dan beban kerja secara serentak. 3
1
Banyak papan pendahulu AI menumpukan skor keupayaan atau melaporkan satu angka kelajuan inferens. Pipette pula cuba menunjukkan bagaimana keseluruhan sistem berfungsi dalam penggunaan sebenar. Perubahan pada kuantisasi, runtime, backend, tekanan memori atau perkakasan boleh mengubah keputusan walaupun berat model kekal sama.
Pelancaran ini merangkumi set data awam yang mengandungi keputusan disahkan makmal bagi lebih 1,000 konfigurasi model, kuantisasi, runtime, peranti dan konteks. Data awal meliputi lebih 30 model, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android. Konfigurasi prestasi yang diseragamkan menggunakan panjang konteks antara 256 hingga 8,192 token. 3
Pengukuran inferens Pipette digabungkan dengan penilaian kecerdasan model mudah alih oleh Artificial Analysis. Kerjasama ini melihat dua perkara sekali gus: sejauh mana model berfungsi dan seberapa pantas serta cekap pelaksanaan tertentu berjalan pada peranti. 33
Pipette menyediakan klien natif untuk iOS dan Android bagi menjalankan model terus pada telefon. Liputan penanda aras yang lebih luas turut merangkumi macOS dan Windows melalui binaan runtime yang disokong. Peranti rujukan yang dikenal pasti dalam bahan pelancaran termasuk iPhone 17 Pro, Galaxy S26 Ultra dan MacBook Pro dengan cip M5 Max. 3
38
Pengguna perlu memuat turun model ke peranti sebelum ujian bermula. Oleh itu, Pipette mengukur inferens setempat—bukan kependaman ketika berhubung dengan API awan. 41
50
Papan pendahulu Pipette merangkumi keluarga LFM2.5 Liquid AI bersama model pihak ketiga. Antara contoh yang disenaraikan ialah Gemma, Nanbeige, Granite, Qwen serta pelbagai model kecil atau termampat yang lain. 9
41
Penanda aras ini menyokong beberapa format kuantisasi. Perbandingan kecerdasan mudah alih memberi tumpuan kepada model yang kekal dalam saiz 8 GB apabila dikuantisasi kepada 4 bit, menjadikannya lebih relevan untuk telefon yang mempunyai memori terhad. 3
41
Bagi pelaksanaan setempat, dokumentasi Liquid membezakan antara GGUF, yang lazim digunakan bersama llama.cpp pada sasaran CPU dan GPU, dengan MLX, format yang direka untuk pelaksanaan pada Apple Silicon. 47 Saiz fail model terkuantisasi hanyalah sebahagian daripada gambaran; runtime dan backend perkakasan menentukan cara model itu diproses dalam amalan.
Set data pelancaran melaporkan konfigurasi inferens yang diseragamkan bagi panjang konteks antara 256 hingga 8,192 token. 3 Penilaian kecerdasan mudah alih berasingan oleh Artificial Analysis pula menggunakan had konteks 16K token.
33
Angka ini tidak boleh disamakan dengan tetingkap konteks maksimum yang diiklankan bagi sesebuah model. Dokumentasi model Liquid menyenaraikan konteks 32K token untuk banyak model LFM dan 128K untuk LFM2.5-8B-A1B. Namun, keupayaan model tidak bermaksud setiap ujian telefon akan menggunakan panjang konteks penuh itu. 47
Pipette menggabungkan beberapa dimensi prestasi pada peranti, bukannya mengehadkan keputusan kepada kelajuan menjana token. Lima metrik prestasinya meliputi:
Gabungan ini penting kerana sesuatu pelaksanaan mungkin menjana token dengan pantas tetapi mengambil masa lama untuk bermula, menggunakan terlalu banyak memori atau menjadi semakin perlahan apabila konteks bertambah. Masa respons hujung ke hujung amat berguna untuk menilai pengalaman sebenar pengguna ketika menggunakan pembantu AI setempat.
Bagi aspek kualiti, Artificial Analysis menjalankan penilaian seperti pematuhan arahan, penggunaan alat, penaakulan dan keupayaan berkaitan yang lain. 33
Setiap keputusan Pipette dipautkan kepada konfigurasi yang jelas, manakala protokol untuk menghasilkan data yang disahkan turut diterbitkan. Papan pemuka awamnya memisahkan perbandingan papan pendahulu daripada keputusan terperinci dan penghantaran data. Pengguna boleh menyemak baris data asas, bukan sekadar bergantung pada kedudukan keseluruhan. 1
Metodologi ini turut merekodkan kebergantungan runtime. Sebagai contoh, Liquid menyatakan bahawa keputusan prestasi awam semasa memerlukan binaan llama.cpp tertentu, termasuk b10216 dan b10516. 2 Menetapkan versi runtime membantu mengelakkan perubahan perisian daripada disalah anggap sebagai peningkatan pada model atau perkakasan.
Walaupun langkah ini meningkatkan kebolehbandingan, ia tidak menghapuskan semua variasi. Pendikitan terma, keadaan sistem operasi, memori peranti, firmware, pemilihan backend dan had kuasa berterusan boleh mempengaruhi keputusan telefon. Sesuatu skor paling bermakna apabila pemboleh ubah tersebut adalah sepadan.
Keputusan awal menjelaskan mengapa Pipette melaporkan konfigurasi lengkap, bukannya menghasilkan satu ranking universal untuk semua model.
Kesimpulannya, kualiti, kelajuan, kependaman dan penggunaan memori boleh menunjukkan arah yang berbeza. Model paling pantas tidak semestinya paling berkebolehan, manakala model dengan skor keupayaan tertinggi tidak semestinya memberikan pelaksanaan terbaik pada telefon.
Had paling penting dalam keluaran mudah alih awal Pipette ialah perbezaan antara kedua-dua klien. Versi iOS boleh menggunakan pengiraan GPU melalui ekosistem Metal Apple, termasuk MLX. Versi Android pada peringkat awal pula terhad kepada inferens CPU. 41
50
Justeru, keputusan iPhone yang menggunakan MLX/Metal dan keputusan Android yang dijana melalui CPU sahaja bukan perbandingan bersih antara keseluruhan perkakasan AI kedua-dua telefon. Pengukuran iOS mungkin mendapat manfaat daripada pecutan GPU, manakala pengukuran Android menggambarkan prestasi laluan CPU yang tersedia dalam klien semasa.
Keputusan Android masih berguna untuk memahami inferens setempat berasaskan CPU dan pengalaman yang diberikan oleh pelaksanaan tersebut. Namun, keputusan itu belum boleh digunakan untuk mengisytiharkan cip AI keseluruhan satu telefon lebih pantas daripada telefon lain sehingga backend GPU atau NPU yang setara diuji dengan beban kerja sama.
Pipette muncul ketika pengeluar cip semakin menonjolkan pemprosesan AI setempat dan AI berasaskan ejen. Platform Snapdragon 8 Elite Gen 5 Qualcomm menggunakan CPU Oryon generasi ketiga dengan kelajuan sehingga 4.74 GHz, selain mendakwa peningkatan prestasi CPU 20% dan kecekapan kuasa CPU 35%. 24
Qualcomm juga telah memperkenalkan gambaran awal platform Snapdragon perdana seterusnya dengan CPU Oryon yang menyasarkan 5 GHz serta seni bina FlexCache. Reka bentuk ini membolehkan teras CPU heterogen berkongsi kumpulan cache yang diperuntukkan secara dinamik. 23
Spesifikasi ini menunjukkan mengapa AI pada peranti semakin menjadi medan persaingan perkakasan. Namun, kelajuan jam semata-mata tidak dapat meramalkan prestasi model bahasa. Kuantisasi, lebar jalur memori, tingkah laku cache, pelaksanaan runtime, penggunaan GPU atau NPU, suhu dan had kuasa berterusan juga boleh memainkan peranan besar.
Di sinilah pendekatan berasaskan konfigurasi Pipette menjadi berguna. Peranan jangka panjangnya adalah untuk menunjukkan sama ada dakwaan peningkatan cip benar-benar menghasilkan AI setempat yang lebih pantas, lebih responsif dan lebih cekap memori di bawah beban kerja yang boleh diulang.
Buat masa ini, cara paling tepat memahami Pipette ialah sebagai penanda aras pelaksanaan yang telus—bukan ranking muktamad antara perkakasan iPhone dan Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja.
Dilancarkan pada 24 Ogos bersama Artificial Analysis, Pipette mengukur keseluruhan penggunaan AI pada peranti, bukan berat model sahaja. Suite ini menyokong klien iOS dan Android, pelaksanaan model secara setempat, pelbagai format kuantisasi serta binaan llama.cpp untuk macOS, iOS, Windows dan Android.
Dalam ujian kecerdasan mudah alih dengan had konteks 16K token, Nanbeige4.2 3B dan LFM2.5 2.6B berkongsi tempat teratas dengan skor purata 63; satu konfigurasi Gemma 4 E2B 4 bit pada iPhone 17 Pro pula mencatat 48.37...