Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti. Ujian mengambil kira gabungan model, kuantisasi, runtime, peranti dan beban kerja, bukan prestasi model secara berasingan.
Diterbitkan olehImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette ialah suite penanda aras percuma dan sumber terbuka daripada Liquid AI untuk mengukur prestasi AI yang benar-benar dijalankan pada peranti seperti telefon atau komputer riba. Ia tidak hanya menilai model AI secara teori, sebaliknya menguji keseluruhan konfigurasi: model, tahap kuantisasi, runtime, peranti dan beban kerja. 11
4
Platform ini dilancarkan pada 24 Ogos menerusi kerjasama Liquid AI dan Artificial Analysis. Liquid AI mengendalikan pengukuran inferens, manakala Artificial Analysis menilai tahap kecerdasan model mudah alih. 11
9
Dataset awam awal Pipette mengandungi lebih 1,000 konfigurasi yang telah disahkan melalui ujian makmal. Papan pendahulunya merangkumi lebih 30 model, tujuh pilihan kuantisasi dan empat peranti awal. 11
4
Lima metrik prestasi pada peranti yang dilaporkan termasuk:
Ini penting kerana kadar penjanaan yang tinggi sahaja tidak semestinya bermakna pengalaman penggunaan lebih baik. Model yang pantas menjana token mungkin mengambil masa lebih lama untuk menghasilkan token pertama atau menggunakan lebih banyak memori.
Pipette menyediakan klien untuk iOS dan Android. Aplikasi ini menjalankan model yang dimuat turun terus ke peranti, bukannya menghantar permintaan kepada pelayan awan. 10
8
Liputan awal turut melibatkan binaan llama.cpp untuk macOS, iOS, Windows dan Android. Namun begitu, keputusan pada papan pendahulu merujuk kepada konfigurasi tertentu, jadi jenis peranti, jumlah RAM, sistem operasi, runtime dan binaan perisian perlu dipadankan sebelum dua keputusan boleh dibandingkan secara adil. 11
6
Model yang disokong pada peringkat awal termasuk keluarga LFM milik Liquid AI serta model kecil pihak ketiga seperti Gemma dan Nanbeige. Perbandingan kecerdasan mudah alih memberi tumpuan kepada model yang boleh dimuatkan dalam 8 GB selepas dikuantisasi kepada 4 bit. 10
8
Kuantisasi ialah proses mengurangkan ketepatan numerik model supaya saiz dan penggunaan memorinya lebih kecil. Dalam ekosistem tempatan, format seperti GGUF lazimnya digunakan untuk inferens CPU atau GPU, manakala MLX dioptimumkan untuk peranti Apple Silicon. 2
Ujian kecerdasan mudah alih yang diterbitkan menggunakan had konteks 16K token. Had ini ialah tetapan piawai bagi ujian tersebut, bukannya had mutlak semua model. Katalog LFM Liquid AI sendiri menyenaraikan konteks 32K untuk banyak model dan sehingga 128K bagi LFM2.5-8B-A1B. 8
2
Dataset prestasi Pipette yang diterbitkan pula merangkumi panjang konteks antara 256 hingga 8,192 token bagi konfigurasi awalnya. 11
Salah satu keputusan yang diketengahkan ialah iPhone 17 Pro yang mencapai 48.37 token sesaat ketika menjalankan Gemma 4 E2B dalam kuantisasi 4 bit melalui Apple MLX. Itu ialah keputusan bagi konfigurasi khusus “Gemma 4 E2B + 4 bit + MLX/Metal + iPhone 17 Pro”, bukannya skor umum untuk semua versi Gemma atau semua telefon. 4
5
Dalam penilaian kecerdasan mudah alih dengan konteks 16K, Nanbeige4.2-3B dan LFM2.5-2.6B berkongsi skor purata tertinggi, iaitu 63. 9
8
Perbezaan utama antara platform ialah iOS boleh menggunakan pengiraan GPU melalui Metal atau MLX, manakala klien Android pada peringkat awal hanya menggunakan CPU. 10
Oleh itu, angka kelajuan iPhone dan Android pada masa ini bukan perbandingan terus antara cip. Keputusan Apple boleh mendapat manfaat daripada pecutan GPU, sementara keputusan Android mencerminkan inferens CPU. Data Android masih berguna untuk menilai prestasi CPU dan pengalaman penggunaan di bawah runtime tersebut, tetapi tidak boleh membuktikan bahawa keseluruhan perkakasan AI pada satu telefon sememangnya lebih pantas. 10
4
Perbandingan yang lebih adil memerlukan sokongan GPU Android dan enjin NPU yang dipercepatkan. Liquid AI menyatakan bahawa liputan peranti dan ujian berasaskan NPU merupakan antara hala tuju seterusnya. 6
4
Belum. Sumbangan utama Pipette ialah metodologi yang lebih telus: setiap keputusan dipautkan kepada konfigurasi penuh, dijalankan dalam persekitaran makmal yang disahkan dan disertakan protokol kebolehulangan. 4
11
Pendekatan ini lebih bermakna berbanding angka “token sesaat” yang berdiri sendiri daripada vendor. Namun, keputusan masih boleh berubah mengikut suhu peranti, keadaan sistem operasi, varian peranti, jumlah RAM, runtime, backend, lebar jalur memori dan had kuasa berterusan.
Pipette juga menetapkan kebergantungan perisian tertentu. Sebagai contoh, keputusan prestasi awam semasa memerlukan binaan llama.cpp tertentu seperti b10216 dan b10516. 6
Pelancaran Pipette hadir ketika pengeluar cip semakin menekankan keupayaan AI tempatan dan beban kerja berasaskan ejen. Qualcomm mendakwa CPU Oryon generasi ketiga pada Snapdragon 8 Elite Gen 5 boleh mencapai 4.74 GHz, selain menawarkan peningkatan prestasi CPU sebanyak 20% dan kecekapan kuasa CPU sebanyak 35% bagi platform itu. 14
Qualcomm turut mempratonton platform Snapdragon perdana seterusnya dengan CPU Oryon yang menyasarkan 5 GHz serta seni bina FlexCache untuk berkongsi cache secara dinamik antara teras. Namun, kelajuan jam semata-mata tidak dapat meramalkan prestasi inferens model bahasa besar. Runtime, lebar jalur memori, tingkah laku cache, kuantisasi, backend GPU atau NPU, suhu dan had kuasa berterusan semuanya memainkan peranan. 9
13
Kesimpulannya, tafsiran paling tepat terhadap Pipette buat masa ini ialah ia merupakan penanda aras penggunaan AI pada peranti yang telus dan boleh diulang—bukan ranking muktamad perkakasan telefon merentas iOS dan Android. Nilainya akan meningkat apabila lebih banyak peranti, backend GPU dan NPU diuji menggunakan beban kerja yang sama. 6
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti.
Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti. Ujian mengambil kira gabungan model, kuantisasi, runtime, peranti dan beban kerja, bukan prestasi model secara berasingan.
Pelancaran pada 24 Ogos dibuat bersama Artificial Analysis, yang mengendalikan penilaian tahap kecerdasan model mudah alih.
Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti. Ujian mengambil kira gabungan model, kuantisasi, runtime, peranti dan beban kerja, bukan prestasi model secara berasingan.
Diterbitkan olehImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette ialah suite penanda aras percuma dan sumber terbuka daripada Liquid AI untuk mengukur prestasi AI yang benar-benar dijalankan pada peranti seperti telefon atau komputer riba. Ia tidak hanya menilai model AI secara teori, sebaliknya menguji keseluruhan konfigurasi: model, tahap kuantisasi, runtime, peranti dan beban kerja. 11
4
Platform ini dilancarkan pada 24 Ogos menerusi kerjasama Liquid AI dan Artificial Analysis. Liquid AI mengendalikan pengukuran inferens, manakala Artificial Analysis menilai tahap kecerdasan model mudah alih. 11
9
Dataset awam awal Pipette mengandungi lebih 1,000 konfigurasi yang telah disahkan melalui ujian makmal. Papan pendahulunya merangkumi lebih 30 model, tujuh pilihan kuantisasi dan empat peranti awal. 11
4
Lima metrik prestasi pada peranti yang dilaporkan termasuk:
Ini penting kerana kadar penjanaan yang tinggi sahaja tidak semestinya bermakna pengalaman penggunaan lebih baik. Model yang pantas menjana token mungkin mengambil masa lebih lama untuk menghasilkan token pertama atau menggunakan lebih banyak memori.
Pipette menyediakan klien untuk iOS dan Android. Aplikasi ini menjalankan model yang dimuat turun terus ke peranti, bukannya menghantar permintaan kepada pelayan awan. 10
8
Liputan awal turut melibatkan binaan llama.cpp untuk macOS, iOS, Windows dan Android. Namun begitu, keputusan pada papan pendahulu merujuk kepada konfigurasi tertentu, jadi jenis peranti, jumlah RAM, sistem operasi, runtime dan binaan perisian perlu dipadankan sebelum dua keputusan boleh dibandingkan secara adil. 11
6
Model yang disokong pada peringkat awal termasuk keluarga LFM milik Liquid AI serta model kecil pihak ketiga seperti Gemma dan Nanbeige. Perbandingan kecerdasan mudah alih memberi tumpuan kepada model yang boleh dimuatkan dalam 8 GB selepas dikuantisasi kepada 4 bit. 10
8
Kuantisasi ialah proses mengurangkan ketepatan numerik model supaya saiz dan penggunaan memorinya lebih kecil. Dalam ekosistem tempatan, format seperti GGUF lazimnya digunakan untuk inferens CPU atau GPU, manakala MLX dioptimumkan untuk peranti Apple Silicon. 2
Ujian kecerdasan mudah alih yang diterbitkan menggunakan had konteks 16K token. Had ini ialah tetapan piawai bagi ujian tersebut, bukannya had mutlak semua model. Katalog LFM Liquid AI sendiri menyenaraikan konteks 32K untuk banyak model dan sehingga 128K bagi LFM2.5-8B-A1B. 8
2
Dataset prestasi Pipette yang diterbitkan pula merangkumi panjang konteks antara 256 hingga 8,192 token bagi konfigurasi awalnya. 11
Salah satu keputusan yang diketengahkan ialah iPhone 17 Pro yang mencapai 48.37 token sesaat ketika menjalankan Gemma 4 E2B dalam kuantisasi 4 bit melalui Apple MLX. Itu ialah keputusan bagi konfigurasi khusus “Gemma 4 E2B + 4 bit + MLX/Metal + iPhone 17 Pro”, bukannya skor umum untuk semua versi Gemma atau semua telefon. 4
5
Dalam penilaian kecerdasan mudah alih dengan konteks 16K, Nanbeige4.2-3B dan LFM2.5-2.6B berkongsi skor purata tertinggi, iaitu 63. 9
8
Perbezaan utama antara platform ialah iOS boleh menggunakan pengiraan GPU melalui Metal atau MLX, manakala klien Android pada peringkat awal hanya menggunakan CPU. 10
Oleh itu, angka kelajuan iPhone dan Android pada masa ini bukan perbandingan terus antara cip. Keputusan Apple boleh mendapat manfaat daripada pecutan GPU, sementara keputusan Android mencerminkan inferens CPU. Data Android masih berguna untuk menilai prestasi CPU dan pengalaman penggunaan di bawah runtime tersebut, tetapi tidak boleh membuktikan bahawa keseluruhan perkakasan AI pada satu telefon sememangnya lebih pantas. 10
4
Perbandingan yang lebih adil memerlukan sokongan GPU Android dan enjin NPU yang dipercepatkan. Liquid AI menyatakan bahawa liputan peranti dan ujian berasaskan NPU merupakan antara hala tuju seterusnya. 6
4
Belum. Sumbangan utama Pipette ialah metodologi yang lebih telus: setiap keputusan dipautkan kepada konfigurasi penuh, dijalankan dalam persekitaran makmal yang disahkan dan disertakan protokol kebolehulangan. 4
11
Pendekatan ini lebih bermakna berbanding angka “token sesaat” yang berdiri sendiri daripada vendor. Namun, keputusan masih boleh berubah mengikut suhu peranti, keadaan sistem operasi, varian peranti, jumlah RAM, runtime, backend, lebar jalur memori dan had kuasa berterusan.
Pipette juga menetapkan kebergantungan perisian tertentu. Sebagai contoh, keputusan prestasi awam semasa memerlukan binaan llama.cpp tertentu seperti b10216 dan b10516. 6
Pelancaran Pipette hadir ketika pengeluar cip semakin menekankan keupayaan AI tempatan dan beban kerja berasaskan ejen. Qualcomm mendakwa CPU Oryon generasi ketiga pada Snapdragon 8 Elite Gen 5 boleh mencapai 4.74 GHz, selain menawarkan peningkatan prestasi CPU sebanyak 20% dan kecekapan kuasa CPU sebanyak 35% bagi platform itu. 14
Qualcomm turut mempratonton platform Snapdragon perdana seterusnya dengan CPU Oryon yang menyasarkan 5 GHz serta seni bina FlexCache untuk berkongsi cache secara dinamik antara teras. Namun, kelajuan jam semata-mata tidak dapat meramalkan prestasi inferens model bahasa besar. Runtime, lebar jalur memori, tingkah laku cache, kuantisasi, backend GPU atau NPU, suhu dan had kuasa berterusan semuanya memainkan peranan. 9
13
Kesimpulannya, tafsiran paling tepat terhadap Pipette buat masa ini ialah ia merupakan penanda aras penggunaan AI pada peranti yang telus dan boleh diulang—bukan ranking muktamad perkakasan telefon merentas iOS dan Android. Nilainya akan meningkat apabila lebih banyak peranti, backend GPU dan NPU diuji menggunakan beban kerja yang sama. 6
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti.
Pipette ialah suite penanda aras percuma dan sumber terbuka yang mengukur prestasi penggunaan AI secara terus pada peranti. Ujian mengambil kira gabungan model, kuantisasi, runtime, peranti dan beban kerja, bukan prestasi model secara berasingan.
Pelancaran pada 24 Ogos dibuat bersama Artificial Analysis, yang mengendalikan penilaian tahap kecerdasan model mudah alih.