Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja. Benchmark ini mencakup lebih dari 1.000 konfigurasi, lebih dari 30 model, berbagai format kuantisasi, runtime llama.cpp, serta konteks 256 hingga 8.192 token.
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette adalah rangkaian benchmark open source dari Liquid AI untuk menguji model AI di tempat model itu benar-benar digunakan: ponsel, laptop, PC, dan perangkat edge lainnya. Diluncurkan bersama Artificial Analysis pada 24 Agustus, Pipette menjadikan deployment—bukan model semata—sebagai unit pengukuran. Artinya, hasil benchmark terikat pada kombinasi model, kuantisasi, runtime, perangkat, dan beban kerja tertentu. 3
1
Banyak papan peringkat AI berfokus pada skor kemampuan atau hanya menampilkan satu angka kecepatan inferensi. Pipette mencoba menggambarkan perilaku seluruh sistem ketika model dijalankan secara lokal.
Perubahan pada format kuantisasi, runtime, backend, tekanan memori, atau perangkat keras dapat mengubah hasil meskipun bobot modelnya tetap sama. Karena itu, angka yang muncul di Pipette sebaiknya dibaca sebagai hasil dari satu konfigurasi spesifik, bukan sebagai peringkat mutlak sebuah model.
Rilis awalnya menyertakan dataset publik berisi hasil yang diverifikasi di laboratorium untuk lebih dari 1.000 konfigurasi model, kuantisasi, runtime, perangkat, dan konteks. Cakupannya meliputi lebih dari 30 model, berbagai format kuantisasi, serta build llama.cpp untuk macOS, iOS, Windows, dan Android. Data performanya menggunakan panjang konteks standar antara 256 hingga 8.192 token. 3
Pengukuran inferensi dari Liquid AI dipasangkan dengan evaluasi kecerdasan model seluler dari Artificial Analysis. Kolaborasi ini memungkinkan penilaian terhadap dua sisi sekaligus: seberapa baik model bekerja dan seberapa cepat serta efisien model tersebut berjalan pada deployment tertentu. 33
Pipette menyediakan klien native untuk iOS dan Android, sehingga model dapat dijalankan langsung di smartphone. Cakupan benchmark yang lebih luas juga mencakup macOS dan Windows melalui build runtime yang didukung. Perangkat referensi yang disebut dalam materi peluncuran antara lain iPhone 17 Pro, Galaxy S26 Ultra, dan MacBook Pro dengan chip M5 Max. 3
38
Model harus diunduh ke perangkat sebelum pengujian dimulai. Dengan demikian, Pipette mengukur inferensi lokal, bukan latensi ketika pengguna mengirim permintaan ke API cloud. 41
50
Papan peringkat Pipette mencakup keluarga LFM2.5 milik Liquid AI dan sejumlah model pihak ketiga. Contohnya adalah Gemma, Nanbeige, Granite, Qwen, serta berbagai model berukuran kecil atau versi terkompresi lainnya. 9
41
Benchmark ini mendukung beberapa format kuantisasi. Dalam perbandingan kecerdasan model seluler, pengujian difokuskan pada model yang tetap berukuran maksimal 8 GB setelah dikuantisasi ke 4 bit. Batas ini membuat pengujian lebih relevan untuk smartphone dengan kapasitas memori terbatas. 3
41
Untuk deployment lokal, dokumentasi Liquid AI membedakan GGUF, yang umum digunakan bersama llama.cpp pada target CPU dan GPU, dari MLX, yang dirancang untuk deployment di perangkat Apple Silicon. 47 Ukuran berkas model terkuantisasi hanyalah salah satu faktor. Runtime dan backend perangkat keras turut menentukan bagaimana model tersebut diproses dalam praktik.
Dataset peluncuran Pipette melaporkan konfigurasi inferensi standar dengan panjang konteks 256 hingga 8.192 token. 3 Sementara itu, evaluasi kecerdasan seluler dari Artificial Analysis menggunakan batas konteks 16K token.
33
Angka-angka tersebut tidak boleh disamakan dengan panjang konteks maksimum yang tercantum dalam spesifikasi model. Dokumentasi Liquid AI mencantumkan konteks 32K token untuk banyak model LFM dan 128K untuk LFM2.5-8B-A1B. Namun, kemampuan maksimum sebuah model tidak berarti setiap pengujian di ponsel akan menjalankan konteks sepanjang itu. 47
Pipette menggabungkan beberapa dimensi performa, bukan sekadar mengukur kecepatan model menghasilkan token. Lima metrik performanya mencakup:
Kombinasi ini penting karena sebuah deployment dapat menghasilkan token dengan cepat, tetapi tetap membutuhkan waktu lama untuk mulai merespons, menggunakan terlalu banyak memori, atau melambat ketika konteks bertambah. Waktu respons dari awal hingga akhir juga lebih dekat dengan pengalaman nyata pengguna saat memakai asisten AI lokal.
Artificial Analysis melengkapi sisi performa teknis tersebut dengan evaluasi kualitas, termasuk kemampuan mengikuti instruksi, penggunaan alat, penalaran, dan kapabilitas terkait lainnya. 33
Setiap hasil Pipette dikaitkan dengan konfigurasi yang jelas. Protokol pengujian yang digunakan untuk menghasilkan data terverifikasi juga dipublikasikan. Dasbornya memisahkan perbandingan di papan peringkat dari detail hasil dan data submission, sehingga pengguna dapat menelusuri baris benchmark yang mendasari suatu angka, bukan hanya mengandalkan peringkat utama. 1
Metodologinya turut mencatat dependensi runtime. Liquid AI, misalnya, menyatakan bahwa hasil performa publik saat ini memerlukan build llama.cpp tertentu, termasuk b10216 dan b10516. 2 Penguncian versi runtime membantu mencegah perubahan perangkat lunak dianggap keliru sebagai peningkatan performa model atau perangkat keras.
Meski begitu, langkah-langkah tersebut tidak menghapus semua sumber variasi. Thermal throttling, kondisi sistem operasi, kapasitas memori perangkat, firmware, pilihan backend, dan batas daya berkelanjutan tetap dapat memengaruhi hasil ponsel. Sebuah skor paling bermakna jika variabel-variabel tersebut dibuat setara.
Hasil perdana Pipette memperlihatkan alasan benchmark ini melaporkan konfigurasi lengkap, bukan peringkat universal antarmodel.
Pelajaran utamanya sederhana: kualitas, kecepatan, latensi, dan penggunaan memori bisa menunjuk ke arah yang berbeda. Model tercepat belum tentu paling cakap, sementara model dengan skor kemampuan tertinggi belum tentu menjadi pilihan terbaik untuk deployment di ponsel.
Keterbatasan terpenting pada rilis seluler awal adalah perbedaan kemampuan kedua klien. Versi iOS dapat menggunakan komputasi GPU melalui ekosistem Metal milik Apple, termasuk MLX. Pada tahap awal, versi Android masih terbatas pada inferensi melalui CPU. 41
50
Akibatnya, hasil iPhone yang menggunakan MLX/Metal dan hasil Android yang diperoleh hanya melalui CPU bukan perbandingan langsung seluruh kemampuan AI dari kedua ponsel. Pengukuran iOS dapat memperoleh manfaat akselerasi GPU, sedangkan pengukuran Android mencerminkan performa jalur CPU yang tersedia pada klien saat ini.
Hasil Android tetap berguna untuk memahami inferensi lokal berbasis CPU dan pengalaman yang diberikan implementasi tersebut. Namun, hasil itu belum dapat digunakan untuk menyimpulkan bahwa silikon AI keseluruhan pada satu ponsel lebih cepat daripada ponsel lain. Perbandingan lintas platform yang lebih adil membutuhkan backend GPU atau NPU yang setara, dengan beban kerja dan konfigurasi yang sama.
Pipette hadir ketika produsen chip sedang berlomba meningkatkan pemrosesan AI lokal dan AI agentik. Platform Snapdragon 8 Elite Gen 5 dari Qualcomm menggunakan CPU Oryon generasi ketiga dengan kecepatan hingga 4,74 GHz. Qualcomm mengklaim peningkatan performa CPU sebesar 20% dan efisiensi daya CPU sebesar 35%. 24
Qualcomm juga telah mempratinjau platform Snapdragon flagship berikutnya dengan CPU Oryon yang menargetkan kecepatan 5 GHz. Arsitektur FlexCache pada chip tersebut memungkinkan inti CPU heterogen berbagi kumpulan cache yang dialokasikan secara dinamis. 23
Spesifikasi itu menunjukkan bahwa AI di perangkat semakin menjadi arena persaingan perangkat keras. Namun, kecepatan clock saja tidak cukup untuk memprediksi performa model bahasa. Kuantisasi, bandwidth memori, perilaku cache, implementasi runtime, penggunaan GPU atau NPU, suhu, dan batas daya berkelanjutan juga dapat sangat berpengaruh.
Di sinilah pendekatan berbasis konfigurasi milik Pipette menjadi relevan. Peran jangka panjangnya adalah menunjukkan apakah klaim peningkatan sebuah chip benar-benar menghasilkan AI lokal yang lebih cepat, lebih responsif, dan lebih hemat memori dalam beban kerja yang dapat direproduksi.
Untuk saat ini, Pipette paling tepat dipahami sebagai benchmark deployment yang transparan—bukan sebagai peringkat final antara perangkat keras iPhone dan Android.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja.
Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja. Benchmark ini mencakup lebih dari 1.000 konfigurasi, lebih dari 30 model, berbagai format kuantisasi, runtime llama.cpp, serta konteks 256 hingga 8.192 token.
Lima metrik utamanya meliputi pemrosesan prompt, kecepatan generasi, waktu menuju token pertama, waktu respons lengkap, dan penggunaan memori.
Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja. Benchmark ini mencakup lebih dari 1.000 konfigurasi, lebih dari 30 model, berbagai format kuantisasi, runtime llama.cpp, serta konteks 256 hingga 8.192 token.
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette adalah rangkaian benchmark open source dari Liquid AI untuk menguji model AI di tempat model itu benar-benar digunakan: ponsel, laptop, PC, dan perangkat edge lainnya. Diluncurkan bersama Artificial Analysis pada 24 Agustus, Pipette menjadikan deployment—bukan model semata—sebagai unit pengukuran. Artinya, hasil benchmark terikat pada kombinasi model, kuantisasi, runtime, perangkat, dan beban kerja tertentu. 3
1
Banyak papan peringkat AI berfokus pada skor kemampuan atau hanya menampilkan satu angka kecepatan inferensi. Pipette mencoba menggambarkan perilaku seluruh sistem ketika model dijalankan secara lokal.
Perubahan pada format kuantisasi, runtime, backend, tekanan memori, atau perangkat keras dapat mengubah hasil meskipun bobot modelnya tetap sama. Karena itu, angka yang muncul di Pipette sebaiknya dibaca sebagai hasil dari satu konfigurasi spesifik, bukan sebagai peringkat mutlak sebuah model.
Rilis awalnya menyertakan dataset publik berisi hasil yang diverifikasi di laboratorium untuk lebih dari 1.000 konfigurasi model, kuantisasi, runtime, perangkat, dan konteks. Cakupannya meliputi lebih dari 30 model, berbagai format kuantisasi, serta build llama.cpp untuk macOS, iOS, Windows, dan Android. Data performanya menggunakan panjang konteks standar antara 256 hingga 8.192 token. 3
Pengukuran inferensi dari Liquid AI dipasangkan dengan evaluasi kecerdasan model seluler dari Artificial Analysis. Kolaborasi ini memungkinkan penilaian terhadap dua sisi sekaligus: seberapa baik model bekerja dan seberapa cepat serta efisien model tersebut berjalan pada deployment tertentu. 33
Pipette menyediakan klien native untuk iOS dan Android, sehingga model dapat dijalankan langsung di smartphone. Cakupan benchmark yang lebih luas juga mencakup macOS dan Windows melalui build runtime yang didukung. Perangkat referensi yang disebut dalam materi peluncuran antara lain iPhone 17 Pro, Galaxy S26 Ultra, dan MacBook Pro dengan chip M5 Max. 3
38
Model harus diunduh ke perangkat sebelum pengujian dimulai. Dengan demikian, Pipette mengukur inferensi lokal, bukan latensi ketika pengguna mengirim permintaan ke API cloud. 41
50
Papan peringkat Pipette mencakup keluarga LFM2.5 milik Liquid AI dan sejumlah model pihak ketiga. Contohnya adalah Gemma, Nanbeige, Granite, Qwen, serta berbagai model berukuran kecil atau versi terkompresi lainnya. 9
41
Benchmark ini mendukung beberapa format kuantisasi. Dalam perbandingan kecerdasan model seluler, pengujian difokuskan pada model yang tetap berukuran maksimal 8 GB setelah dikuantisasi ke 4 bit. Batas ini membuat pengujian lebih relevan untuk smartphone dengan kapasitas memori terbatas. 3
41
Untuk deployment lokal, dokumentasi Liquid AI membedakan GGUF, yang umum digunakan bersama llama.cpp pada target CPU dan GPU, dari MLX, yang dirancang untuk deployment di perangkat Apple Silicon. 47 Ukuran berkas model terkuantisasi hanyalah salah satu faktor. Runtime dan backend perangkat keras turut menentukan bagaimana model tersebut diproses dalam praktik.
Dataset peluncuran Pipette melaporkan konfigurasi inferensi standar dengan panjang konteks 256 hingga 8.192 token. 3 Sementara itu, evaluasi kecerdasan seluler dari Artificial Analysis menggunakan batas konteks 16K token.
33
Angka-angka tersebut tidak boleh disamakan dengan panjang konteks maksimum yang tercantum dalam spesifikasi model. Dokumentasi Liquid AI mencantumkan konteks 32K token untuk banyak model LFM dan 128K untuk LFM2.5-8B-A1B. Namun, kemampuan maksimum sebuah model tidak berarti setiap pengujian di ponsel akan menjalankan konteks sepanjang itu. 47
Pipette menggabungkan beberapa dimensi performa, bukan sekadar mengukur kecepatan model menghasilkan token. Lima metrik performanya mencakup:
Kombinasi ini penting karena sebuah deployment dapat menghasilkan token dengan cepat, tetapi tetap membutuhkan waktu lama untuk mulai merespons, menggunakan terlalu banyak memori, atau melambat ketika konteks bertambah. Waktu respons dari awal hingga akhir juga lebih dekat dengan pengalaman nyata pengguna saat memakai asisten AI lokal.
Artificial Analysis melengkapi sisi performa teknis tersebut dengan evaluasi kualitas, termasuk kemampuan mengikuti instruksi, penggunaan alat, penalaran, dan kapabilitas terkait lainnya. 33
Setiap hasil Pipette dikaitkan dengan konfigurasi yang jelas. Protokol pengujian yang digunakan untuk menghasilkan data terverifikasi juga dipublikasikan. Dasbornya memisahkan perbandingan di papan peringkat dari detail hasil dan data submission, sehingga pengguna dapat menelusuri baris benchmark yang mendasari suatu angka, bukan hanya mengandalkan peringkat utama. 1
Metodologinya turut mencatat dependensi runtime. Liquid AI, misalnya, menyatakan bahwa hasil performa publik saat ini memerlukan build llama.cpp tertentu, termasuk b10216 dan b10516. 2 Penguncian versi runtime membantu mencegah perubahan perangkat lunak dianggap keliru sebagai peningkatan performa model atau perangkat keras.
Meski begitu, langkah-langkah tersebut tidak menghapus semua sumber variasi. Thermal throttling, kondisi sistem operasi, kapasitas memori perangkat, firmware, pilihan backend, dan batas daya berkelanjutan tetap dapat memengaruhi hasil ponsel. Sebuah skor paling bermakna jika variabel-variabel tersebut dibuat setara.
Hasil perdana Pipette memperlihatkan alasan benchmark ini melaporkan konfigurasi lengkap, bukan peringkat universal antarmodel.
Pelajaran utamanya sederhana: kualitas, kecepatan, latensi, dan penggunaan memori bisa menunjuk ke arah yang berbeda. Model tercepat belum tentu paling cakap, sementara model dengan skor kemampuan tertinggi belum tentu menjadi pilihan terbaik untuk deployment di ponsel.
Keterbatasan terpenting pada rilis seluler awal adalah perbedaan kemampuan kedua klien. Versi iOS dapat menggunakan komputasi GPU melalui ekosistem Metal milik Apple, termasuk MLX. Pada tahap awal, versi Android masih terbatas pada inferensi melalui CPU. 41
50
Akibatnya, hasil iPhone yang menggunakan MLX/Metal dan hasil Android yang diperoleh hanya melalui CPU bukan perbandingan langsung seluruh kemampuan AI dari kedua ponsel. Pengukuran iOS dapat memperoleh manfaat akselerasi GPU, sedangkan pengukuran Android mencerminkan performa jalur CPU yang tersedia pada klien saat ini.
Hasil Android tetap berguna untuk memahami inferensi lokal berbasis CPU dan pengalaman yang diberikan implementasi tersebut. Namun, hasil itu belum dapat digunakan untuk menyimpulkan bahwa silikon AI keseluruhan pada satu ponsel lebih cepat daripada ponsel lain. Perbandingan lintas platform yang lebih adil membutuhkan backend GPU atau NPU yang setara, dengan beban kerja dan konfigurasi yang sama.
Pipette hadir ketika produsen chip sedang berlomba meningkatkan pemrosesan AI lokal dan AI agentik. Platform Snapdragon 8 Elite Gen 5 dari Qualcomm menggunakan CPU Oryon generasi ketiga dengan kecepatan hingga 4,74 GHz. Qualcomm mengklaim peningkatan performa CPU sebesar 20% dan efisiensi daya CPU sebesar 35%. 24
Qualcomm juga telah mempratinjau platform Snapdragon flagship berikutnya dengan CPU Oryon yang menargetkan kecepatan 5 GHz. Arsitektur FlexCache pada chip tersebut memungkinkan inti CPU heterogen berbagi kumpulan cache yang dialokasikan secara dinamis. 23
Spesifikasi itu menunjukkan bahwa AI di perangkat semakin menjadi arena persaingan perangkat keras. Namun, kecepatan clock saja tidak cukup untuk memprediksi performa model bahasa. Kuantisasi, bandwidth memori, perilaku cache, implementasi runtime, penggunaan GPU atau NPU, suhu, dan batas daya berkelanjutan juga dapat sangat berpengaruh.
Di sinilah pendekatan berbasis konfigurasi milik Pipette menjadi relevan. Peran jangka panjangnya adalah menunjukkan apakah klaim peningkatan sebuah chip benar-benar menghasilkan AI lokal yang lebih cepat, lebih responsif, dan lebih hemat memori dalam beban kerja yang dapat direproduksi.
Untuk saat ini, Pipette paling tepat dipahami sebagai benchmark deployment yang transparan—bukan sebagai peringkat final antara perangkat keras iPhone dan Android.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja.
Dirilis pada 24 Agustus melalui kolaborasi Liquid AI dan Artificial Analysis, Pipette mengukur konfigurasi deployment AI secara utuh, bukan bobot model saja. Benchmark ini mencakup lebih dari 1.000 konfigurasi, lebih dari 30 model, berbagai format kuantisasi, runtime llama.cpp, serta konteks 256 hingga 8.192 token.
Lima metrik utamanya meliputi pemrosesan prompt, kecepatan generasi, waktu menuju token pertama, waktu respons lengkap, dan penggunaan memori.