Pipette, bir yapay zekâ modelini tek başına değil; model, quantization, çalışma zamanı, cihaz ve iş yükü kombinasyonunu ölçen ücretsiz, açık kaynaklı bir benchmark platformu. 24 Ağustos’ta Artificial Analysis ile birlikte yayımlanan platform, 1.000’den fazla laboratuvar doğrulamalı yapılandırmayı ve 30’dan fazla mod...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette, Liquid AI’nin yapay zekâ modellerini gerçek cihazlarda değerlendirmek için geliştirdiği ücretsiz ve açık kaynaklı benchmark paketidir. Platform, yalnızca “Bu model ne kadar hızlı?” sorusunu sormaz; modelin hangi quantization biçiminde çalıştığını, hangi çalışma zamanını kullandığını, hangi cihazda test edildiğini ve iş yükünün ne olduğunu birlikte değerlendirir. 24 Ağustos’ta Artificial Analysis ortaklığıyla yayımlanan Pipette, Liquid AI’nin çıkarım ölçümlerini Artificial Analysis’in mobil model zekâsı değerlendirmeleriyle bir araya getiriyor. 119
Pipette’in temel farkı, ölçüm birimini tek başına model değil, tam dağıtım yapılandırması olarak ele almasıdır:
Kamuya açık sürümde, laboratuvarda doğrulanmış 1.000’den fazla yapılandırmadan oluşan bir veri seti bulunuyor. İlk liderlik tablosu 30’dan fazla model, yedi quantization seçeneği ve dört başlangıç cihazını kapsıyor. 114
Performans tarafında beş cihaz-üstü metrik kullanılıyor. Bunlar istemin işlenme veya prefill hızı, yanıt üretme ya da decode hızı, ilk token’a kadar geçen süre, uçtan uca yanıt süresi ve bellek kullanımı gibi ölçümleri içeriyor. Böylece yalnızca yüksek “saniyede token” değerine bakmak yerine, modelin yanıt vermeye ne kadar sürede başladığı ve cihazda ne kadar bellek tükettiği de görülebiliyor. 411
Pipette’in iOS ve Android istemcileri bulunuyor. Uygulama, modelleri önce cihaza indiriyor ve testleri bir bulut API’sine bağlanmadan yerel olarak gerçekleştiriyor. İlk model havuzunda Liquid AI’nin LFM ailesinin yanı sıra Gemma ve Nanbeige gibi üçüncü taraf küçük modeller de yer alıyor. Mobil zekâ karşılaştırmasında ise 4-bit quantization sonrasında 8 GB içine sığabilen modeller esas alındı. 108
İlk yayımlanan benchmark verileri ayrıca macOS, iOS, Windows ve Android için llama.cpp derlemelerini kapsıyor. Veri setindeki bağlam uzunlukları 256 ile 8.192 token arasında değişiyor. 11
Burada önemli bir ayrım var: Liquid AI’nin model kataloğunda birçok LFM modeli için 32K bağlam, LFM2.5-8B-A1B için ise 128K bağlam desteği belirtiliyor. Ancak bunlar modellerin teorik veya ürün düzeyindeki yetenekleri; Pipette’in ilk standartlaştırılmış mobil iş yükünün bağlam sınırıyla aynı anlama gelmiyor. 2
Artificial Analysis’in mobil zekâ testlerinde kullanılan bağlam uzunluğu 16K token olarak belirlendi. Bu nedenle 16K sınırı, söz konusu karşılaştırmanın test koşuludur; her modelin azami bağlam kapasitesi değildir. 89
İlk sonuçlardan biri, 4-bit Gemma 4 E2B modelinin Apple MLX üzerinden iPhone 17 Pro’da saniyede 48,37 decode token’ına ulaşması. Bu değer dikkat çekici olsa da evrensel bir “Gemma hızı” veya “telefon hızı” olarak okunmamalı. Doğru tanım, Gemma 4 E2B + 4-bit quantization + MLX/Metal + iPhone 17 Pro yapılandırmasıdır. 45
16K bağlam sınırıyla yapılan mobil zekâ değerlendirmesinde Nanbeige4.2-3B ile LFM2.5-2.6B, ortalama 63 puanla liderliği paylaştı. 98 LFM2.5-2.6B ayrıca iPhone 17 Pro’da standart 1.024 token’lık bir istemi 8,0 saniyede yanıtladı ve 2,3 GB bellek kullandı. 9
Pipette’in mevcut sürümünde iOS, Metal/MLX üzerinden GPU hesaplamasından yararlanabiliyor. İlk Android istemcisi ise yalnızca CPU ile çalışıyor. 10
Bu fark, iPhone ve Android sonuçlarını aynı çerçevede yorumlamayı zorlaştırıyor. iPhone tarafındaki sonuçlara GPU hızlandırması dahil olabilirken Android sonuçları CPU çıkarımını yansıtıyor. Dolayısıyla mevcut veriler, bir telefonun toplam yapay zekâ donanımının diğerinden kesin olarak hızlı olduğunu kanıtlamıyor; daha çok belirli çalışma zamanlarının ve donanım yollarının performansını gösteriyor. 104
Adil bir platformlar arası karşılaştırma için Android’de NPU ve eşdeğer GPU hızlandırmalı backend’lerin de teste dahil edilmesi gerekiyor.
Pipette’in en değerli katkısı yalnızca yeni bir liderlik tablosu sunması değil, ölçüm yöntemini görünür kılması. Sonuçlar açıkça tanımlanmış tam yapılandırmalara bağlanıyor, doğrulanmış laboratuvar testlerinden geliyor ve yayımlanmış protokollerle birlikte sunuluyor. Ayrıca yazılım bağımlılıkları da sabitleniyor. Örneğin güncel kamuya açık performans sonuçları, belirli llama.cpp derlemelerini; bunlar arasında b10216 ve b10516 sürümlerini gerektiriyor. 4116
Bu yaklaşım, bir üreticinin tek başına açıkladığı “saniyede token” değerini karşılaştırmaktan daha sağlıklı. Yine de test sonuçları cihazın sıcaklığına, işletim sistemi durumuna, cihazdaki RAM miktarına ve model SKU’suna, kullanılan backend’e ve güç yönetimine bağlı olarak değişebilir. Bu alanlar aynı değilse iki sonucu doğrudan kıyaslamak doğru olmaz.
Pipette, çip üreticilerinin yerel ve aracı tabanlı yapay zekâ iş yüklerine daha fazla odaklandığı bir dönemde yayımlandı. Qualcomm, Snapdragon 8 Elite Gen 5 platformundaki üçüncü nesil Oryon CPU’nun 4,74 GHz’e ulaştığını; platform için CPU performansında yüzde 20, CPU güç verimliliğinde ise yüzde 35 iyileşme sunduğunu belirtiyor. 7
Qualcomm ayrıca sonraki amiral gemisi Snapdragon platformu için 5 GHz hedefleyen yeni bir Oryon CPU ve çekirdekler arasında önbelleği dinamik biçimde paylaşan FlexCache tasarımını tanıttı. Bu duyurular yerel iş yüklerinde daha hızlı ve tepkisel deneyim hedefini gösteriyor. Ancak saat frekansı tek başına büyük dil modeli çıkarım hızını belirlemez; çalışma zamanı, bellek bant genişliği, önbellek davranışı, quantization, GPU/NPU backend’i, sıcaklık ve sürdürülebilir güç sınırları da sonucu etkiler. 712
Liquid AI’nin daha fazla cihazı ve NPU hızlandırmalı testleri kapsama planı hayata geçerse Pipette’in değeri artabilir. Platform o zaman CPU kazanımlarını GPU ve NPU kazanımlarından daha net biçimde ayırabilir. Şimdilik Pipette’i nihai bir telefon veya çip sıralaması olarak değil, gerçek cihaz dağıtımlarını şeffaf biçimde karşılaştıran bir ölçüm aracı olarak değerlendirmek en doğru yaklaşım. 64
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, bir yapay zekâ modelini tek başına değil; model, quantization, çalışma zamanı, cihaz ve iş yükü kombinasyonunu ölçen ücretsiz, açık kaynaklı bir benchmark platformu.
Pipette, bir yapay zekâ modelini tek başına değil; model, quantization, çalışma zamanı, cihaz ve iş yükü kombinasyonunu ölçen ücretsiz, açık kaynaklı bir benchmark platformu. 24 Ağustos’ta Artificial Analysis ile birlikte yayımlanan platform, 1.000’den fazla laboratuvar doğrulamalı yapılandırmayı ve 30’dan fazla modeli kapsıyor.
iOS ve Android uygulamaları modelleri buluttan değil, doğrudan cihaza indirerek çalıştırıyor.