24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor. Açık kaynaklı benchmark; iOS ve Android istemcilerinin yanı sıra macOS ve Windows üzerinde llama.cpp derlemelerini, farklı kuantizasyon biçimlerini ve 256 ila 8.192 token arasındaki bağlam...
YayımlayanGPT-5.6 Luna ile düzenlendiGörseller GPT Image 1.5 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI’nin Artificial Analysis iş birliğiyle 24 Ağustos’ta yayımladığı Pipette, yapay zekâ modellerini bulutta değil, gerçekten çalıştırılacakları cihazlarda değerlendirmeyi amaçlayan açık kaynaklı bir benchmark paketi. Sistem; modeli tek başına puanlamak yerine model, kuantizasyon, çalışma zamanı, cihaz ve iş yükünü tek bir dağıtım yapılandırması olarak ele alıyor. 3
1
Bu yaklaşım önemli; çünkü aynı model, farklı bir kuantizasyon biçimi, çalışma zamanı veya donanım arka ucu kullanıldığında tamamen farklı hız, gecikme ve bellek sonuçları verebilir.
Birçok yapay zekâ liderlik tablosu modelin yetenek puanlarına ya da tek bir çıkarım hızı ölçümüne odaklanır. Pipette ise gerçek kullanım senaryosundaki uçtan uca yığını incelemeye çalışıyor.
Örneğin model ağırlıkları değişmese bile kuantizasyon biçimi, runtime sürümü, bellek baskısı, GPU veya CPU arka ucu ve cihazın termal durumu sonucu etkileyebilir. Bu nedenle Pipette’te bir sonuç, “bu model şu kadar hızlı” şeklinde genellenmek yerine belirli bir yapılandırmaya bağlanıyor.
İlk sürümde, laboratuvarda doğrulanmış 1.000’den fazla model, kuantizasyon, runtime, cihaz ve bağlam yapılandırmasını içeren herkese açık bir veri seti yayımlandı. Veri seti 30’dan fazla modeli, farklı kuantizasyon formatlarını, macOS, iOS, Windows ve Android için llama.cpp derlemelerini ve 256 ila 8.192 token arasındaki bağlam uzunluklarını kapsıyor. 3
Pipette’in çıkarım ölçümleri, Artificial Analysis’in mobil cihazlara uygun modeller için gerçekleştirdiği zekâ değerlendirmeleriyle birlikte sunuluyor. Böylece iş birliği hem modelin ne kadar iyi sonuç verdiğine hem de belirli bir cihaz kurulumunda ne kadar hızlı ve verimli çalıştığına bakıyor. 33
Pipette’in yerel model çalıştırmaya yönelik iOS ve Android istemcileri bulunuyor. Daha geniş benchmark kapsamı ise desteklenen runtime derlemeleri aracılığıyla macOS ve Windows sistemlerini de içeriyor. İlk tanıtım materyallerinde referans donanımlar arasında iPhone 17 Pro, Galaxy S26 Ultra ve M5 Max çipli MacBook Pro yer alıyor. 3
38
Test yapılabilmesi için modelin öncelikle cihaza indirilmesi gerekiyor. Bu nedenle Pipette, bir bulut API’sinin ağ gecikmesini değil, yapay zekâ modelinin cihaz üzerinde yerel olarak çalıştırılmasını ölçüyor. 41
50
Liderlik tablosunda Liquid AI’nin LFM2.5 ailesinin yanı sıra farklı şirket ve topluluklara ait modeller de bulunuyor. Gemma, Nanbeige, Granite, Qwen ve çeşitli küçük ya da sıkıştırılmış model sürümleri listelenen örnekler arasında. 9
41
Benchmark birden fazla kuantizasyon formatını destekliyor. Mobil zekâ karşılaştırmasında özellikle 4 bit kuantizasyon uygulandığında 8 GB sınırına sığan modeller kullanıldı. Bu tercih, belleği sınırlı akıllı telefonlardaki yerel yapay zekâ deneyimini daha iyi yansıtmayı hedefliyor. 3
41
Liquid AI’nin belgelerinde yerel dağıtım için iki format öne çıkıyor:
Bir kuantize modelin dosya boyutu, performansın yalnızca bir parçası. Modelin cihazda nasıl işlendiğini runtime ve donanım arka ucu belirliyor.
Pipette’in lansman veri seti, 256 ila 8.192 token arasındaki bağlam uzunluklarında standartlaştırılmış çıkarım yapılandırmaları raporluyor. 3 Artificial Analysis’in ayrı mobil zekâ değerlendirmesinde ise 16K token bağlam sınırı kullanılıyor.
33
Bu değerleri bir modelin ilan edilen azami bağlam penceresiyle karıştırmamak gerekiyor. Liquid AI belgelerinde birçok LFM modeli için 32K, LFM2.5-8B-A1B için ise 128K token bağlam desteği listeleniyor. Ancak bir modelin teorik kapasitesi, her telefon testinin bu uzunlukta çalıştırıldığı anlamına gelmiyor. 47
Pipette, sonucu yalnızca üretim hızına indirgemiyor. Beş temel performans metriği kullanıyor:
Bu ölçüm seti, gerçek kullanıcı deneyimi açısından daha anlamlı bir tablo sunuyor. Bir model token’ları hızlı üretebilir; ancak yanıt vermeye başlaması uzun sürebilir, fazla bellek tüketebilir veya bağlam uzadıkça belirgin biçimde yavaşlayabilir.
Artificial Analysis ise mobil karşılaştırmanın kalite tarafını; talimat izleme, araç kullanımı, akıl yürütme ve benzeri yetenek testleriyle değerlendiriyor. 33
Pipette her sonucu açıkça tanımlanmış bir yapılandırmaya bağlıyor ve doğrulanmış verilerin üretiminde kullanılan protokolleri yayımlıyor. Kontrol panelinde liderlik tablosu, ayrıntılı sonuçlar ve gönderimler ayrı bölümlerde gösteriliyor. Böylece kullanıcılar yalnızca genel sıralamaya değil, sıralamanın arkasındaki benchmark satırlarına da ulaşabiliyor. 1
Yöntem, runtime bağımlılıklarını da kayda geçiriyor. Liquid AI’ye göre güncel herkese açık performans sonuçları, b10216 ve b10516 gibi belirli llama.cpp derlemelerini gerektiriyor. 2 Runtime sürümünü sabitlemek, yazılım değişikliklerinin donanım veya model iyileşmesi sanılmasını önlemeye yardımcı oluyor.
Bununla birlikte bu önlemler tüm değişkenleri ortadan kaldırmıyor. Termal daraltma, işletim sistemi durumu, cihaz belleği, firmware, seçilen arka uç ve sürdürülebilir güç sınırları telefonların sonuçlarını etkileyebilir. Bir puan ancak bu değişkenler eşleştiğinde anlamlı biçimde karşılaştırılabilir.
İlk sonuçlar, Pipette’in neden evrensel model sıralaması yerine eksiksiz yapılandırmaları raporladığını açıkça ortaya koyuyor.
Buradaki temel ders şu: kalite, hız, gecikme ve bellek kullanımı aynı yönde ilerlemek zorunda değil. En hızlı model otomatik olarak en yetenekli model olmayabilir. En yüksek yetenek puanını alan model de telefonda en iyi deneyimi sunmayabilir.
İlk mobil sürümdeki en önemli sınırlama, iki istemci arasındaki hesaplama farkı. iOS sürümü Apple’ın Metal ekosistemi üzerinden GPU hesaplamasını, MLX’i de kullanabiliyor. Android sürümü ise başlangıçta yalnızca CPU çıkarımıyla sınırlıydı. 41
50
Bu nedenle MLX/Metal kullanan bir iPhone sonucu ile yalnızca CPU üzerinden alınan bir Android sonucu, telefonların toplam yapay zekâ donanımını adil biçimde karşılaştırmıyor. iOS ölçümü GPU hızlandırmasından yararlanabilirken Android sonucu mevcut istemcinin sunduğu CPU yolunu yansıtıyor.
Android sonuçları, CPU tabanlı yerel çıkarımı ve o yazılım uygulamasının kullanıcı deneyimini anlamak açısından yine de değerli. Ancak eşdeğer GPU veya NPU arka uçları aynı iş yükü altında test edilmeden bir telefonun toplam yapay zekâ silikonunun diğerinden daha hızlı olduğu sonucuna varılamaz.
Pipette, çip üreticilerinin yerel ve ajan tabanlı yapay zekâ işlemlerini hızlandırma iddialarını artırdığı bir dönemde ortaya çıktı. Qualcomm, Snapdragon 8 Elite Gen 5 platformundaki üçüncü nesil Oryon CPU’nun 4,74 GHz’e kadar çıktığını; CPU performansında yüzde 20, CPU güç verimliliğinde ise yüzde 35 iyileşme sunduğunu belirtiyor. 24
Şirket ayrıca sonraki amiral gemisi Snapdragon platformu için 5 GHz hedefleyen yeni bir Oryon CPU ve farklı CPU çekirdeklerinin dinamik olarak paylaştığı FlexCache mimarisini tanıttı. 23
Bu teknik özellikler, cihaz üzerinde yapay zekânın neden bir donanım rekabetine dönüştüğünü gösteriyor. Ancak saat frekansı tek başına dil modeli performansını öngörmüyor. Kuantizasyon, bellek bant genişliği, önbellek davranışı, runtime uygulaması, GPU veya NPU kullanımı, sıcaklık ve sürdürülebilir güç sınırları en az saat hızı kadar önemli olabilir.
Pipette’in uzun vadeli değeri de burada yatıyor: belirli bir çip iyileştirmesinin, tekrarlanabilir bir iş yükü altında daha hızlı, daha düşük gecikmeli ve daha az bellek tüketen yerel yapay zekâ deneyimine dönüşüp dönüşmediğini gösterebilir.
Şimdilik Pipette’i iPhone ile Android arasında kesin bir donanım sıralaması yapan araç olarak değil, gerçek dağıtım koşullarını görünür kılan şeffaf bir benchmark olarak değerlendirmek en doğru yaklaşım. 1
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor.
24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor. Açık kaynaklı benchmark; iOS ve Android istemcilerinin yanı sıra macOS ve Windows üzerinde llama.cpp derlemelerini, farklı kuantizasyon biçimlerini ve 256 ila 8.192 token arasındaki bağlam uzunluklarını destekliyor.
İlk mobil değerlendirmede Nanbeige4.2 3B ile LFM2.5 2.6B, 16K bağlam sınırı altında 63 puanla ortak lider oldu.
24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor. Açık kaynaklı benchmark; iOS ve Android istemcilerinin yanı sıra macOS ve Windows üzerinde llama.cpp derlemelerini, farklı kuantizasyon biçimlerini ve 256 ila 8.192 token arasındaki bağlam...
YayımlayanGPT-5.6 Luna ile düzenlendiGörseller GPT Image 1.5 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI’nin Artificial Analysis iş birliğiyle 24 Ağustos’ta yayımladığı Pipette, yapay zekâ modellerini bulutta değil, gerçekten çalıştırılacakları cihazlarda değerlendirmeyi amaçlayan açık kaynaklı bir benchmark paketi. Sistem; modeli tek başına puanlamak yerine model, kuantizasyon, çalışma zamanı, cihaz ve iş yükünü tek bir dağıtım yapılandırması olarak ele alıyor. 3
1
Bu yaklaşım önemli; çünkü aynı model, farklı bir kuantizasyon biçimi, çalışma zamanı veya donanım arka ucu kullanıldığında tamamen farklı hız, gecikme ve bellek sonuçları verebilir.
Birçok yapay zekâ liderlik tablosu modelin yetenek puanlarına ya da tek bir çıkarım hızı ölçümüne odaklanır. Pipette ise gerçek kullanım senaryosundaki uçtan uca yığını incelemeye çalışıyor.
Örneğin model ağırlıkları değişmese bile kuantizasyon biçimi, runtime sürümü, bellek baskısı, GPU veya CPU arka ucu ve cihazın termal durumu sonucu etkileyebilir. Bu nedenle Pipette’te bir sonuç, “bu model şu kadar hızlı” şeklinde genellenmek yerine belirli bir yapılandırmaya bağlanıyor.
İlk sürümde, laboratuvarda doğrulanmış 1.000’den fazla model, kuantizasyon, runtime, cihaz ve bağlam yapılandırmasını içeren herkese açık bir veri seti yayımlandı. Veri seti 30’dan fazla modeli, farklı kuantizasyon formatlarını, macOS, iOS, Windows ve Android için llama.cpp derlemelerini ve 256 ila 8.192 token arasındaki bağlam uzunluklarını kapsıyor. 3
Pipette’in çıkarım ölçümleri, Artificial Analysis’in mobil cihazlara uygun modeller için gerçekleştirdiği zekâ değerlendirmeleriyle birlikte sunuluyor. Böylece iş birliği hem modelin ne kadar iyi sonuç verdiğine hem de belirli bir cihaz kurulumunda ne kadar hızlı ve verimli çalıştığına bakıyor. 33
Pipette’in yerel model çalıştırmaya yönelik iOS ve Android istemcileri bulunuyor. Daha geniş benchmark kapsamı ise desteklenen runtime derlemeleri aracılığıyla macOS ve Windows sistemlerini de içeriyor. İlk tanıtım materyallerinde referans donanımlar arasında iPhone 17 Pro, Galaxy S26 Ultra ve M5 Max çipli MacBook Pro yer alıyor. 3
38
Test yapılabilmesi için modelin öncelikle cihaza indirilmesi gerekiyor. Bu nedenle Pipette, bir bulut API’sinin ağ gecikmesini değil, yapay zekâ modelinin cihaz üzerinde yerel olarak çalıştırılmasını ölçüyor. 41
50
Liderlik tablosunda Liquid AI’nin LFM2.5 ailesinin yanı sıra farklı şirket ve topluluklara ait modeller de bulunuyor. Gemma, Nanbeige, Granite, Qwen ve çeşitli küçük ya da sıkıştırılmış model sürümleri listelenen örnekler arasında. 9
41
Benchmark birden fazla kuantizasyon formatını destekliyor. Mobil zekâ karşılaştırmasında özellikle 4 bit kuantizasyon uygulandığında 8 GB sınırına sığan modeller kullanıldı. Bu tercih, belleği sınırlı akıllı telefonlardaki yerel yapay zekâ deneyimini daha iyi yansıtmayı hedefliyor. 3
41
Liquid AI’nin belgelerinde yerel dağıtım için iki format öne çıkıyor:
Bir kuantize modelin dosya boyutu, performansın yalnızca bir parçası. Modelin cihazda nasıl işlendiğini runtime ve donanım arka ucu belirliyor.
Pipette’in lansman veri seti, 256 ila 8.192 token arasındaki bağlam uzunluklarında standartlaştırılmış çıkarım yapılandırmaları raporluyor. 3 Artificial Analysis’in ayrı mobil zekâ değerlendirmesinde ise 16K token bağlam sınırı kullanılıyor.
33
Bu değerleri bir modelin ilan edilen azami bağlam penceresiyle karıştırmamak gerekiyor. Liquid AI belgelerinde birçok LFM modeli için 32K, LFM2.5-8B-A1B için ise 128K token bağlam desteği listeleniyor. Ancak bir modelin teorik kapasitesi, her telefon testinin bu uzunlukta çalıştırıldığı anlamına gelmiyor. 47
Pipette, sonucu yalnızca üretim hızına indirgemiyor. Beş temel performans metriği kullanıyor:
Bu ölçüm seti, gerçek kullanıcı deneyimi açısından daha anlamlı bir tablo sunuyor. Bir model token’ları hızlı üretebilir; ancak yanıt vermeye başlaması uzun sürebilir, fazla bellek tüketebilir veya bağlam uzadıkça belirgin biçimde yavaşlayabilir.
Artificial Analysis ise mobil karşılaştırmanın kalite tarafını; talimat izleme, araç kullanımı, akıl yürütme ve benzeri yetenek testleriyle değerlendiriyor. 33
Pipette her sonucu açıkça tanımlanmış bir yapılandırmaya bağlıyor ve doğrulanmış verilerin üretiminde kullanılan protokolleri yayımlıyor. Kontrol panelinde liderlik tablosu, ayrıntılı sonuçlar ve gönderimler ayrı bölümlerde gösteriliyor. Böylece kullanıcılar yalnızca genel sıralamaya değil, sıralamanın arkasındaki benchmark satırlarına da ulaşabiliyor. 1
Yöntem, runtime bağımlılıklarını da kayda geçiriyor. Liquid AI’ye göre güncel herkese açık performans sonuçları, b10216 ve b10516 gibi belirli llama.cpp derlemelerini gerektiriyor. 2 Runtime sürümünü sabitlemek, yazılım değişikliklerinin donanım veya model iyileşmesi sanılmasını önlemeye yardımcı oluyor.
Bununla birlikte bu önlemler tüm değişkenleri ortadan kaldırmıyor. Termal daraltma, işletim sistemi durumu, cihaz belleği, firmware, seçilen arka uç ve sürdürülebilir güç sınırları telefonların sonuçlarını etkileyebilir. Bir puan ancak bu değişkenler eşleştiğinde anlamlı biçimde karşılaştırılabilir.
İlk sonuçlar, Pipette’in neden evrensel model sıralaması yerine eksiksiz yapılandırmaları raporladığını açıkça ortaya koyuyor.
Buradaki temel ders şu: kalite, hız, gecikme ve bellek kullanımı aynı yönde ilerlemek zorunda değil. En hızlı model otomatik olarak en yetenekli model olmayabilir. En yüksek yetenek puanını alan model de telefonda en iyi deneyimi sunmayabilir.
İlk mobil sürümdeki en önemli sınırlama, iki istemci arasındaki hesaplama farkı. iOS sürümü Apple’ın Metal ekosistemi üzerinden GPU hesaplamasını, MLX’i de kullanabiliyor. Android sürümü ise başlangıçta yalnızca CPU çıkarımıyla sınırlıydı. 41
50
Bu nedenle MLX/Metal kullanan bir iPhone sonucu ile yalnızca CPU üzerinden alınan bir Android sonucu, telefonların toplam yapay zekâ donanımını adil biçimde karşılaştırmıyor. iOS ölçümü GPU hızlandırmasından yararlanabilirken Android sonucu mevcut istemcinin sunduğu CPU yolunu yansıtıyor.
Android sonuçları, CPU tabanlı yerel çıkarımı ve o yazılım uygulamasının kullanıcı deneyimini anlamak açısından yine de değerli. Ancak eşdeğer GPU veya NPU arka uçları aynı iş yükü altında test edilmeden bir telefonun toplam yapay zekâ silikonunun diğerinden daha hızlı olduğu sonucuna varılamaz.
Pipette, çip üreticilerinin yerel ve ajan tabanlı yapay zekâ işlemlerini hızlandırma iddialarını artırdığı bir dönemde ortaya çıktı. Qualcomm, Snapdragon 8 Elite Gen 5 platformundaki üçüncü nesil Oryon CPU’nun 4,74 GHz’e kadar çıktığını; CPU performansında yüzde 20, CPU güç verimliliğinde ise yüzde 35 iyileşme sunduğunu belirtiyor. 24
Şirket ayrıca sonraki amiral gemisi Snapdragon platformu için 5 GHz hedefleyen yeni bir Oryon CPU ve farklı CPU çekirdeklerinin dinamik olarak paylaştığı FlexCache mimarisini tanıttı. 23
Bu teknik özellikler, cihaz üzerinde yapay zekânın neden bir donanım rekabetine dönüştüğünü gösteriyor. Ancak saat frekansı tek başına dil modeli performansını öngörmüyor. Kuantizasyon, bellek bant genişliği, önbellek davranışı, runtime uygulaması, GPU veya NPU kullanımı, sıcaklık ve sürdürülebilir güç sınırları en az saat hızı kadar önemli olabilir.
Pipette’in uzun vadeli değeri de burada yatıyor: belirli bir çip iyileştirmesinin, tekrarlanabilir bir iş yükü altında daha hızlı, daha düşük gecikmeli ve daha az bellek tüketen yerel yapay zekâ deneyimine dönüşüp dönüşmediğini gösterebilir.
Şimdilik Pipette’i iPhone ile Android arasında kesin bir donanım sıralaması yapan araç olarak değil, gerçek dağıtım koşullarını görünür kılan şeffaf bir benchmark olarak değerlendirmek en doğru yaklaşım. 1
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor.
24 Ağustos’ta yayımlanan Pipette, yalnızca model ağırlıklarını değil, gerçek cihaz üzerindeki tüm yapay zekâ dağıtımını ölçüyor. Açık kaynaklı benchmark; iOS ve Android istemcilerinin yanı sıra macOS ve Windows üzerinde llama.cpp derlemelerini, farklı kuantizasyon biçimlerini ve 256 ila 8.192 token arasındaki bağlam uzunluklarını destekliyor.
İlk mobil değerlendirmede Nanbeige4.2 3B ile LFM2.5 2.6B, 16K bağlam sınırı altında 63 puanla ortak lider oldu.