Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu. Benchmark obsługuje klientów iOS i Android, lokalne uruchamianie modeli, różne formaty kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida.
Opublikowane przezEdytowane za pomocą GPT-5.6 LunaObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette to otwarty zestaw benchmarków firmy Liquid AI, który sprawdza, jak modele sztucznej inteligencji działają tam, gdzie faktycznie mają być używane: na smartfonach, laptopach, komputerach PC i innym sprzęcie brzegowym. Narzędzie uruchomiono 24 sierpnia we współpracy z Artificial Analysis. Jego wyróżnikiem jest traktowanie całego wdrożenia — a nie samego modelu — jako podstawowej jednostki pomiaru. Wynik zależy więc łącznie od modelu, kwantyzacji, środowiska uruchomieniowego, urządzenia i rodzaju obciążenia. 3
1
Wiele rankingów AI skupia się na jakości odpowiedzi albo podaje jedną liczbę opisującą szybkość wnioskowania. Pipette ma pokazać, jak zachowuje się cały stos technologiczny w rzeczywistym wdrożeniu. Zmiana kwantyzacji, środowiska uruchomieniowego, backendu, dostępnej pamięci lub sprzętu może zmienić rezultat, nawet jeśli wagi modelu pozostają takie same.
Wraz z premierą opublikowano zbiór zweryfikowanych laboratoryjnie wyników obejmujący ponad 1000 konfiguracji modelu, kwantyzacji, runtime’u, urządzenia i kontekstu. Początkowa wersja obejmuje ponad 30 modeli, wiele formatów kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida. Ustandaryzowane pomiary wykonano dla długości kontekstu od 256 do 8192 tokenów. 3
Pomiary wnioskowania z Pipette połączono z oceną inteligencji modeli mobilnych przygotowaną przez Artificial Analysis. Współpraca pozwala więc analizować jednocześnie jakość działania modelu oraz szybkość i efektywność konkretnego wdrożenia. 33
Pipette udostępnia natywne aplikacje na iOS i Androida, dzięki którym modele można uruchamiać lokalnie na smartfonie. Szerszy zakres benchmarku obejmuje także macOS i Windows za pośrednictwem obsługiwanych wersji środowiska uruchomieniowego. W materiałach premierowych jako urządzenia referencyjne wskazano między innymi iPhone’a 17 Pro, Galaxy S26 Ultra oraz MacBooka Pro z układem M5 Max. 3
38
Przed rozpoczęciem testu model trzeba pobrać na urządzenie. Pipette mierzy zatem lokalne wnioskowanie, a nie opóźnienie odpowiedzi z chmurowego API. 41
50
W rankingu znalazły się modele z rodziny Liquid AI LFM2.5 oraz konstrukcje innych firm. Wśród wymienianych przykładów są Gemma, Nanbeige, Granite, Qwen i inne małe lub skompresowane warianty modeli. 9
41
Benchmark obsługuje wiele formatów kwantyzacji. Mobilne porównanie inteligencji koncentrowało się na modelach, które po kwantyzacji do 4 bitów mieściły się w 8 GB, dzięki czemu test jest istotny także dla smartfonów z ograniczoną pamięcią. 3
41
W przypadku lokalnych wdrożeń dokumentacja Liquid AI rozróżnia format GGUF, często używany z llama.cpp na celach CPU i GPU, oraz format MLX przeznaczony dla wdrożeń na układach Apple Silicon. 47 Sam rozmiar skwantyzowanego pliku to jednak tylko część obrazu — o tym, jak model jest faktycznie przetwarzany, decydują również runtime i backend sprzętowy.
Zbiór danych z premiery zawiera ustandaryzowane konfiguracje wnioskowania dla kontekstu od 256 do 8192 tokenów. 3 Oddzielny test inteligencji modeli mobilnych Artificial Analysis używa limitu 16 tys. tokenów.
33
Nie należy mylić tych wartości z maksymalnym deklarowanym oknem kontekstu modelu. Dokumentacja Liquid AI podaje dla wielu modeli LFM kontekst 32 tys. tokenów, a dla LFM2.5-8B-A1B — 128 tys. Jednak możliwość modelu nie oznacza, że każdy test na smartfonie wykorzystuje pełną długość. 47
Pipette łączy kilka wymiarów wydajności urządzenia, zamiast sprowadzać wynik do szybkości generowania tokenów. Pięć głównych metryk obejmuje przetwarzanie promptu lub fazę prefill, przepustowość generowania lub dekodowania, czas do pierwszego tokenu, czas otrzymania kompletnej odpowiedzi oraz zużycie pamięci. 1
3
14
To ważne, ponieważ wdrożenie może generować tokeny szybko, a jednocześnie długo rozpoczynać odpowiedź, zużywać zbyt dużo pamięci albo zwalniać wraz ze wzrostem kontekstu. Całkowity czas odpowiedzi lepiej opisuje doświadczenie osoby korzystającej z lokalnego asystenta.
Artificial Analysis dostarcza natomiast części jakościowej mobilnego porównania. Wykorzystuje testy obejmujące między innymi wykonywanie instrukcji, użycie narzędzi i rozumowanie. 33
Każdy wynik jest przypisany do dokładnie opisanej konfiguracji, a wraz z danymi publikowane są protokoły użyte do przeprowadzenia zweryfikowanych testów. Publiczny panel rozdziela ranking od szczegółowych rezultatów i zgłoszeń, dzięki czemu można sprawdzić źródłowe wiersze benchmarku, zamiast polegać wyłącznie na głównej tabeli wyników. 1
Metodologia uwzględnia również zależności programowe. Liquid AI podaje na przykład, że obecne publiczne wyniki wydajności wymagają określonych kompilacji llama.cpp, w tym b10216 i b10516. 2 Ustalenie konkretnej wersji runtime’u pomaga uniknąć sytuacji, w której zmiana oprogramowania zostanie błędnie uznana za poprawę modelu lub sprzętu.
Takie zabezpieczenia zwiększają porównywalność, ale nie eliminują wszystkich źródeł różnic. Na rezultat telefonu mogą wpływać throttling termiczny, stan systemu operacyjnego, dostępna pamięć, firmware, wybór backendu oraz limity długotrwałego poboru energii. Wynik ma największy sens wtedy, gdy te zmienne są takie same.
Wyniki z premiery dobrze pokazują, dlaczego Pipette raportuje pełne konfiguracje, a nie tworzy jednego, uniwersalnego rankingu modeli.
Najważniejszy wniosek jest prosty: jakość, szybkość, opóźnienie i zużycie pamięci mogą prowadzić do różnych zwycięzców. Najszybszy model nie musi być najbardziej kompetentny, a model z najwyższą oceną jakości nie musi oferować najlepszego doświadczenia na telefonie.
Najistotniejszym ograniczeniem pierwszej mobilnej wersji Pipette jest różnica między obiema aplikacjami. Wersja iOS może korzystać z obliczeń GPU w ekosystemie Apple Metal, w tym z MLX. Początkowa wersja na Androida była ograniczona do wnioskowania na CPU. 41
50
Dlatego wynik iPhone’a uzyskany z MLX/Metal oraz wynik telefonu z Androidem obliczony wyłącznie na CPU nie są bezpośrednim porównaniem całego sprzętu AI obu urządzeń. Pomiar iOS może korzystać z akceleracji GPU, podczas gdy pomiar Androida odzwierciedla wydajność ścieżki CPU udostępnionej przez aktualnego klienta.
Wyniki Androida nadal są przydatne do analizy lokalnego wnioskowania na CPU oraz doświadczenia zapewnianego przez tę konkretną implementację. Nie powinny jednak służyć do ogłaszania, że układ AI jednego telefonu jest ogólnie szybszy od układu innego, dopóki równoważne backendy GPU lub NPU nie zostaną przetestowane przy tym samym obciążeniu.
Pipette pojawia się w momencie, gdy producenci układów promują coraz szybsze lokalne i agentowe przetwarzanie AI. Platforma Qualcomm Snapdragon 8 Elite Gen 5 wykorzystuje procesor Oryon trzeciej generacji o taktowaniu do 4,74 GHz; Qualcomm deklaruje przy tym 20-procentowy wzrost wydajności CPU oraz 35-procentową poprawę jego efektywności energetycznej. 24
Qualcomm zapowiedział także kolejną flagową platformę Snapdragon z procesorem Oryon osiągającym docelowo 5 GHz oraz architekturą FlexCache, która pozwala heterogenicznym rdzeniom korzystać ze wspólnej, dynamicznie przydzielanej puli pamięci podręcznej. 23
Specyfikacje te pokazują, dlaczego lokalna AI staje się polem rywalizacji producentów układów, ale samo taktowanie nie przewiduje wydajności modeli językowych. Równie ważne mogą być kwantyzacja, przepustowość pamięci, zachowanie cache’u, implementacja runtime’u, wykorzystanie GPU lub NPU, temperatura oraz długotrwały limit mocy.
Właśnie dlatego podejście Pipette oparte na pełnej konfiguracji może być użyteczne. Jego najważniejszą rolą w dłuższej perspektywie będzie pokazanie, czy deklarowana poprawa układu przekłada się na szybszą, bardziej responsywną i oszczędniejszą pamięciowo lokalną AI przy powtarzalnym obciążeniu. Na obecnym etapie Pipette najlepiej traktować jako przejrzysty benchmark wdrożeń, a nie ostateczny ranking sprzętu iPhone’a oraz Androida.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu.
Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu. Benchmark obsługuje klientów iOS i Android, lokalne uruchamianie modeli, różne formaty kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida.
W początkowym teście z limitem kontekstu 16 tys. tokenów Nanbeige4.2 3B i LFM2.5 2.6B uzyskały wspólnie najwyższą średnią ocenę: 63.
Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu. Benchmark obsługuje klientów iOS i Android, lokalne uruchamianie modeli, różne formaty kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida.
Opublikowane przezEdytowane za pomocą GPT-5.6 LunaObrazy wygenerowane za pomocą GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette to otwarty zestaw benchmarków firmy Liquid AI, który sprawdza, jak modele sztucznej inteligencji działają tam, gdzie faktycznie mają być używane: na smartfonach, laptopach, komputerach PC i innym sprzęcie brzegowym. Narzędzie uruchomiono 24 sierpnia we współpracy z Artificial Analysis. Jego wyróżnikiem jest traktowanie całego wdrożenia — a nie samego modelu — jako podstawowej jednostki pomiaru. Wynik zależy więc łącznie od modelu, kwantyzacji, środowiska uruchomieniowego, urządzenia i rodzaju obciążenia. 3
1
Wiele rankingów AI skupia się na jakości odpowiedzi albo podaje jedną liczbę opisującą szybkość wnioskowania. Pipette ma pokazać, jak zachowuje się cały stos technologiczny w rzeczywistym wdrożeniu. Zmiana kwantyzacji, środowiska uruchomieniowego, backendu, dostępnej pamięci lub sprzętu może zmienić rezultat, nawet jeśli wagi modelu pozostają takie same.
Wraz z premierą opublikowano zbiór zweryfikowanych laboratoryjnie wyników obejmujący ponad 1000 konfiguracji modelu, kwantyzacji, runtime’u, urządzenia i kontekstu. Początkowa wersja obejmuje ponad 30 modeli, wiele formatów kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida. Ustandaryzowane pomiary wykonano dla długości kontekstu od 256 do 8192 tokenów. 3
Pomiary wnioskowania z Pipette połączono z oceną inteligencji modeli mobilnych przygotowaną przez Artificial Analysis. Współpraca pozwala więc analizować jednocześnie jakość działania modelu oraz szybkość i efektywność konkretnego wdrożenia. 33
Pipette udostępnia natywne aplikacje na iOS i Androida, dzięki którym modele można uruchamiać lokalnie na smartfonie. Szerszy zakres benchmarku obejmuje także macOS i Windows za pośrednictwem obsługiwanych wersji środowiska uruchomieniowego. W materiałach premierowych jako urządzenia referencyjne wskazano między innymi iPhone’a 17 Pro, Galaxy S26 Ultra oraz MacBooka Pro z układem M5 Max. 3
38
Przed rozpoczęciem testu model trzeba pobrać na urządzenie. Pipette mierzy zatem lokalne wnioskowanie, a nie opóźnienie odpowiedzi z chmurowego API. 41
50
W rankingu znalazły się modele z rodziny Liquid AI LFM2.5 oraz konstrukcje innych firm. Wśród wymienianych przykładów są Gemma, Nanbeige, Granite, Qwen i inne małe lub skompresowane warianty modeli. 9
41
Benchmark obsługuje wiele formatów kwantyzacji. Mobilne porównanie inteligencji koncentrowało się na modelach, które po kwantyzacji do 4 bitów mieściły się w 8 GB, dzięki czemu test jest istotny także dla smartfonów z ograniczoną pamięcią. 3
41
W przypadku lokalnych wdrożeń dokumentacja Liquid AI rozróżnia format GGUF, często używany z llama.cpp na celach CPU i GPU, oraz format MLX przeznaczony dla wdrożeń na układach Apple Silicon. 47 Sam rozmiar skwantyzowanego pliku to jednak tylko część obrazu — o tym, jak model jest faktycznie przetwarzany, decydują również runtime i backend sprzętowy.
Zbiór danych z premiery zawiera ustandaryzowane konfiguracje wnioskowania dla kontekstu od 256 do 8192 tokenów. 3 Oddzielny test inteligencji modeli mobilnych Artificial Analysis używa limitu 16 tys. tokenów.
33
Nie należy mylić tych wartości z maksymalnym deklarowanym oknem kontekstu modelu. Dokumentacja Liquid AI podaje dla wielu modeli LFM kontekst 32 tys. tokenów, a dla LFM2.5-8B-A1B — 128 tys. Jednak możliwość modelu nie oznacza, że każdy test na smartfonie wykorzystuje pełną długość. 47
Pipette łączy kilka wymiarów wydajności urządzenia, zamiast sprowadzać wynik do szybkości generowania tokenów. Pięć głównych metryk obejmuje przetwarzanie promptu lub fazę prefill, przepustowość generowania lub dekodowania, czas do pierwszego tokenu, czas otrzymania kompletnej odpowiedzi oraz zużycie pamięci. 1
3
14
To ważne, ponieważ wdrożenie może generować tokeny szybko, a jednocześnie długo rozpoczynać odpowiedź, zużywać zbyt dużo pamięci albo zwalniać wraz ze wzrostem kontekstu. Całkowity czas odpowiedzi lepiej opisuje doświadczenie osoby korzystającej z lokalnego asystenta.
Artificial Analysis dostarcza natomiast części jakościowej mobilnego porównania. Wykorzystuje testy obejmujące między innymi wykonywanie instrukcji, użycie narzędzi i rozumowanie. 33
Każdy wynik jest przypisany do dokładnie opisanej konfiguracji, a wraz z danymi publikowane są protokoły użyte do przeprowadzenia zweryfikowanych testów. Publiczny panel rozdziela ranking od szczegółowych rezultatów i zgłoszeń, dzięki czemu można sprawdzić źródłowe wiersze benchmarku, zamiast polegać wyłącznie na głównej tabeli wyników. 1
Metodologia uwzględnia również zależności programowe. Liquid AI podaje na przykład, że obecne publiczne wyniki wydajności wymagają określonych kompilacji llama.cpp, w tym b10216 i b10516. 2 Ustalenie konkretnej wersji runtime’u pomaga uniknąć sytuacji, w której zmiana oprogramowania zostanie błędnie uznana za poprawę modelu lub sprzętu.
Takie zabezpieczenia zwiększają porównywalność, ale nie eliminują wszystkich źródeł różnic. Na rezultat telefonu mogą wpływać throttling termiczny, stan systemu operacyjnego, dostępna pamięć, firmware, wybór backendu oraz limity długotrwałego poboru energii. Wynik ma największy sens wtedy, gdy te zmienne są takie same.
Wyniki z premiery dobrze pokazują, dlaczego Pipette raportuje pełne konfiguracje, a nie tworzy jednego, uniwersalnego rankingu modeli.
Najważniejszy wniosek jest prosty: jakość, szybkość, opóźnienie i zużycie pamięci mogą prowadzić do różnych zwycięzców. Najszybszy model nie musi być najbardziej kompetentny, a model z najwyższą oceną jakości nie musi oferować najlepszego doświadczenia na telefonie.
Najistotniejszym ograniczeniem pierwszej mobilnej wersji Pipette jest różnica między obiema aplikacjami. Wersja iOS może korzystać z obliczeń GPU w ekosystemie Apple Metal, w tym z MLX. Początkowa wersja na Androida była ograniczona do wnioskowania na CPU. 41
50
Dlatego wynik iPhone’a uzyskany z MLX/Metal oraz wynik telefonu z Androidem obliczony wyłącznie na CPU nie są bezpośrednim porównaniem całego sprzętu AI obu urządzeń. Pomiar iOS może korzystać z akceleracji GPU, podczas gdy pomiar Androida odzwierciedla wydajność ścieżki CPU udostępnionej przez aktualnego klienta.
Wyniki Androida nadal są przydatne do analizy lokalnego wnioskowania na CPU oraz doświadczenia zapewnianego przez tę konkretną implementację. Nie powinny jednak służyć do ogłaszania, że układ AI jednego telefonu jest ogólnie szybszy od układu innego, dopóki równoważne backendy GPU lub NPU nie zostaną przetestowane przy tym samym obciążeniu.
Pipette pojawia się w momencie, gdy producenci układów promują coraz szybsze lokalne i agentowe przetwarzanie AI. Platforma Qualcomm Snapdragon 8 Elite Gen 5 wykorzystuje procesor Oryon trzeciej generacji o taktowaniu do 4,74 GHz; Qualcomm deklaruje przy tym 20-procentowy wzrost wydajności CPU oraz 35-procentową poprawę jego efektywności energetycznej. 24
Qualcomm zapowiedział także kolejną flagową platformę Snapdragon z procesorem Oryon osiągającym docelowo 5 GHz oraz architekturą FlexCache, która pozwala heterogenicznym rdzeniom korzystać ze wspólnej, dynamicznie przydzielanej puli pamięci podręcznej. 23
Specyfikacje te pokazują, dlaczego lokalna AI staje się polem rywalizacji producentów układów, ale samo taktowanie nie przewiduje wydajności modeli językowych. Równie ważne mogą być kwantyzacja, przepustowość pamięci, zachowanie cache’u, implementacja runtime’u, wykorzystanie GPU lub NPU, temperatura oraz długotrwały limit mocy.
Właśnie dlatego podejście Pipette oparte na pełnej konfiguracji może być użyteczne. Jego najważniejszą rolą w dłuższej perspektywie będzie pokazanie, czy deklarowana poprawa układu przekłada się na szybszą, bardziej responsywną i oszczędniejszą pamięciowo lokalną AI przy powtarzalnym obciążeniu. Na obecnym etapie Pipette najlepiej traktować jako przejrzysty benchmark wdrożeń, a nie ostateczny ranking sprzętu iPhone’a oraz Androida.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu.
Uruchomiony 24 sierpnia Pipette mierzy kompletne wdrożenia AI na urządzeniu, a nie same wagi modelu. Benchmark obsługuje klientów iOS i Android, lokalne uruchamianie modeli, różne formaty kwantyzacji oraz kompilacje llama.cpp dla macOS, iOS, Windows i Androida.
W początkowym teście z limitem kontekstu 16 tys. tokenów Nanbeige4.2 3B i LFM2.5 2.6B uzyskały wspólnie najwyższą średnią ocenę: 63.