Pipette, vydaná 24. srpna, hodnotí celé nasazení AI v zařízení — tedy model, kvantizaci, runtime, hardware a pracovní zátěž, nikoli pouze samotné váhy modelu.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette je open-source benchmarkovací sada společnosti Liquid AI pro hodnocení modelů v prostředí, kde se skutečně používají: v telefonech, noteboocích, počítačích a dalším edge hardwaru. Liquid AI ji 24. srpna uvedla ve spolupráci s Artificial Analysis. Základní jednotkou měření přitom není samotný model, ale celé nasazení — tedy kombinace modelu, kvantizace, runtime, zařízení a pracovní zátěže. 31
Mnoho žebříčků umělé inteligence se soustředí na schopnosti modelu nebo zveřejňuje jediné číslo pro rychlost inference. Pipette se snaží ukázat, jak se chová kompletní technologický řetězec při reálném nasazení. Výsledek může změnit kvantizace, runtime, backend, tlak na paměť i konkrétní hardware, přestože váhy modelu zůstanou stejné.
Při uvedení byl zveřejněn dataset laboratorně ověřených výsledků, který pokrývá více než 1 000 kombinací modelů, kvantizací, runtime, zařízení a kontextů. První verze zahrnuje více než 30 modelů, několik kvantizačních formátů a buildy llama.cpp pro macOS, iOS, Windows a Android. Standardizovaná měření pracují s délkami kontextu od 256 do 8 192 tokenů. 3
Měření inference v Pipette doplňuje hodnocení inteligence mobilních modelů od Artificial Analysis. Spolupráce tak sleduje nejen to, jak dobře model odpovídá, ale také jak rychle a úsporně běží konkrétní nasazení. 33
Pipette nabízí nativní klienty pro iOS a Android, které umožňují spouštět modely lokálně přímo ve smartphonu. Širší pokrytí benchmarku zahrnuje také macOS a Windows prostřednictvím podporovaných buildů runtime. Mezi referenční hardware uvedený v materiálech k uvedení patří iPhone 17 Pro, Galaxy S26 Ultra a MacBook Pro s čipem M5 Max. 338
Před testem je nutné model stáhnout do zařízení. Pipette proto měří lokální inferenci, nikoli odezvu cloudového API. 4150
V žebříčku jsou modely Liquid AI z rodiny LFM2.5 i modely třetích stran. Mezi uvedené příklady patří Gemma, Nanbeige, Granite, Qwen a další malé nebo komprimované varianty. 941
Benchmark podporuje více kvantizačních formátů. Srovnání mobilní inteligence se zaměřilo na modely, které se po kvantizaci na 4 bity vejdou do 8 GB. Výsledky jsou tak relevantní především pro telefony s omezenou kapacitou paměti. 341
Dokumentace Liquid AI rozlišuje formát GGUF, běžně používaný s llama.cpp na CPU i GPU, a formát MLX určený pro nasazení na Apple Silicon. 47 Velikost kvantizovaného souboru je však jen část příběhu: o skutečném zpracování rozhoduje také runtime a hardwarový backend.
Úvodní dataset uvádí standardizované konfigurace inference s kontextem od 256 do 8 192 tokenů. 3 Samostatné hodnocení mobilní inteligence od Artificial Analysis používá limit 16K tokenů. 33
Tyto hodnoty nelze zaměňovat za maximální kontextové okno modelu. Dokumentace Liquid AI uvádí u mnoha modelů LFM kontext 32K tokenů a u modelu LFM2.5-8B-A1B 128K tokenů. Schopnost modelu pracovat s tak dlouhým kontextem ale neznamená, že benchmark na každém telefonu používá celou tuto délku. 47
Pipette kombinuje několik rozměrů výkonu namísto jediného údaje o rychlosti generování. Jejích pět metrik pokrývá zpracování promptu neboli prefill, propustnost při generování neboli decode, čas do prvního tokenu, dobu do dokončení celé odpovědi a využití paměti. 1314
To je důležité, protože nasazení může generovat tokeny vysokou rychlostí, ale zároveň dlouho čekat před prvním tokenem, spotřebovávat příliš mnoho paměti nebo se zpomalovat s rostoucí délkou kontextu. Pro skutečný uživatelský dojem z lokálního asistenta je obzvlášť užitečná celková doba odpovědi.
Artificial Analysis dodává kvalitativní část mobilního srovnání prostřednictvím testů zaměřených mimo jiné na následování instrukcí, používání nástrojů a uvažování. 33
Každý výsledek je svázán s přesně popsanou konfigurací a Liquid AI zveřejňuje protokoly použité při ověřených měřeních. Veřejný dashboard odděluje žebříček od podrobných výsledků a odevzdaných měření. Uživatelé tak mohou kontrolovat konkrétní řádky benchmarku, místo aby se spoléhali pouze na pořadí v žebříčku. 1
Metodika zaznamenává také závislosti na runtime. Liquid AI například uvádí, že současné veřejné výsledky vyžadují konkrétní buildy llama.cpp, včetně buildů b10216 a b10516. 2 Připnutí verze runtime pomáhá zabránit tomu, aby se změna softwaru vydávala za zlepšení modelu nebo hardwaru.
Ani tato opatření však neodstraňují všechny zdroje odchylek. Výsledek telefonu může ovlivnit teplota a throttling, stav operačního systému, dostupná paměť, firmware, zvolený backend i dlouhodobý limit spotřeby. Skóre je nejlépe porovnatelné tehdy, když se tyto podmínky shodují.
Úvodní výsledky vysvětlují, proč Pipette zveřejňuje celé konfigurace namísto univerzálního pořadí modelů.
Hlavní závěr je jednoduchý: kvalita, rychlost, latence a spotřeba paměti nemusí ukazovat stejným směrem. Nejrychlejší model nemusí být nejvýkonnější a model s nejvyšším skóre schopností nemusí být nejlepší volbou pro telefon.
Největším omezením první mobilní verze je rozdíl mezi oběma klienty. Verze pro iOS dokáže využít výpočty na GPU prostřednictvím ekosystému Apple Metal, včetně frameworku MLX. Androidová verze byla zpočátku omezena na inferenci přes CPU. 4150
Výsledek iPhonu s MLX/Metal a výsledek Androidu založený pouze na CPU proto nepředstavují čisté srovnání celého AI hardwaru obou telefonů. Měření iOS může těžit z akcelerace GPU, zatímco Android odráží výkon CPU cesty dostupné v aktuálním klientovi.
Androidová čísla jsou stále užitečná pro pochopení lokální inference na CPU a uživatelského dojmu, který tato implementace nabízí. Nelze z nich ale vyvozovat, že jeden telefon má obecně rychlejší AI čip než jiný. K takovému závěru by bylo potřeba otestovat srovnatelné GPU nebo NPU backendy při stejné pracovní zátěži.
Pipette přichází v době, kdy výrobci čipů propagují rychlejší lokální a agentní AI. Platforma Qualcomm Snapdragon 8 Elite Gen 5 využívá procesor třetí generace Oryon s taktem až 4,74 GHz a podle Qualcommu přináší o 20 % vyšší výkon CPU a o 35 % lepší energetickou účinnost CPU. 24
Qualcomm už také představil některé informace o následující vlajkové platformě Snapdragon. Její procesor Oryon má mířit na frekvenci 5 GHz a architektura FlexCache umožní heterogenním jádrům sdílet dynamicky přidělovaný fond cache. 23
Tyto specifikace ukazují, proč se lokální AI stává součástí hardwarového závodu. Samotná taktovací frekvence ale výkon jazykového modelu nepředpoví. Stejně důležité mohou být kvantizace, propustnost paměti, chování cache, implementace runtime, využití GPU nebo NPU, teplota a dlouhodobý limit spotřeby.
Právě zde je přístup Pipette založený na konkrétních konfiguracích užitečný. Její dlouhodobý přínos bude spočívat v tom, že ukáže, zda se deklarované zlepšení čipu skutečně promítne do rychlejší, pohotovější a paměťově úspornější lokální AI při reprodukovatelné zátěži. V současnosti je proto nejlepší chápat Pipette jako transparentní benchmark nasazení, nikoli jako definitivní žebříček hardwaru iPhone versus Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, vydaná 24. srpna, hodnotí celé nasazení AI v zařízení — tedy model, kvantizaci, runtime, hardware a pracovní zátěž, nikoli pouze samotné váhy modelu.
Pipette, vydaná 24. srpna, hodnotí celé nasazení AI v zařízení — tedy model, kvantizaci, runtime, hardware a pracovní zátěž, nikoli pouze samotné váhy modelu. Benchmark nabízí klienty pro iOS a Android, lokální spouštění modelů, několik kvantizačních formátů a buildy llama.cpp pro macOS, iOS, Windows a Android.
Úvodní dataset zahrnuje více než 1 000 laboratorně ověřených konfigurací, přes 30 modelů a kontexty od 256 do 8 192 tokenů.