Pipette — безкоштовний набір відкритих інструментів для вимірювання продуктивності повного локального ШІ розгортання, а не окремої моделі. Платформу випустили 24 серпня у партнерстві з Artificial Analysis: Liquid AI відповідає за інференс тести, а Artificial Analysis — за оцінювання інтелектуальних можливостей мобіл...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette — це безкоштовний набір відкритих інструментів Liquid AI для тестування штучного інтелекту безпосередньо на смартфонах, ноутбуках та інших периферійних пристроях. Платформу випустили 24 серпня у партнерстві з Artificial Analysis. Вона вимірює не абстрактну «швидкість моделі», а конкретне поєднання моделі, рівня квантизації, програмного рушія, пристрою та робочого навантаження. 119
Такий підхід важливий для локального ШІ: одна й та сама модель може поводитися зовсім по-різному залежно від формату файлу, версії рушія, доступної пам’яті, температури пристрою та того, чи використовуються CPU, GPU або NPU.
Публічний реліз містить набір даних із понад 1 000 лабораторно перевірених конфігурацій і п’ятьма метриками продуктивності на пристрої. Початкова таблиця результатів охоплює понад 30 моделей, сім варіантів квантизації та чотири пристрої. 114
Серед вимірювань —:
Отже, високий показник токенів за секунду сам по собі не робить конфігурацію найкращою. Модель може швидко генерувати текст, але довго готувати відповідь, споживати забагато пам’яті або мати гірші результати в тестах якості.
Pipette має клієнти для iOS та Android і запускає завантажені на пристрій моделі локально, а не через віддалений сервер. 108 У початковому наборі є моделі сімейства Liquid Foundation Models (LFM), а також сторонні компактні моделі, зокрема Gemma та Nanbeige. 8
У відкритих результатах використовуються збірки llama.cpp для macOS, iOS, Windows та Android. Платформа також розрізняє програмні рушії: на iOS доступний варіант із MLX, який використовує графічні можливості Apple через Metal. 1110
Щодо форматів і рівнів квантизації, бенчмарк порівнює сім різних варіантів. Один із прикладів — 4-бітна версія Gemma 4 E2B у форматі, що запускається через Apple MLX. У документації Liquid AI також зазначено GGUF як формат для локального CPU/GPU-інференсу на різних платформах, а MLX — як варіант, оптимізований для Apple Silicon. 42
Публічний набір інференс-результатів охоплює контексти від 256 до 8 192 токенів. 11 Водночас окреме оцінювання інтелектуальних можливостей мобільних моделей від Artificial Analysis використовує ліміт контексту 16K токенів. 98
Ці числа не варто змішувати. 16K — це стандартизоване обмеження конкретного мобільного тесту, тоді як 256–8 192 токенів — діапазон контекстів у початковому наборі інференс-вимірювань. Заявлені можливості самих моделей можуть бути більшими: для багатьох LFM вказано контекст 32K, а для LFM2.5-8B-A1B — 128K. Це характеристики моделей, а не обов’язково параметри першого спільного навантаження Pipette. 2
Для мобільного оцінювання Artificial Analysis розглядав моделі, які після 4-бітної квантизації вміщуються в 8 ГБ пам’яті. 8
Головний внесок Pipette — не лише в таблиці результатів, а й у методології. Кожен показник прив’язаний до повної конфігурації, отриманий у перевіреному лабораторному середовищі та супроводжується опублікованим протоколом відтворення. 411
Liquid AI також фіксує програмні залежності. Наприклад, поточні публічні результати потребують конкретних збірок llama.cpp, зокрема b10216 і b10516. Це зменшує ризик, що зміна версії рушія непомітно вплине на результат. 6
Такий підхід набагато корисніший за ізольовану цифру «токенів за секунду» від виробника. Проте він не скасовує впливу температури, стану операційної системи, конкретної версії пристрою, обсягу оперативної пам’яті та обраного бекенду. Щоб порівняння було коректним, ці параметри мають збігатися.
Показник 48,37 токена/с для 4-бітної Gemma 4 E2B на iPhone 17 Pro через Apple MLX є сильним результатом для конкретної конфігурації. Його коректно читати так: «Gemma 4 E2B + 4 біти + MLX/Metal + iPhone 17 Pro», а не як універсальну оцінку Gemma або всіх смартфонів. 45
У тесті інтелектуальних можливостей із лімітом контексту 16K найвищий середній бал — 63 — спільно отримали Nanbeige4.2-3B і LFM2.5-2.6B. 98
За даними Artificial Analysis, LFM2.5-2.6B на iPhone 17 Pro відповідала на стандартний запит обсягом 1 024 токени за 8,0 секунди, використовуючи 2,3 ГБ пам’яті. 9
На iOS Pipette може використовувати GPU через Metal/MLX. Початкова версія клієнта для Android, за наявними даними, виконує обчислення лише на CPU. 10
Тому нинішні показники швидкості iPhone та Android не є чистим порівнянням апаратної платформи з апаратною платформою. Результат Apple може включати прискорення GPU, тоді як результат Android відображає роботу інференсу на CPU. Android-тести корисні для оцінювання CPU та практичного користувацького досвіду в межах цього бекенду, але вони не доводять, що загальна апаратна система локального ШІ одного смартфона принципово швидша за іншу. 104
Для справедливого міжплатформного порівняння потрібні Android-бекенди з підтримкою NPU або еквівалентного GPU-прискорення.
Реліз Pipette з’явився на тлі боротьби виробників чипів за швидші локальні та агентні ШІ-навантаження. Qualcomm заявляє, що процесор Oryon третього покоління у Snapdragon 8 Elite Gen 5 досягає частоти 4,74 ГГц, а сама платформа забезпечує приріст CPU-продуктивності на 20% і енергоефективності CPU на 35%. 14
Окремо Qualcomm анонсувала наступну флагманську платформу Snapdragon із Oryon, орієнтованим на частоту 5 ГГц, і архітектурою FlexCache, яка динамічно розподіляє кеш між ядрами. Це свідчить про прагнення зробити локальні застосунки швидшими та чутливішими, але сама тактова частота не прогнозує продуктивність LLM. На неї також впливають рушій, пропускна здатність пам’яті, робота кешу, квантизація, GPU/NPU-бекенд, нагрівання та тривалі обмеження потужності. 913
Pipette варто сприймати як прозорий бенчмарк повного локального розгортання, а не як остаточний рейтинг смартфонів або процесорів. Його сильна сторона — можливість побачити, як модель поводиться в реальній зв’язці з конкретним форматом, рушієм і пристроєм.
Якщо Liquid AI розширить підтримку пристроїв і додасть NPU-прискорення, платформа стане ще кориснішою: вона зможе відокремити переваги CPU від внеску GPU та NPU у спільних робочих навантаженнях. Поки цього не сталося, результати Pipette слід порівнювати лише всередині однакових або дуже близьких конфігурацій. 64
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette — безкоштовний набір відкритих інструментів для вимірювання продуктивності повного локального ШІ розгортання, а не окремої моделі.
Pipette — безкоштовний набір відкритих інструментів для вимірювання продуктивності повного локального ШІ розгортання, а не окремої моделі. Платформу випустили 24 серпня у партнерстві з Artificial Analysis: Liquid AI відповідає за інференс тести, а Artificial Analysis — за оцінювання інтелектуальних можливостей мобільних моделей.
Публічний набір даних містить понад 1 000 лабораторно перевірених конфігурацій, п’ять метрик продуктивності, понад 30 моделей, сім варіантів квантизації та чотири початкові пристрої.