Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження. Бенчмарк підтримує iOS та Android, локальний запуск моделей, кілька форматів квантизації й збірки llama.cpp для macOS, iOS, Windows та Android.
ОпублікувавВідредаговано за допомогою GPT-5.6 LunaЗображення створено за допомогою GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI Pipette — це відкритий набір інструментів для перевірки моделей штучного інтелекту там, де вони фактично працюють: на смартфонах, ноутбуках, ПК та іншому edge-обладнанні. Проєкт представили 24 серпня у партнерстві з Artificial Analysis. Його головна особливість — одиницею вимірювання є не сама модель, а повне розгортання: модель, рівень квантизації, програмний рушій, пристрій і робоче навантаження разом. 3
1
Багато рейтингів ШІ зосереджуються на балах за інтелектуальність або на одному показнику швидкості інференсу. Pipette натомість показує, як поводиться весь стек у конкретному сценарії запуску.
Навіть якщо ваги моделі не змінюються, результат може помітно відрізнятися через інший рівень квантизації, рушій, бекенд, доступний обсяг пам’яті чи апаратну платформу.
До запуску увійшов відкритий набір лабораторно перевірених даних із понад 1 000 конфігурацій «модель × квантизація × рушій × пристрій × контекст». Початкова версія охоплює понад 30 моделей, кілька форматів квантизації та збірки llama.cpp для macOS, iOS, Windows і Android. Стандартизовані тести проводяться з довжиною контексту від 256 до 8 192 токенів. 3
Вимірювання швидкодії Pipette доповнює оцінка інтелектуальності мобільних моделей від Artificial Analysis. У результаті партнерство враховує і якість відповідей, і те, наскільки швидко та економно конкретне розгортання працює на пристрої. 33
Pipette має нативні клієнти для iOS та Android, які дають змогу запускати моделі безпосередньо на смартфоні. Ширше покриття бенчмарку також включає macOS і Windows через сумісні версії рушія. Серед референсних пристроїв, названих у матеріалах запуску, — iPhone 17 Pro, Galaxy S26 Ultra та MacBook Pro із чипом M5 Max. 3
38
Перед тестуванням модель потрібно завантажити на пристрій. Отже, Pipette вимірює локальний інференс, а не затримку під час звернення до хмарного API. 41
50
У таблиці лідерів є моделі Liquid AI з родини LFM2.5, а також сторонні рішення. Серед прикладів — Gemma, Nanbeige, Granite, Qwen та інші компактні або стиснені варіанти моделей. 9
41
Бенчмарк підтримує кілька форматів квантизації. Для порівняння інтелектуальності на смартфонах відібрали моделі, які після 4-бітної квантизації вкладаються в 8 ГБ. Це робить тест релевантним для телефонів з обмеженою оперативною пам’яттю. 3
41
У документації Liquid AI розрізняє GGUF — формат, який часто використовують із llama.cpp на CPU та GPU, — і MLX, орієнтований на запуск на Apple Silicon. 47 Розмір квантованого файла — лише частина картини: те, як модель працює на практиці, визначають також рушій і апаратний бекенд.
У стартовому наборі даних стандартизовані конфігурації охоплюють контекст від 256 до 8 192 токенів. 3 Окреме оцінювання інтелектуальності мобільних моделей від Artificial Analysis використовує обмеження в 16K токенів.
33
Ці значення не слід плутати з максимальною заявленою довжиною контексту моделі. Документація Liquid вказує 32K токенів для багатьох моделей LFM і 128K для LFM2.5-8B-A1B. Однак здатність моделі підтримувати такий контекст не означає, що кожен тест на смартфоні запускається на максимальній довжині. 47
Pipette не зводить оцінку лише до швидкості генерації. Його п’ять основних показників охоплюють обробку запиту або prefill, швидкість генерації чи decode, час до появи першого токена, повний час формування відповіді та використання пам’яті. 1
3
14
Це важливо, адже модель може швидко генерувати токени, але довго готуватися до відповіді, споживати забагато пам’яті або втрачати швидкість зі зростанням контексту. Повний час відповіді особливо добре відображає досвід користувача локального асистента.
Artificial Analysis відповідає за оцінку якісної складової мобільного порівняння. До тестів входять, зокрема, дотримання інструкцій, використання інструментів, міркування та інші перевірки можливостей моделей. 33
Кожен результат прив’язаний до чітко описаної конфігурації, а протоколи перевірених вимірювань опубліковані відкрито. На публічній панелі окремо доступні таблиця лідерів, детальні результати й подані вимірювання. Це дає змогу перевірити конкретні рядки даних, а не покладатися лише на загальний рейтинг. 1
Методологія також фіксує програмні залежності. Наприклад, для актуальних публічних результатів продуктивності потрібні визначені збірки llama.cpp, зокрема b10216 і b10516. 2 Фіксація версії рушія допомагає не сплутати зміни в програмному забезпеченні з покращенням моделі чи апаратної платформи.
Ці заходи роблять результати більш зіставними, але не усувають усіх джерел похибки. На показники смартфона можуть впливати тротлінг через нагрівання, стан операційної системи, обсяг пам’яті, прошивка, вибір бекенду та обмеження тривалої потужності. Результат має сенс порівнювати лише тоді, коли ці умови збігаються.
Перші дані добре демонструють, чому Pipette публікує результати для повних конфігурацій, а не універсальний рейтинг моделей.
Головний висновок простий: якість, швидкість, затримка та споживання пам’яті можуть вести в різні боки. Найшвидша модель не обов’язково найкраща за можливостями, а модель із найвищим балом інтелектуальності не обов’язково дає найкращий досвід на смартфоні.
Найважливіше обмеження першого мобільного релізу — різні можливості клієнтів. Версія для iOS може використовувати GPU через екосистему Apple Metal, зокрема за допомогою MLX. Початкова версія для Android була обмежена обчисленнями на CPU. 41
50
Тому результат iPhone із MLX/Metal і результат Android-смартфона з CPU-only інференсом не є чесним порівнянням усієї AI-апаратної частини телефонів. Вимірювання на iOS може отримувати перевагу від GPU-прискорення, тоді як Android-результат відображає можливості CPU-шляху, реалізованого поточним клієнтом.
Android-показники залишаються корисними для оцінювання локального інференсу на CPU та досвіду, який забезпечує така реалізація. Проте на їхній основі не варто оголошувати, що апаратна платформа одного смартфона загалом швидша за іншу, доки еквівалентні GPU- або NPU-бекенди не протестують на однаковому навантаженні.
Pipette з’явився на тлі змагання виробників чипів за швидший локальний та агентний ШІ. Платформа Qualcomm Snapdragon 8 Elite Gen 5 використовує процесор третього покоління Oryon із частотою до 4,74 ГГц; Qualcomm заявляє про 20% приросту продуктивності CPU та 35% покращення його енергоефективності. 24
Компанія також анонсувала наступну флагманську платформу Snapdragon із процесором Oryon, розрахованим на частоту до 5 ГГц, і архітектурою FlexCache. Вона дає змогу різнорідним ядрам спільно використовувати динамічно розподілений кеш. 23
Ці характеристики показують, чому локальний ШІ перетворюється на окремий фронт апаратної конкуренції. Але сама тактова частота не передбачає продуктивність мовної моделі. Не менш важливими можуть бути пропускна здатність пам’яті, поведінка кешу, реалізація рушія, квантизація, використання GPU або NPU, температура та тривалі обмеження потужності.
Саме тут підхід Pipette із фіксацією повної конфігурації може виявитися найкориснішим. У довгостроковій перспективі він має показати, чи перетворюється заявлене покращення чипа на швидший, чутливіший і економніший локальний ШІ за відтворюваного навантаження.
Поки що Pipette найкраще сприймати як прозорий бенчмарк розгортання, а не як остаточний рейтинг апаратного забезпечення iPhone проти Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження.
Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження. Бенчмарк підтримує iOS та Android, локальний запуск моделей, кілька форматів квантизації й збірки llama.cpp для macOS, iOS, Windows та Android.
У першій оцінці інтелектуальності для мобільних пристроїв Nanbeige4.2 3B і LFM2.5 2.6B розділили перше місце із середнім результатом 63 за ліміту контексту 16K.
Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження. Бенчмарк підтримує iOS та Android, локальний запуск моделей, кілька форматів квантизації й збірки llama.cpp для macOS, iOS, Windows та Android.
ОпублікувавВідредаговано за допомогою GPT-5.6 LunaЗображення створено за допомогою GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI Pipette — це відкритий набір інструментів для перевірки моделей штучного інтелекту там, де вони фактично працюють: на смартфонах, ноутбуках, ПК та іншому edge-обладнанні. Проєкт представили 24 серпня у партнерстві з Artificial Analysis. Його головна особливість — одиницею вимірювання є не сама модель, а повне розгортання: модель, рівень квантизації, програмний рушій, пристрій і робоче навантаження разом. 3
1
Багато рейтингів ШІ зосереджуються на балах за інтелектуальність або на одному показнику швидкості інференсу. Pipette натомість показує, як поводиться весь стек у конкретному сценарії запуску.
Навіть якщо ваги моделі не змінюються, результат може помітно відрізнятися через інший рівень квантизації, рушій, бекенд, доступний обсяг пам’яті чи апаратну платформу.
До запуску увійшов відкритий набір лабораторно перевірених даних із понад 1 000 конфігурацій «модель × квантизація × рушій × пристрій × контекст». Початкова версія охоплює понад 30 моделей, кілька форматів квантизації та збірки llama.cpp для macOS, iOS, Windows і Android. Стандартизовані тести проводяться з довжиною контексту від 256 до 8 192 токенів. 3
Вимірювання швидкодії Pipette доповнює оцінка інтелектуальності мобільних моделей від Artificial Analysis. У результаті партнерство враховує і якість відповідей, і те, наскільки швидко та економно конкретне розгортання працює на пристрої. 33
Pipette має нативні клієнти для iOS та Android, які дають змогу запускати моделі безпосередньо на смартфоні. Ширше покриття бенчмарку також включає macOS і Windows через сумісні версії рушія. Серед референсних пристроїв, названих у матеріалах запуску, — iPhone 17 Pro, Galaxy S26 Ultra та MacBook Pro із чипом M5 Max. 3
38
Перед тестуванням модель потрібно завантажити на пристрій. Отже, Pipette вимірює локальний інференс, а не затримку під час звернення до хмарного API. 41
50
У таблиці лідерів є моделі Liquid AI з родини LFM2.5, а також сторонні рішення. Серед прикладів — Gemma, Nanbeige, Granite, Qwen та інші компактні або стиснені варіанти моделей. 9
41
Бенчмарк підтримує кілька форматів квантизації. Для порівняння інтелектуальності на смартфонах відібрали моделі, які після 4-бітної квантизації вкладаються в 8 ГБ. Це робить тест релевантним для телефонів з обмеженою оперативною пам’яттю. 3
41
У документації Liquid AI розрізняє GGUF — формат, який часто використовують із llama.cpp на CPU та GPU, — і MLX, орієнтований на запуск на Apple Silicon. 47 Розмір квантованого файла — лише частина картини: те, як модель працює на практиці, визначають також рушій і апаратний бекенд.
У стартовому наборі даних стандартизовані конфігурації охоплюють контекст від 256 до 8 192 токенів. 3 Окреме оцінювання інтелектуальності мобільних моделей від Artificial Analysis використовує обмеження в 16K токенів.
33
Ці значення не слід плутати з максимальною заявленою довжиною контексту моделі. Документація Liquid вказує 32K токенів для багатьох моделей LFM і 128K для LFM2.5-8B-A1B. Однак здатність моделі підтримувати такий контекст не означає, що кожен тест на смартфоні запускається на максимальній довжині. 47
Pipette не зводить оцінку лише до швидкості генерації. Його п’ять основних показників охоплюють обробку запиту або prefill, швидкість генерації чи decode, час до появи першого токена, повний час формування відповіді та використання пам’яті. 1
3
14
Це важливо, адже модель може швидко генерувати токени, але довго готуватися до відповіді, споживати забагато пам’яті або втрачати швидкість зі зростанням контексту. Повний час відповіді особливо добре відображає досвід користувача локального асистента.
Artificial Analysis відповідає за оцінку якісної складової мобільного порівняння. До тестів входять, зокрема, дотримання інструкцій, використання інструментів, міркування та інші перевірки можливостей моделей. 33
Кожен результат прив’язаний до чітко описаної конфігурації, а протоколи перевірених вимірювань опубліковані відкрито. На публічній панелі окремо доступні таблиця лідерів, детальні результати й подані вимірювання. Це дає змогу перевірити конкретні рядки даних, а не покладатися лише на загальний рейтинг. 1
Методологія також фіксує програмні залежності. Наприклад, для актуальних публічних результатів продуктивності потрібні визначені збірки llama.cpp, зокрема b10216 і b10516. 2 Фіксація версії рушія допомагає не сплутати зміни в програмному забезпеченні з покращенням моделі чи апаратної платформи.
Ці заходи роблять результати більш зіставними, але не усувають усіх джерел похибки. На показники смартфона можуть впливати тротлінг через нагрівання, стан операційної системи, обсяг пам’яті, прошивка, вибір бекенду та обмеження тривалої потужності. Результат має сенс порівнювати лише тоді, коли ці умови збігаються.
Перші дані добре демонструють, чому Pipette публікує результати для повних конфігурацій, а не універсальний рейтинг моделей.
Головний висновок простий: якість, швидкість, затримка та споживання пам’яті можуть вести в різні боки. Найшвидша модель не обов’язково найкраща за можливостями, а модель із найвищим балом інтелектуальності не обов’язково дає найкращий досвід на смартфоні.
Найважливіше обмеження першого мобільного релізу — різні можливості клієнтів. Версія для iOS може використовувати GPU через екосистему Apple Metal, зокрема за допомогою MLX. Початкова версія для Android була обмежена обчисленнями на CPU. 41
50
Тому результат iPhone із MLX/Metal і результат Android-смартфона з CPU-only інференсом не є чесним порівнянням усієї AI-апаратної частини телефонів. Вимірювання на iOS може отримувати перевагу від GPU-прискорення, тоді як Android-результат відображає можливості CPU-шляху, реалізованого поточним клієнтом.
Android-показники залишаються корисними для оцінювання локального інференсу на CPU та досвіду, який забезпечує така реалізація. Проте на їхній основі не варто оголошувати, що апаратна платформа одного смартфона загалом швидша за іншу, доки еквівалентні GPU- або NPU-бекенди не протестують на однаковому навантаженні.
Pipette з’явився на тлі змагання виробників чипів за швидший локальний та агентний ШІ. Платформа Qualcomm Snapdragon 8 Elite Gen 5 використовує процесор третього покоління Oryon із частотою до 4,74 ГГц; Qualcomm заявляє про 20% приросту продуктивності CPU та 35% покращення його енергоефективності. 24
Компанія також анонсувала наступну флагманську платформу Snapdragon із процесором Oryon, розрахованим на частоту до 5 ГГц, і архітектурою FlexCache. Вона дає змогу різнорідним ядрам спільно використовувати динамічно розподілений кеш. 23
Ці характеристики показують, чому локальний ШІ перетворюється на окремий фронт апаратної конкуренції. Але сама тактова частота не передбачає продуктивність мовної моделі. Не менш важливими можуть бути пропускна здатність пам’яті, поведінка кешу, реалізація рушія, квантизація, використання GPU або NPU, температура та тривалі обмеження потужності.
Саме тут підхід Pipette із фіксацією повної конфігурації може виявитися найкориснішим. У довгостроковій перспективі він має показати, чи перетворюється заявлене покращення чипа на швидший, чутливіший і економніший локальний ШІ за відтворюваного навантаження.
Поки що Pipette найкраще сприймати як прозорий бенчмарк розгортання, а не як остаточний рейтинг апаратного забезпечення iPhone проти Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження.
Pipette, представлений 24 серпня, оцінює повну конфігурацію локального ШІ: модель, квантизацію, рушій, пристрій і робоче навантаження. Бенчмарк підтримує iOS та Android, локальний запуск моделей, кілька форматів квантизації й збірки llama.cpp для macOS, iOS, Windows та Android.
У першій оцінці інтелектуальності для мобільних пристроїв Nanbeige4.2 3B і LFM2.5 2.6B розділили перше місце із середнім результатом 63 за ліміту контексту 16K.